Все статьи

· Casimiro Ferreira· 3 мин чтения

Клонирование голосов для языков под угрозой исчезновения: создание модели синтеза речи для астурийского и арагонского

  • TTS
  • Asturian
  • Aragonese
  • Minority Languages
  • Voice Cloning

Эта статья была изначально опубликована в блоге OpenVoiceOS

Астурийский (ast) и арагонский (an) — романские языки, на которых говорят на севере Испании сообщества, практически не получающие никакого покрытия от коммерческих голосовых технологий. Носители, которым нужен голосовой ассистент, используют испанский — или обходятся без него. Мы построили модели TTS на основе VITS для обоих языков и выпускаем их как открытые веса на HuggingFace.

Ограничение: Mozilla Common Voice 23.0 для обоих языков является многоголосым и относительно небольшим. Обучить высококачественную одноголосую модель TTS напрямую на этих данных нереально. Поэтому мы использовали гибридный подход.

Пробел: отсутствие G2P

Одно обстоятельство, которое не изменится с будущим обновлением модели: ни астурийский, ни арагонский не имеют пригодного к использованию открытого фонемизатора. Эти модели обучаются напрямую на графемах. Фонемизатор открыл бы возможность ввода в формате IPA во время выполнения (принудительно задавая произношение имён, неологизмов, переключений кода) и в целом повысил бы согласованность. Если вам известны существующие лексиконы или данные о произношении для любого из этих языков или вы хотите поучаствовать в их создании, свяжитесь с нами.

Гибридный конвейер

Полная методология изложена в нашем Whitepaper по гибридному синтезу датасетов TTS. Краткая версия:

  1. Исходные данные: Common Voice 23.0 — астурийский и Common Voice 23.0 — арагонский. Многоголосые, разнообразные условия записи.

  2. Фильтрация: аудио нормализовано, тишина обрезана, выбросы по числу слов в минуту удалены. Этот шаг важен — транскрипции от торопливых или невнятных дикторов подрывают выравнивание.

  3. Zero-shot переозвучивание: модель преобразования голоса берёт отфильтрованное многоголосое аудио и короткий фрагмент донорского голоса и повторно синтезирует все высказывания донорским голосом. Результат — согласованный одноголосый датасет с единообразным голосом, размером с исходный многоголосый источник.

  4. Обучение VITS через phoonnx: VITS обучается быстро, работает без GPU при инференсе, а получаемые модели встраиваются в любой совместимый с phoonnx конвейер.

Результаты

“L’arcu la vieya ye un fenómenu ópticu y meteorolóxicu que produz l’apaición d’un espectru de lluz continu nel cielu cuando los rayos del sol trespasen pequeñes partícules de mugor conteníes n’atmósfera terrestre. La forma ye la d’un arcu multicolor col roxo hacia la parte esterior y el viola hacia la interior. El arco iris duble, ye menos avezau a vese, y tien los colores invertíos, esto ye, el roxo hacia dientro y el viola hacia l’esterior.”

Скачать: астурийский — dii (женский) и астурийский — miro (мужской)

“L’arco de sant Chuan ye un fenomeno optico y meteorolochico que produce l’aparición d’un espectro de luz contino en o cielo cuan os rayos d’o sol trescruzan chicotas particlas d’humidat situatas por l’atmosfera terrestre. A forma suya ye a d’un arco multicolor con o royo en a parti exterior y o morau en a interior. No ye tan cutiano l’arco de sant Chuan dople, que incluye un segundo arco mas tenue con as colors chiratas, ye dicir o royo en l’interior y o morau en l’exterior.”

Скачать: арагонский — dii (женский) и арагонский — miro (мужской)

Конвейер подтверждает свою состоятельность. Произношение несовершенно — обучение на графемах без фонемизатора означает, что модель аппроксимирует фонетику исключительно по закономерностям написания. То, что имеется сейчас, — это пригодная базовая версия и воспроизводимый процесс.


Скачайте модели и послушайте выше. Если у вас есть данные о произношении астурийского или арагонского, лексикон G2P или вы хотите внести вклад в виде голосовых записей под открытой лицензией, свяжитесь с нами — эти ресурсы напрямую улучшают следующую итерацию.

Поддержите проект OpenVoiceOS