Все статьи

· Casimiro Ferreira· 1 мин чтения

Создание синтетических голосов с нуля

  • TTS
  • Synthetic Data
  • Voice Cloning
  • OVOS

Эта статья была первоначально опубликована в блоге OpenVoiceOS

Хорошего офлайн-голоса TTS для европейского португальского не существовало. Студийная запись стоит дорого, занимает месяцы, а для большинства языков мира такие записи попросту никогда не делались. Поэтому мы создали четыре голоса с нуля — без студии звукозаписи, без актёра озвучивания, без облака.

Трёхэтапный конвейер

1. Генерация синтетических речевых пар. Мы используем существующий голос TTS в качестве донора — любой источник, способный производить разборчивое аудио, — и прогоняем его по большому текстовому корпусу, чтобы получить тысячи пар аудио/текст. Донорскому голосу не нужно быть высокого качества. Ему достаточно быть достаточно связным, чтобы на нём можно было учиться.

2. Применение преобразования голоса. Этап преобразования голоса превращает тембр донора в новую идентичность — другой пол, возраст или характер. Полученное аудио звучит как целевой голос, а не как донор. Именно здесь рождается новая личность.

3. Обучение компактной модели VITS. Преобразованное аудио становится обучающей выборкой для небольшой модели архитектуры VITS через phoonnx_train. Готовая модель экспортируется в ONNX и работает полностью офлайн — при необходимости на Raspberry Pi.

Этические ограничения

Если донор — это голос реального человека, мы сначала получаем явное разрешение. Когда разрешение невозможно, мы используем записи из общественного достояния или генерируем полностью оригинальный голос, не копирующий ничью идентичность. Этап преобразования голоса также обладает полезным свойством для конфиденциальности: результат акустически достаточно отличается от донора, так что риск выдачи себя за другого человека ничтожен.

Применение к европейскому португальскому

У европейского португальского не было качественного открытого офлайн-голоса. Мы создали четыре голоса — включая идентичности Miro и Dii, которые теперь являются голосами OVOS по умолчанию для pt-PT, — используя именно этот конвейер. Они комфортно работают на скромном оборудовании, не требуют подключения к интернету, а обучающие данные опубликованы открыто, так что каждый может воспроизвести или расширить их.

Все модели и датасеты находятся на huggingface.co/OpenVoiceOS и huggingface.co/TigreGotico.