Что мы выпускаем
Все 40 синтетических обучающих датасетов, использованных для создания Miro и Dii — голосовых идентичностей, которые мы разработали в партнёрстве с OpenVoiceOS. Коллекция охватывает европейский португальский, бразильский португальский, нидерландский, немецкий, французский, итальянский, японский, испанский, румынский, польский, шведский, хинди, датский, фарси, английский, баскский и другие языки. Каждый датасет следует единому соглашению об именовании: tts-train-synthetic-miro_pt-PT, tts-train-synthetic-dii_pt-BR, tts-train-synthetic-miro_nl-NL и так далее для каждой языковой пары.
Каждый датасет полностью синтетический — сгенерированный текст в паре с синтезированным аудио в раскладке LJSpeech, без студийных сессий — и выпущен под открытой лицензией, так что каждый может переобучить или расширить голос. Фонемизация происходит во время обучения в phoonnx, опираясь на наши исследования G2P для 350+ языков.
Как голосовая идентичность остаётся согласованной между языками
Мы не обучаем один многоязычный монолит в надежде, что акцент разберётся сам собой. Каждый язык получает одноязычную модель, обученную звучать как носитель этого языка. Общая идентичность между моделями достигается за счёт клонирования голоса: каждая модель Miro и каждая модель Dii клонируется из одного и того же исходного голоса перед адаптацией к новому языку. Тембр, характер, узнаваемое качество голоса — это переносится. Акцент — намеренно нет.
Практический итог: говорящий на португальском, говорящий на нидерландском, говорящий на японском — все безошибочно один и тот же человек, и каждый звучит как носитель.
Зачем публиковать обучающие данные
Контрольная точка без обучающих данных — это чёрный ящик. Публикация делает голос проверяемым (вы видите в точности, на чём он обучался), воспроизводимым (запустите phoonnx_train на тех же данных и получите тот же результат) и расширяемым (добавьте предложения, дообучите под диалект, постройте нового диктора поверх).
Это важнее всего для малоресурсных языков из этого списка. Когда обучающие данные открыты, сообщество носителей языка может улучшить свой собственный голос — не дожидаясь, пока какой-либо поставщик решит, что это коммерчески интересно.
Где всё найти
Все датасеты и обученные модели находятся под TigreGotico на HuggingFace, а совместимые с Piper контрольные точки голосов также зеркалируются под OpenVoiceOS.
Фреймворк вывода и обучения, использующий эти датасеты, см. в phoonnx.