この記事はもともとOpenVoiceOSブログに掲載されたものです
アストゥリアス語(ast)とアラゴン語(an)は、スペイン北部で話されているロマンス系の言語であり、その話者コミュニティは商用音声技術からほとんどカバレッジを受けていません。音声アシスタントを使いたい話者はスペイン語を使うか、あるいは諦めるしかありません。私たちは両言語のVITS TTSモデルを構築し、HuggingFace上でオープンな重みとして公開しました。
制約となるのは、両言語のMozilla Common Voice 23.0がマルチ話者かつ比較的小規模であることです。そのデータで高品質な単一話者TTSモデルを直接学習させるのは現実的ではありません。そこで私たちはハイブリッドなアプローチを採用しました。
ギャップ:G2Pの欠如
将来のモデルのアップグレードでも変わらないことが一つあります。アストゥリアス語もアラゴン語も、実用的なオープンな音素化ツールが存在しないという点です。これらのモデルは書記素(グラフェム)から直接学習されています。音素化ツールがあれば、実行時にIPA入力が可能になり(固有名詞、新語、コードスイッチの発音を強制できる)、全体的な一貫性も向上します。いずれかの言語について既存の辞書や発音データをご存じの方、あるいは一緒に作成したいという方は、ぜひご連絡ください。
ハイブリッドパイプライン
完全な手法は、私たちの**ハイブリッド合成TTSデータセット生成に関するホワイトペーパー**に記載されています。短くまとめると次のとおりです。
-
ソースデータ:Common Voice 23.0 — アストゥリアス語とCommon Voice 23.0 — アラゴン語。マルチ話者で、録音条件はさまざまです。
-
フィルタリング:音声の正規化、無音のトリミング、毎分あたりの単語数による外れ値の除去。このステップは重要です。急いで話したり不明瞭だったりする話者の書き起こしは、アライメントを損ないます。
-
ゼロショット・リボイシング:ボイスコンバージョンモデルが、フィルタリング済みのマルチ話者音声と短いドナー音声クリップを受け取り、すべての発話をドナーの声で再合成します。その結果、元のマルチ話者ソースと同じ規模で、一貫した声を持つまとまりのある単一話者データセットが得られます。
-
phoonnxによるVITS学習:VITSは学習が速く、推論時にはGPUなしで動作し、得られるモデルはphoonnx互換の任意のパイプラインにそのまま組み込めます。
結果
“L’arcu la vieya ye un fenómenu ópticu y meteorolóxicu que produz l’apaición d’un espectru de lluz continu nel cielu cuando los rayos del sol trespasen pequeñes partícules de mugor conteníes n’atmósfera terrestre. La forma ye la d’un arcu multicolor col roxo hacia la parte esterior y el viola hacia la interior. El arco iris duble, ye menos avezau a vese, y tien los colores invertíos, esto ye, el roxo hacia dientro y el viola hacia l’esterior.”
ダウンロード:アストゥリアス語 — dii(女性)とアストゥリアス語 — miro(男性)
“L’arco de sant Chuan ye un fenomeno optico y meteorolochico que produce l’aparición d’un espectro de luz contino en o cielo cuan os rayos d’o sol trescruzan chicotas particlas d’humidat situatas por l’atmosfera terrestre. A forma suya ye a d’un arco multicolor con o royo en a parti exterior y o morau en a interior. No ye tan cutiano l’arco de sant Chuan dople, que incluye un segundo arco mas tenue con as colors chiratas, ye dicir o royo en l’interior y o morau en l’exterior.”
ダウンロード:アラゴン語 — dii(女性)とアラゴン語 — miro(男性)
パイプラインは有効に機能します。発音は完璧ではありません。音素化ツールなしで書記素から学習するということは、モデルが綴りのパターンだけから音声を近似しているということです。今あるのは、実用的なベースラインと反復可能なプロセスです。
モデルをダウンロードして、上で聴いてみてください。アストゥリアス語やアラゴン語の発音データ、G2P辞書をお持ちの方、あるいはオープンライセンスで音声録音を提供したいという方は、ぜひご連絡ください。そうしたリソースは、次のイテレーションを直接的に改善します。