すべての記事

· Casimiro Ferreira· 1 分で読めます

phoonnx のご紹介:OpenVoiceOS の新しい TTS フレームワーク

  • phoonnx
  • TTS
  • OVOS
  • ONNX
  • Phonemization

このブログは元々 OpenVoiceOS ブログ で公開されました

phoonnx が OpenVoiceOS の主要なテキスト読み上げフレームワークになりました。VITS と ONNX を基盤とする完全な学習・推論スタックであり、当社が対応するあらゆる言語で、一貫した、オフライン対応の音声を実現するために設計されています。

実際の動作を聴いてみてください: 音声デモ は、phoonnx の音声をブラウザ上でライブに実行します — onnxruntime-web を使用し、サーバーは不要です。


新しい言語:バスク語のご紹介!

これまでの取り組みである ゼロから合成音声を作るアラビア語 TTS コラボレーション を土台として、当社の言語サポートに加わった最新の音声が バスク語(eu-ES) の音声です。

これには男性の声(Miro)と女性の声(Dii)の両方が含まれ、オープンで高品質な TTS の選択肢を欠く低リソース言語までも支援するという当社の使命をさらに前進させます。

以前は、ILENIA との協力で作られた AhoTTS プラグインを通じて、機械的な女性の声が一つ利用できるだけでした。

結果を聴いてみてください:新しいオープンソースのバスク語音声の例です。

Miro(男性の声): Miro を聴く

Dii(女性の声): Dii を聴く


言語をまたいで一貫した音声アイデンティティ

OpenVoiceOS には、一貫したブランドの声が必要です。すなわち、アシスタントがどの言語向けに設定されていても同じように聞こえる、標準の男性ペルソナと女性ペルソナです。リスボンで OpenVoiceOS を設定し、後にドイツ語へ切り替えたユーザーは、同じ聞き慣れた話者の声を聞くべきです。

TigreGoticophoonnx エンジンを構築・保守し、オープンな学習用データセットを提供し、この約束を果たす OVOS のデフォルト多言語音声 — Miro(男性)と Dii(女性)— を学習させています。


音素化器の柔軟性

phoonnx は単なる推論ツール以上のものです。堅牢な VITS アーキテクチャ を基盤に構築された、完全な 学習・推論フレームワーク です。 この二重の能力により、高品質な音声を迅速にプロトタイプ化し、学習させ、デプロイすることができます。

この柔軟性の鍵は、多様な 音素化器(phonemizer) をサポートできることです。 音素化器(あるいは G2P — 書記素から音素へのモデル)は、書かれたテキストを、TTS モデルが発話する音の単位(音素)の列に変換します。 言語が異なれば、正確な発話のために異なる専用の音素化器が必要になる場合があります。

  • eSpeak 互換性:中核となる機能の一つは、phoonnx モデルが、広く利用可能な eSpeak 音素化器を用いて学習されていれば、人気の Piper TTS エンジンのランタイム と完全に互換性があることです。これにより、既存の OVOS エコシステムや Home Assistant のようなサードパーティのプロジェクト内での容易なデプロイが保証されます。
  • カスタム音素化器のサポート:このフレームワークは eSpeak に限定されません。例えば、Proxecto NósCotovia 音素化器を用いて開発した高品質な ガリシア語モデル も完全に互換性があり、phoonnx のパイプラインで使用できます。

この柔軟性により、当社は他のオープンソースプロジェクトの成果を統合し、その恩恵を受けることができます。実際、推論においては、phoonnxCoquiMimic3Piper を含む他のプロジェクトで元々学習されたモデルを問題なく使用できます。

次のステップ:ByT5 ベースの G2P モデル

将来を見据え、当社は特に低リソース言語における G2P の精度を向上させるために絶えず取り組んでいます。現在、強力な ByT5 アーキテクチャに基づく次世代の G2P モデルを開発・テストしています。これらの transformer ベースのモデルは、より幅広い言語にわたって、より正確で堅牢な音素化を提供することを約束します。

その開発はこちらで追うことができます:G2P モデルコレクション

近い将来、phoonnx 専用の OVOS TTS プラグインが作成され、OpenVoiceOS のデフォルトとなり、以前のプラグインである ovos-tts-plugin-piperovos-tts-plugin-nos を置き換えます。

それまでの間、既存のプラグイン ovos-tts-plugin-piper を通じて新しい音声を試すことができます。

必要なのは、mycroft.conf にモデルの url を渡すことだけです。

  "tts": {
    "module": "ovos-tts-plugin-piper",
    "ovos-tts-plugin-piper": {
      "model": "https://huggingface.co/OpenVoiceOS/phoonnx_eu-ES_miro_espeak/resolve/main/miro_eu-ES.onnx",
      "model_config": "https://huggingface.co/OpenVoiceOS/phoonnx_eu-ES_miro_espeak/resolve/main/miro_eu-ES.piper.json"
    }
  }

進捗報告:利用可能な言語

OpenVoiceOS と TigreGotico のチームの共同作業により、オープンソースの TTS モデルのライブラリが急速に拡大しています。

現在サポートされている言語:

  • アラビア語
  • バスク語
  • オランダ語
  • 英語(米国/英国)
  • フランス語
  • ドイツ語
  • イタリア語
  • ポルトガル語(ブラジル/ポルトガル)
  • スペイン語

参加してモデルを見つけよう

コミュニティの皆さまに、これらの新しいリソースを探索し活用していただくようお招きします。

リソース説明リンク
Phoonnx モデルONNX 形式の新しい phoonnx で学習された TTS モデル。phoonnx-tts-models
Piper/Phoonnx 音声Piper と互換性のある OpenVoiceOS 音声の全コレクション。pipertts-voices
オープンデータセットこれらの音声の学習に使用されたデータセット。オープンデータ研究を促進します。tts-datasets


Hugging Face でモデルとデータセットの全カタログを探索してください:TigreGotico · OpenVoiceOS。データを提供するには、phoonnx で issue またはディスカッションを開いてください。