今すぐ聴いてみてください: 音声デモ は Miro と Dii を ブラウザ上でライブに実行します — 言語を選び、文章を入力して、聴いてみてください。インストール不要、サーバー不要です。
人はアシスタントの名前よりも、その声を覚えているものです。ですから、OpenVoiceOS との提携における中心的な問いは実践的なものです。アシスタントは、あらゆる言語で、誰の声に聞こえるべきなのか?
その答えが Miro(男性)と Dii(女性)です — OpenVoiceOS が対応するあらゆる言語にわたって受け継がれる 2 つの音声アイデンティティです。リスボンでアシスタントを設定し、後にドイツ語へ切り替えたユーザーは、同じ聞き慣れた話者の声を聞くべきです。1 つのブランドの声を、すべての言語に、コミュニティの所有物として。
1 つのアイデンティティ、多くの言語
多言語音声を得る一般的な方法は、1 つのモデルを多くの言語で一度に学習させることです。それは機能しますが、結果をにじませてしまう傾向があります。アクセントが言語間で混ざり合い、発音が近似的になり、声はネイティブ話者の明瞭さを失います。
私たちはより困難な道を選びます。すべての言語について 単一言語 モデルを構築します — 1 つのモデル、1 つの言語、その言語を上手にこなすよう学習させたものです。それらを結びつける仕掛けが 音声クローニング です。各単一言語の Miro モデルは同じソースのアイデンティティからクローンされ、Dii についても同様です。その結果、言語ごとのモデルの一族が生まれ、それぞれがネイティブのように話しながらも、すべてが同じ音色、同じ性格、同じ Miro らしさや Dii らしさを共有します。片方を犠牲にしてもう片方を得るのではなく、ネイティブ品質の発音 と 単一の認識可能なアイデンティティの両方を手に入れられるのです。
これらのモデルは、当社のオープンな TTS フレームワークである phoonnx で学習・提供されます — VITS ベースで、ONNX にエクスポートされ、CPU のみで動作します。音声は完全にオフラインで動作します。クラウドなし、API キーなし、データがハードウェアから出ることもありません。OpenVoiceOS の内部では、ovos-tts-plugin-phoonnx プラグインがそれらの取得と読み込みを処理します。ハードウェアとアーキテクチャの詳細については、ジャガイモでも動く TTS をご覧ください。
それを可能にする G2P 研究
言語を上手に話すことは、声だけの問題ではありません — 書かれたものがどう聞こえる べきか を知ることに関わります。それが 書記素から音素へ(G2P) の変換の仕事です。書かれたテキストを、モデルが実際に発音する音素の列に変えるのです。私たちが取り組むすべての新しい言語には、それ自身の G2P 研究が伴い、その研究にこそ本当の作業の多くが宿っています。
phoonnx はここで意図的に柔軟です。幅広い音素化器を駆動できます — eSpeak、Gruut、Epitran、モデルベースの ByT5 G2P、そして汎用エンジンでは不十分な場合の言語固有のツールです。これは当社のより広範な音声学スタックに直接つながります。当社の 正書法から IPA への研究 と、ポルトガル語族のために構築した ポルトガル語圏の音素化器 は、同じ目標に貢献します — 大手 TTS プロバイダーが決して丁寧にモデル化しようとしなかった言語のための正確な IPA です。ある言語に良い既製の音素化器がないとき、その空白こそ が プロジェクトなのです。私たちはまず綴りから音への研究を行い、それから声が後に続きます。
要望されたすべての言語に 2 つのモデル
これが具体的な提案であり、提携の核心です。誰かが要望するすべての言語について、私たちは 2 つの TTS モデル — Miro と Dii — を構築します。 いつかの可能性のロードマップではなく、恒常的な約束です。言語を要望してください。そうすれば、その普遍的なペアがそこにやって来ます。
そして私たちは すべて の言語を意味しています。快適で商業的に明白なものだけではありません。世界に欠けている声が、1 億人の話者を持つ言語であることはめったにありません — それは、市場が小さすぎて手間をかける価値がないと主流の TTS がひそかに無視する 危機言語や少数言語 です。それこそが私たちが届けたいと願う言語です。高品質な合成音声を自分たちのものとして持ったことが一度もなく、シリコンバレーのベンダーがいつかそれを提供してくれると期待する理由もないコミュニティです。
これは後回しの約束ではありません。この記事を書いている時点で、Hugging Face の phoonnx TTS モデルコレクション には、少なくとも 1 つの音声が出荷済みの 13 言語が掲載されており、そのうち 8 言語 — バスク語、アラビア語、ヨーロッパポルトガル語、アストゥリアス語、アラゴン語、フリジア語、オック語、コロンビアスペイン語 — はすでに Miro と Dii の両方が利用可能です。
オープンでセルフホスト可能
音声は 無料でオープンソース であり、オフラインでセルフホスト されて動作するのであなたが話す内容はハードウェアから出ることがなく、スタック全体 — エンジン、音素化器、G2P 研究、学習済みの音声 — がオープンであるため、コミュニティが手に取って維持し続けられます。
あなたの言語がまだ一覧になくても、それは閉ざされた扉ではありません — それは、まだなされていない要望を待っているのです。