Dieser Blogbeitrag wurde ursprünglich im OpenVoiceOS-Blog veröffentlicht
phoonnx ist nun das primäre Text-to-Speech-Framework für OpenVoiceOS — ein vollständiger Trainings- und Inferenz-Stack auf Basis von VITS und ONNX, konzipiert für konsistente, offline-fähige Stimmen in jeder Sprache, die wir unterstützen.
Hören Sie es in Aktion: die Voices Demo führt phoonnx-Stimmen live in Ihrem Browser aus — onnxruntime-web, ohne Server.
Neue Sprache: Wir stellen Baskisch vor!
Aufbauend auf unserer früheren Arbeit an Synthetische Stimmen von Grund auf erstellen und unserer arabischen TTS-Kollaboration sind die neuesten Ergänzungen unserer Sprachunterstützung Stimmen für Baskisch (eu-ES).
Dazu gehören sowohl die männliche Stimme (Miro) als auch die weibliche Stimme (Dii), womit wir unsere Mission weiterführen, selbst ressourcenarme Sprachen zu unterstützen, denen offene, hochwertige TTS-Optionen fehlen.
Zuvor war nur eine robotische weibliche Stimme verfügbar, über das Plugin AhoTTS, das in Zusammenarbeit mit ILENIA entstanden ist.
Hören Sie die Ergebnisse: Beispiele der neuen quelloffenen baskischen Stimmen.
Miro (männliche Stimme): Miro anhören
Dii (weibliche Stimme): Dii anhören
Eine konsistente Stimmidentität über alle Sprachen hinweg
OpenVoiceOS benötigt eine konsistente Markenstimme: eine standardmäßige männliche und weibliche Persona, die gleich klingt, unabhängig davon, für welche Sprache der Assistent konfiguriert ist. Ein Nutzer, der OpenVoiceOS in Lissabon einrichtet und später auf Deutsch umstellt, sollte denselben vertrauten Sprecher hören.
TigreGotico baut und pflegt die phoonnx-Engine, steuert die offenen Trainingsdatensätze bei und trainiert die multilingualen Standardstimmen von OVOS — Miro (männlich) und Dii (weiblich) —, die dieses Versprechen erfüllen.
Phonemizer-Flexibilität
phoonnx ist mehr als nur ein Inferenzwerkzeug; es ist ein vollständiges Trainings- und Inferenz-Framework auf Basis der robusten VITS-Architektur. Diese doppelte Fähigkeit erlaubt es uns, hochwertige Stimmen rasch zu prototypisieren, zu trainieren und bereitzustellen.
Ein Schlüssel zu dieser Flexibilität ist die Fähigkeit, diverse Phonemizer zu unterstützen. Ein Phonemizer (oder G2P-Modell – Graphem-zu-Phonem) wandelt geschriebenen Text in die Sequenz von Lauteinheiten (Phonemen) um, die das TTS-Modell spricht. Unterschiedliche Sprachen können für präzise Sprache unterschiedliche, spezialisierte Phonemizer erfordern.
- eSpeak-Kompatibilität: Ein Kernmerkmal ist, dass phoonnx-Modelle vollständig mit dem Runtime der beliebten Piper-TTS-Engine kompatibel sind, sofern sie mit dem weit verbreiteten eSpeak-Phonemizer trainiert wurden. Dies gewährleistet eine einfache Bereitstellung innerhalb des bestehenden OVOS-Ökosystems und in Drittprojekten wie Home Assistant.
- Unterstützung benutzerdefinierter Phonemizer: Das Framework ist nicht auf eSpeak beschränkt. Zum Beispiel sind die hochwertigen galicischen Modelle, die vom Proxecto Nós mit dem Cotovia-Phonemizer entwickelt wurden, vollständig kompatibel und können mit der phoonnx-Pipeline verwendet werden.
Diese Flexibilität erlaubt es uns, die Arbeit anderer Open-Source-Projekte zu integrieren und davon zu profitieren. Tatsächlich kann phoonnx für die Inferenz erfolgreich Modelle verwenden, die ursprünglich von anderen Projekten trainiert wurden, darunter Coqui, Mimic3 und Piper.
Als Nächstes: ByT5-basierte G2P-Modelle
Mit Blick nach vorne arbeiten wir ständig daran, die G2P-Genauigkeit zu verbessern, insbesondere für ressourcenarme Sprachen. Wir entwickeln und testen derzeit G2P-Modelle der nächsten Generation auf Basis der leistungsstarken ByT5-Architektur. Diese transformerbasierten Modelle versprechen, eine präzisere und robustere Phonemisierung über ein breiteres Spektrum von Sprachen hinweg zu liefern.
Sie können ihre Entwicklung hier verfolgen: G2P Models Collection.
In naher Zukunft wird ein dediziertes OVOS-TTS-Plugin für phoonnx erstellt und zum Standard von OpenVoiceOS gemacht, das die bisherigen Plugins ersetzt: ovos-tts-plugin-piper und ovos-tts-plugin-nos.
In der Zwischenzeit können Sie die neuen Stimmen über das bestehende Plugin ovos-tts-plugin-piper ausprobieren.
Sie müssen lediglich die Modell-URLs in mycroft.conf angeben
"tts": {
"module": "ovos-tts-plugin-piper",
"ovos-tts-plugin-piper": {
"model": "https://huggingface.co/OpenVoiceOS/phoonnx_eu-ES_miro_espeak/resolve/main/miro_eu-ES.onnx",
"model_config": "https://huggingface.co/OpenVoiceOS/phoonnx_eu-ES_miro_espeak/resolve/main/miro_eu-ES.piper.json"
}
}
Fortschrittsbericht: Verfügbare Sprachen
Die gemeinsame Arbeit der Teams von OpenVoiceOS und TigreGotico hat zu einer rasch wachsenden Bibliothek quelloffener TTS-Modelle geführt.
Derzeit unterstützte Sprachen:
- Arabisch
- Baskisch
- Niederländisch
- Englisch (US/GB)
- Französisch
- Deutsch
- Italienisch
- Portugiesisch (Brasilien/Portugal)
- Spanisch
Machen Sie mit und finden Sie die Modelle
Wir laden die Gemeinschaft ein, diese neuen Ressourcen zu erkunden und zu nutzen.
| Ressource | Beschreibung | Link |
|---|---|---|
| Phoonnx-Modelle | Die neuen mit phoonnx trainierten TTS-Modelle im ONNX-Format. | phoonnx-tts-models |
| Piper/Phoonnx-Stimmen | Die vollständige Sammlung der Piper-kompatiblen OpenVoiceOS-Stimmen. | pipertts-voices |
| Offene Datensätze | Zum Training dieser Stimmen verwendete Datensätze, die die Open-Data-Forschung fördern. | tts-datasets |
Erkunden Sie den vollständigen Modell- und Datensatzkatalog auf Hugging Face: TigreGotico · OpenVoiceOS. Um Daten beizusteuern, öffnen Sie ein Issue oder eine Diskussion auf phoonnx.