Tous les articles

· Casimiro Ferreira· 4 min de lecture

Présentation de phoonnx : le nouveau framework TTS d'OpenVoiceOS

  • phoonnx
  • TTS
  • OVOS
  • ONNX
  • Phonemization

Ce blog a été initialement publié sur le blog d’OpenVoiceOS

phoonnx est désormais la principale framework de synthèse vocale (Text-to-Speech) d’OpenVoiceOS — une stack complète d’entraînement et d’inférence construite sur VITS et ONNX, conçue pour des voix cohérentes et prêtes pour le hors ligne dans toutes les langues que nous prenons en charge.

Écoutez-le à l’œuvre : la Démo de Voix fait tourner les voix phoonnx en direct dans votre navigateur — onnxruntime-web, sans serveur.


Nouvelle langue : présentation du basque !

En nous appuyant sur nos travaux antérieurs sur la Création de voix synthétiques à partir de zéro et sur notre Collaboration TTS en arabe, les ajouts les plus récents à notre prise en charge des langues sont des voix pour le basque (eu-ES).

Cela comprend à la fois la voix masculine (Miro) et la voix féminine (Dii), poursuivant ainsi notre mission de prendre en charge même les langues à faibles ressources qui manquent d’options de TTS ouvertes et de haute qualité.

Auparavant, seule une voix féminine robotique était disponible, via le plugin AhoTTS réalisé en collaboration avec ILENIA.

Écoutez les résultats : exemples des nouvelles voix open source en basque.

Miro (voix masculine) : Écouter Miro

Dii (voix féminine) : Écouter Dii


Une identité vocale cohérente dans toutes les langues

OpenVoiceOS a besoin d’une voix de marque cohérente : une persona masculine et féminine standard qui sonne de la même manière quelle que soit la langue pour laquelle l’assistant est configuré. Un utilisateur qui configure OpenVoiceOS à Lisbonne et passe ensuite à l’allemand doit entendre le même locuteur familier.

TigreGotico construit et maintient le moteur phoonnx, contribue aux jeux de données d’entraînement ouverts, et entraîne les voix multilingues par défaut d’OVOS — Miro (masculine) et Dii (féminine) — qui remplissent cet engagement.


Flexibilité des phonémiseurs

phoonnx est bien plus qu’un simple outil d’inférence ; c’est une framework complète d’entraînement et d’inférence construite sur la robuste architecture VITS. Cette double capacité nous permet de prototyper, d’entraîner et de déployer rapidement des voix de haute qualité.

L’une des clés de cette flexibilité est la capacité de prendre en charge divers phonémiseurs. Un phonémiseur (ou modèle G2P — Grapheme-to-Phoneme) convertit le texte écrit en la séquence d’unités sonores (phonèmes) que le modèle TTS prononce. Des langues différentes peuvent nécessiter des phonémiseurs différents et spécialisés pour une parole précise.

  • Compatibilité eSpeak : une fonctionnalité essentielle est que les modèles phoonnx sont entièrement compatibles avec le runtime du populaire moteur Piper TTS, à condition qu’ils aient été entraînés en utilisant le phonémiseur eSpeak, largement disponible. Cela garantit un déploiement facile au sein de l’écosystème OVOS existant et de projets tiers comme Home Assistant.
  • Prise en charge de phonémiseurs personnalisés : la framework ne se limite pas à eSpeak. Par exemple, les modèles galiciens de haute qualité développés par Proxecto Nós à l’aide du phonémiseur Cotovia sont entièrement compatibles et peuvent être utilisés avec le pipeline phoonnx.

Cette flexibilité nous permet d’intégrer et de bénéficier du travail d’autres projets open source. En effet, pour l’inférence, phoonnx peut utiliser avec succès des modèles initialement entraînés par d’autres projets, notamment Coqui, Mimic3 et Piper.

À venir : les modèles G2P basés sur ByT5

En regardant vers l’avenir, nous travaillons constamment à améliorer la précision du G2P, en particulier pour les langues à faibles ressources. Nous développons et testons actuellement des modèles G2P de nouvelle génération basés sur la puissante architecture ByT5. Ces modèles fondés sur les transformers promettent de fournir une phonémisation plus précise et plus robuste sur un plus large éventail de langues.

Vous pouvez suivre leur développement ici : Collection de modèles G2P.

Dans un avenir proche, un plugin TTS OVOS dédié sera créé pour phoonnx et deviendra le plugin par défaut d’OpenVoiceOS, remplaçant les plugins précédents : ovos-tts-plugin-piper et ovos-tts-plugin-nos.

En attendant, vous pouvez essayer les nouvelles voix via le plugin existant ovos-tts-plugin-piper

Il vous suffit de passer les urls des modèles dans mycroft.conf

  "tts": {
    "module": "ovos-tts-plugin-piper",
    "ovos-tts-plugin-piper": {
      "model": "https://huggingface.co/OpenVoiceOS/phoonnx_eu-ES_miro_espeak/resolve/main/miro_eu-ES.onnx",
      "model_config": "https://huggingface.co/OpenVoiceOS/phoonnx_eu-ES_miro_espeak/resolve/main/miro_eu-ES.piper.json"
    }
  }

Rapport d’avancement : langues disponibles

Le travail collectif des équipes d’OpenVoiceOS et de TigreGotico a donné lieu à une bibliothèque de modèles TTS open source en rapide expansion.

Langues actuellement prises en charge :

  • Arabe
  • Basque
  • Néerlandais
  • Anglais (US/GB)
  • Français
  • Allemand
  • Italien
  • Portugais (Brésil/Portugal)
  • Espagnol

Participez et trouvez les modèles

Nous invitons la communauté à explorer et à utiliser ces nouvelles ressources.

RessourceDescriptionLien
Modèles PhoonnxLes nouveaux modèles TTS entraînés avec phoonnx au format ONNX.phoonnx-tts-models
Voix Piper/PhoonnxLa collection complète des voix d’OpenVoiceOS compatibles avec Piper.pipertts-voices
Jeux de données ouvertsJeux de données utilisés pour entraîner ces voix, favorisant la recherche en données ouvertes.tts-datasets


Explorez le catalogue complet de modèles et de jeux de données sur Hugging Face : TigreGotico · OpenVoiceOS. Pour contribuer avec des données, ouvrez une issue ou une discussion sur phoonnx.