Tous les articles

· Casimiro Ferreira· 3 min de lecture

Cloner des voix pour les langues menacées : construire un modèle de synthèse vocale pour l'asturien et l'aragonais

  • TTS
  • Asturian
  • Aragonese
  • Minority Languages
  • Voice Cloning

Cet article a été initialement publié sur le blog OpenVoiceOS

L’asturien (ast) et l’aragonais (an) sont des langues romanes parlées dans le nord de l’Espagne par des communautés qui ne bénéficient pratiquement d’aucune couverture de la technologie vocale commerciale. Les locuteurs qui souhaitent un assistant vocal utilisent l’espagnol — ou s’en passent. Nous avons construit des modèles TTS VITS pour ces deux langues, que nous publions sous forme de poids ouverts sur HuggingFace.

La contrainte : Mozilla Common Voice 23.0 pour ces deux langues est multi-locuteurs et relativement réduit. Entraîner directement un modèle de TTS mono-locuteur de haute qualité sur ces données n’est pas viable. Nous avons donc adopté une approche hybride.

Le manque : pas de G2P

Une chose qui ne changera pas avec une future mise à niveau du modèle : ni l’asturien ni l’aragonais ne disposent d’un phonémiseur ouvert utilisable. Ces modèles sont entraînés directement sur les graphèmes. Un phonémiseur permettrait de saisir de l’IPA à l’exécution (en forçant la prononciation des noms, des néologismes, des alternances de code) et améliorerait globalement la cohérence. Si vous connaissez des lexiques existants ou des données de prononciation pour l’une ou l’autre langue, ou si vous souhaitez collaborer à leur création, contactez-nous.

Le pipeline hybride

La méthodologie complète se trouve dans notre Livre blanc sur la synthèse hybride de jeux de données de TTS. En résumé :

  1. Données sources : Common Voice 23.0 — Asturien et Common Voice 23.0 — Aragonais. Multi-locuteurs, conditions d’enregistrement variées.

  2. Filtrage : audio normalisé, silences recadrés, valeurs aberrantes en mots-par-minute supprimées. Cette étape est importante — les transcriptions de locuteurs pressés ou peu clairs compromettent l’alignement.

  3. Revocalisation zero-shot : un modèle de conversion de voix prend l’audio multi-locuteurs filtré et un court extrait de voix donneuse, et resynthétise tous les énoncés dans la voix donneuse. Le résultat est un jeu de données cohérent mono-locuteur, dans une voix homogène, de la taille de la source multi-locuteurs d’origine.

  4. Entraînement VITS via phoonnx : VITS s’entraîne rapidement, s’exécute sans GPU à l’inférence, et les modèles résultants s’intègrent dans n’importe quel pipeline compatible phoonnx.

Résultats

“L’arcu la vieya ye un fenómenu ópticu y meteorolóxicu que produz l’apaición d’un espectru de lluz continu nel cielu cuando los rayos del sol trespasen pequeñes partícules de mugor conteníes n’atmósfera terrestre. La forma ye la d’un arcu multicolor col roxo hacia la parte esterior y el viola hacia la interior. El arco iris duble, ye menos avezau a vese, y tien los colores invertíos, esto ye, el roxo hacia dientro y el viola hacia l’esterior.”

Téléchargement : Asturien — dii (féminine) et Asturien — miro (masculine)

“L’arco de sant Chuan ye un fenomeno optico y meteorolochico que produce l’aparición d’un espectro de luz contino en o cielo cuan os rayos d’o sol trescruzan chicotas particlas d’humidat situatas por l’atmosfera terrestre. A forma suya ye a d’un arco multicolor con o royo en a parti exterior y o morau en a interior. No ye tan cutiano l’arco de sant Chuan dople, que incluye un segundo arco mas tenue con as colors chiratas, ye dicir o royo en l’interior y o morau en l’exterior.”

Téléchargement : Aragonais — dii (féminine) et Aragonais — miro (masculine)

Le pipeline se valide. La prononciation est imparfaite — l’entraînement sur les graphèmes sans phonémiseur signifie que le modèle approxime la phonétique uniquement à partir des schémas d’écriture. Ce qui existe désormais est une base utilisable et un processus reproductible.


Téléchargez les modèles et écoutez ci-dessus. Si vous disposez de données de prononciation en asturien ou en aragonais, d’un lexique G2P, ou si vous souhaitez contribuer avec des enregistrements vocaux sous licence ouverte, contactez-nous — ces ressources améliorent directement la prochaine itération.

Soutenez le projet OpenVoiceOS