Dieser Artikel wurde ursprünglich im OpenVoiceOS-Blog veröffentlicht
Asturisch (ast) und Aragonesisch (an) sind romanische Sprachen, die im Norden Spaniens von Gemeinschaften gesprochen werden, die praktisch keine Abdeckung durch kommerzielle Sprachtechnologie erhalten. Sprecher, die einen Sprachassistenten möchten, verwenden Spanisch — oder verzichten ganz darauf. Wir haben VITS-TTS-Modelle für beide Sprachen erstellt und veröffentlichen sie als offene Gewichte auf HuggingFace.
Die Einschränkung: Mozilla Common Voice 23.0 ist für beide Sprachen mehrsprecherbasiert und relativ klein. Ein hochwertiges Einzelsprecher-TTS-Modell direkt auf diesen Daten zu trainieren ist nicht praktikabel. Daher haben wir einen hybriden Ansatz gewählt.
Die Lücke: kein G2P
Eine Sache, die sich auch mit einem künftigen Modell-Upgrade nicht ändern wird: Weder Asturisch noch Aragonesisch verfügen über einen brauchbaren offenen Phonemizer. Diese Modelle werden direkt auf Graphemen trainiert. Ein Phonemizer würde IPA-Eingaben zur Laufzeit ermöglichen (um die Aussprache von Namen, Neologismen und Code-Switches zu erzwingen) und insgesamt die Konsistenz verbessern. Wenn Sie vorhandene Lexika oder Aussprachedaten für eine der beiden Sprachen kennen oder an einem solchen mitarbeiten möchten, nehmen Sie Kontakt mit uns auf.
Die hybride Pipeline
Die vollständige Methodik finden Sie in unserem Whitepaper zur hybriden Synthese von TTS-Datensätzen. Die Kurzfassung:
-
Ausgangsdaten: Common Voice 23.0 — Asturisch und Common Voice 23.0 — Aragonesisch. Mehrsprecherbasiert, mit unterschiedlichen Aufnahmebedingungen.
-
Filterung: Audio normalisiert, Stille beschnitten, Ausreißer nach Wörtern pro Minute entfernt. Dieser Schritt ist wichtig — Transkripte von hastigen oder undeutlichen Sprechern beeinträchtigen die Ausrichtung.
-
Zero-Shot-Revoicing: Ein Sprachkonvertierungsmodell nimmt das gefilterte Mehrsprecher-Audio und einen kurzen Spender-Sprachausschnitt und resynthetisiert alle Äußerungen in der Spenderstimme. Das Ergebnis ist ein kohärenter Einzelsprecher-Datensatz in einer konsistenten Stimme, in der Größe der ursprünglichen Mehrsprecherquelle.
-
VITS-Training über phoonnx: VITS trainiert schnell, läuft bei der Inferenz ohne GPU, und die resultierenden Modelle fügen sich in jede phoonnx-kompatible Pipeline ein.
Ergebnisse
“L’arcu la vieya ye un fenómenu ópticu y meteorolóxicu que produz l’apaición d’un espectru de lluz continu nel cielu cuando los rayos del sol trespasen pequeñes partícules de mugor conteníes n’atmósfera terrestre. La forma ye la d’un arcu multicolor col roxo hacia la parte esterior y el viola hacia la interior. El arco iris duble, ye menos avezau a vese, y tien los colores invertíos, esto ye, el roxo hacia dientro y el viola hacia l’esterior.”
Herunterladen: Asturisch — dii (weiblich) und Asturisch — miro (männlich)
“L’arco de sant Chuan ye un fenomeno optico y meteorolochico que produce l’aparición d’un espectro de luz contino en o cielo cuan os rayos d’o sol trescruzan chicotas particlas d’humidat situatas por l’atmosfera terrestre. A forma suya ye a d’un arco multicolor con o royo en a parti exterior y o morau en a interior. No ye tan cutiano l’arco de sant Chuan dople, que incluye un segundo arco mas tenue con as colors chiratas, ye dicir o royo en l’interior y o morau en l’exterior.”
Herunterladen: Aragonesisch — dii (weiblich) und Aragonesisch — miro (männlich)
Die Pipeline bewährt sich. Die Aussprache ist unvollkommen — das Training auf Graphemen ohne Phonemizer bedeutet, dass das Modell die Phonetik allein aus Schreibmustern annähert. Was jetzt existiert, ist eine brauchbare Grundlage und ein wiederholbarer Prozess.
Laden Sie die Modelle herunter und hören Sie oben hinein. Wenn Sie über Aussprachedaten für Asturisch oder Aragonesisch, ein G2P-Lexikon verfügen oder Sprachaufnahmen unter einer offenen Lizenz beitragen möchten, melden Sie sich — diese Ressourcen verbessern die nächste Iteration unmittelbar.