Dit artikel werd oorspronkelijk gepubliceerd op de blog van OpenVoiceOS
Het Asturisch (ast) en het Aragonees (an) zijn Romaanse talen die in Noord-Spanje worden gesproken door gemeenschappen die vrijwel geen enkele dekking krijgen van commerciële spraaktechnologie. Sprekers die een spraakassistent willen, gebruiken Spaans — of moeten het zonder stellen. We hebben voor beide talen VITS-TTS-modellen gebouwd en die als open gewichten op HuggingFace uitgebracht.
De beperking: Mozilla Common Voice 23.0 is voor beide talen meersprekerig en relatief klein. Een hoogwaardig TTS-model met één spreker rechtstreeks op die data trainen is niet haalbaar. Daarom hebben we een hybride aanpak gebruikt.
De leemte: geen G2P
Eén ding dat niet zal veranderen met een toekomstige modelupgrade: noch het Asturisch, noch het Aragonees beschikt over een bruikbare open fonemizer. Deze modellen worden rechtstreeks op grafemen getraind. Een fonemizer zou IPA-invoer tijdens runtime mogelijk maken (waarmee de uitspraak van namen, neologismen en code-switches wordt afgedwongen) en de consistentie in het algemeen verbeteren. Als u bestaande lexicons of uitspraakdata voor een van beide talen kent, of aan zo’n bron wilt meewerken, neem dan contact met ons op.
De hybride pijplijn
De volledige methodologie staat in ons Whitepaper over hybride synthese van TTS-datasets. De korte versie:
-
Brondata: Common Voice 23.0 — Asturisch en Common Voice 23.0 — Aragonees. Meersprekerig, met uiteenlopende opnameomstandigheden.
-
Filtering: audio genormaliseerd, stiltes bijgesneden, uitschieters op basis van woorden-per-minuut verwijderd. Deze stap is belangrijk — transcripties van gehaaste of onduidelijke sprekers ondermijnen de uitlijning.
-
Zero-shot-hervocalisatie: een stemconversiemodel neemt de gefilterde meersprekerige audio en een kort fragment van een donorstem, en hersynthetiseert alle uitingen in de donorstem. Het resultaat is een coherente dataset met één spreker in een consistente stem, met de omvang van de oorspronkelijke meersprekerige bron.
-
VITS-training via phoonnx: VITS traint snel, draait bij inferentie zonder GPU, en de resulterende modellen passen in elke phoonnx-compatibele pijplijn.
Resultaten
“L’arcu la vieya ye un fenómenu ópticu y meteorolóxicu que produz l’apaición d’un espectru de lluz continu nel cielu cuando los rayos del sol trespasen pequeñes partícules de mugor conteníes n’atmósfera terrestre. La forma ye la d’un arcu multicolor col roxo hacia la parte esterior y el viola hacia la interior. El arco iris duble, ye menos avezau a vese, y tien los colores invertíos, esto ye, el roxo hacia dientro y el viola hacia l’esterior.”
Downloaden: Asturisch — dii (vrouwelijk) en Asturisch — miro (mannelijk)
“L’arco de sant Chuan ye un fenomeno optico y meteorolochico que produce l’aparición d’un espectro de luz contino en o cielo cuan os rayos d’o sol trescruzan chicotas particlas d’humidat situatas por l’atmosfera terrestre. A forma suya ye a d’un arco multicolor con o royo en a parti exterior y o morau en a interior. No ye tan cutiano l’arco de sant Chuan dople, que incluye un segundo arco mas tenue con as colors chiratas, ye dicir o royo en l’interior y o morau en l’exterior.”
Downloaden: Aragonees — dii (vrouwelijk) en Aragonees — miro (mannelijk)
De pijplijn bewijst zichzelf. De uitspraak is niet perfect — training op grafemen zonder fonemizer betekent dat het model de fonetiek uitsluitend benadert op basis van spellingspatronen. Wat er nu is, is een bruikbare basislijn en een herhaalbaar proces.
Download de modellen en luister hierboven. Als u uitspraakdata voor het Asturisch of Aragonees hebt, een G2P-lexicon, of stemopnames onder een open licentie wilt bijdragen, neem dan contact op — die bronnen verbeteren de volgende iteratie rechtstreeks.