Esta entrada se publicó originalmente en el blog de OpenVoiceOS
El asturiano (ast) y el aragonés (an) son lenguas románicas habladas en el norte de España por comunidades que prácticamente no reciben ninguna cobertura de la tecnología de voz comercial. Los hablantes que quieren un asistente de voz usan el español — o se quedan sin él. Construimos modelos de TTS VITS para ambas, publicándolos como pesos abiertos en HuggingFace.
La limitación: el Mozilla Common Voice 23.0 para ambas lenguas es multilocutor y relativamente pequeño. Entrenar un modelo de TTS de un solo locutor de alta calidad directamente sobre esos datos no es viable. Por eso usamos un enfoque híbrido.
La carencia: sin G2P
Algo que no cambiará con una futura actualización del modelo: ni el asturiano ni el aragonés tienen un fonemizador abierto utilizable. Estos modelos se entrenan directamente sobre grafemas. Un fonemizador desbloquearía la entrada en IPA en tiempo de ejecución (forzando la pronunciación de nombres, neologismos, alternancias de código) y mejoraría la consistencia en general. Si conoce léxicos existentes o datos de pronunciación para cualquiera de las dos lenguas, o quiere colaborar en uno, póngase en contacto.
La pipeline híbrida
La metodología completa está en nuestro Whitepaper sobre síntesis híbrida de datasets de TTS. La versión breve:
-
Datos de origen: Common Voice 23.0 — Asturiano y Common Voice 23.0 — Aragonés. Multilocutor, condiciones de grabación variadas.
-
Filtrado: audio normalizado, silencios recortados, valores atípicos por palabras por minuto eliminados. Este paso importa — las transcripciones de hablantes apresurados o poco claros comprometen el alineamiento.
-
Revocalización zero-shot: un modelo de conversión de voz toma el audio multilocutor filtrado y un breve fragmento de voz donante, y resintetiza todas las locuciones en la voz donante. El resultado es un dataset coherente de un solo locutor, en una voz consistente, con el tamaño de la fuente multilocutor original.
-
Entrenamiento VITS mediante phoonnx: VITS entrena rápido, funciona sin GPU en la inferencia, y los modelos resultantes encajan en cualquier pipeline compatible con phoonnx.
Resultados
“L’arcu la vieya ye un fenómenu ópticu y meteorolóxicu que produz l’apaición d’un espectru de lluz continu nel cielu cuando los rayos del sol trespasen pequeñes partícules de mugor conteníes n’atmósfera terrestre. La forma ye la d’un arcu multicolor col roxo hacia la parte esterior y el viola hacia la interior. El arco iris duble, ye menos avezau a vese, y tien los colores invertíos, esto ye, el roxo hacia dientro y el viola hacia l’esterior.”
Descargar: Asturiano — dii (femenina) y Asturiano — miro (masculina)
“L’arco de sant Chuan ye un fenomeno optico y meteorolochico que produce l’aparición d’un espectro de luz contino en o cielo cuan os rayos d’o sol trescruzan chicotas particlas d’humidat situatas por l’atmosfera terrestre. A forma suya ye a d’un arco multicolor con o royo en a parti exterior y o morau en a interior. No ye tan cutiano l’arco de sant Chuan dople, que incluye un segundo arco mas tenue con as colors chiratas, ye dicir o royo en l’interior y o morau en l’exterior.”
Descargar: Aragonés — dii (femenina) y Aragonés — miro (masculina)
La pipeline se valida. La pronunciación es imperfecta — el entrenamiento sobre grafemas sin un fonemizador significa que el modelo aproxima la fonética solo a partir de patrones ortográficos. Lo que existe ahora es una base utilizable y un proceso repetible.
Descargue los modelos y escuche arriba. Si dispone de datos de pronunciación de asturiano o aragonés, un léxico de G2P, o quiere contribuir con grabaciones de voz bajo una licencia abierta, póngase en contacto — esos recursos mejoran directamente la próxima iteración.