Todos os artigos

· Casimiro Ferreira· 3 min de leitura

Clonar Vozes para Línguas Ameaçadas: Construir um Modelo de Texto-para-Fala para Asturiano e Aragonês

  • TTS
  • Asturian
  • Aragonese
  • Minority Languages
  • Voice Cloning

Este artigo foi originalmente publicado no blog do OpenVoiceOS

O asturiano (ast) e o aragonês (an) são línguas românicas faladas no norte de Espanha por comunidades que praticamente não recebem qualquer cobertura da tecnologia de voz comercial. Os falantes que querem um assistente de voz usam o espanhol, ou ficam sem ele. Construímos modelos de texto-para-fala para ambas usando o VITS, uma arquitetura aberta de texto-para-fala, e lançámo-los como pesos abertos no HuggingFace.

A limitação: o Mozilla Common Voice 23.0 para ambas as línguas é multi-locutor e relativamente pequeno. Treinar um modelo de TTS de locutor único de alta qualidade diretamente sobre esses dados não é viável. Por isso, usámos uma abordagem híbrida.

A lacuna: sem G2P

Nem o asturiano nem o aragonês têm um fonemizador aberto utilizável, e isso não vai mudar com uma futura atualização do modelo. Estes modelos são treinados diretamente sobre grafemas. Um fonemizador acrescentaria input em IPA em tempo de execução, forçando a pronúncia de nomes, neologismos ou alternâncias de código, e melhoraria a consistência de forma geral. Se conhecer léxicos existentes ou dados de pronúncia para qualquer uma das línguas, ou quiser colaborar num, entre em contacto.

A pipeline híbrida

A metodologia completa está no nosso Whitepaper sobre Síntese Híbrida de Datasets de TTS. A versão curta:

  1. Dados de origem: Common Voice 23.0 (Asturiano) e Common Voice 23.0 (Aragonês). Multi-locutor, condições de gravação variadas.

  2. Filtragem: áudio normalizado, silêncios recortados, outliers por palavras-por-minuto removidos. Este passo é importante: transcrições de falantes apressados ou pouco claros comprometem o alinhamento.

  3. Revocalização zero-shot: um modelo de conversão de voz pega no áudio multi-locutor filtrado e num curto excerto de voz dadora, e ressintetiza todas as elocuções na voz dadora. O resultado é um dataset coerente de locutor único, numa voz consistente, com a dimensão da fonte multi-locutor original.

  4. Treino VITS através do phoonnx: o VITS treina depressa, corre sem GPU na inferência, e os modelos resultantes encaixam em qualquer pipeline compatível com o phoonnx.

Resultados

“L’arcu la vieya ye un fenómenu ópticu y meteorolóxicu que produz l’apaición d’un espectru de lluz continu nel cielu cuando los rayos del sol trespasen pequeñes partícules de mugor conteníes n’atmósfera terrestre. La forma ye la d’un arcu multicolor col roxo hacia la parte esterior y el viola hacia la interior. El arco iris duble, ye menos avezau a vese, y tien los colores invertíos, esto ye, el roxo hacia dientro y el viola hacia l’esterior.”

Descarregar: Asturiano, dii (feminina) e Asturiano, miro (masculina)

“L’arco de sant Chuan ye un fenomeno optico y meteorolochico que produce l’aparición d’un espectro de luz contino en o cielo cuan os rayos d’o sol trescruzan chicotas particlas d’humidat situatas por l’atmosfera terrestre. A forma suya ye a d’un arco multicolor con o royo en a parti exterior y o morau en a interior. No ye tan cutiano l’arco de sant Chuan dople, que incluye un segundo arco mas tenue con as colors chiratas, ye dicir o royo en l’interior y o morau en l’exterior.”

Descarregar: Aragonês, dii (feminina) e Aragonês, miro (masculina)

A pipeline valida-se. A pronúncia é imperfeita: o treino sobre grafemas sem um fonemizador significa que o modelo está a aproximar a fonética apenas a partir de padrões de escrita. O que existe agora é uma base utilizável e um processo repetível.


Descarregue os modelos e ouça acima. Se tem dados de pronúncia de asturiano ou aragonês, um léxico de G2P, ou quer contribuir com gravações de voz sob uma licença aberta, contacte-nos. Esses recursos melhoram diretamente a próxima iteração.

Apoie o projeto OpenVoiceOS