Tutti gli articoli

· Casimiro Ferreira· 3 min di lettura

Clonare Voci per Lingue in via di Estinzione: Costruire un Modello Text-to-Speech per Asturiano e Aragonese

  • TTS
  • Asturian
  • Aragonese
  • Minority Languages
  • Voice Cloning

Questo articolo è stato originariamente pubblicato sul blog di OpenVoiceOS

L’asturiano (ast) e l’aragonese (an) sono lingue romanze parlate nel nord della Spagna da comunità che praticamente non ricevono alcuna copertura dalla tecnologia vocale commerciale. I parlanti che desiderano un assistente vocale usano lo spagnolo — oppure ne fanno a meno. Abbiamo costruito modelli TTS VITS per entrambe, rilasciandoli come pesi aperti su HuggingFace.

Il vincolo: Mozilla Common Voice 23.0 per entrambe le lingue è multi-parlante e relativamente ridotto. Addestrare un modello TTS mono-parlante di alta qualità direttamente su quei dati non è praticabile. Perciò abbiamo adottato un approccio ibrido.

La lacuna: nessun G2P

Una cosa che non cambierà con un futuro aggiornamento del modello: né l’asturiano né l’aragonese dispongono di un fonemizzatore aperto utilizzabile. Questi modelli sono addestrati direttamente sui grafemi. Un fonemizzatore sbloccherebbe l’input in IPA in fase di esecuzione (forzando la pronuncia di nomi, neologismi, alternanze di codice) e migliorerebbe in generale la coerenza. Se conosce lessici esistenti o dati di pronuncia per una di queste lingue, o desidera collaborare a uno, si metta in contatto.

La pipeline ibrida

La metodologia completa è nel nostro Whitepaper sulla Sintesi Ibrida di Dataset TTS. In sintesi:

  1. Dati di origine: Common Voice 23.0 — Asturiano e Common Voice 23.0 — Aragonese. Multi-parlante, condizioni di registrazione variabili.

  2. Filtraggio: audio normalizzato, silenzi ritagliati, outlier per parole-al-minuto rimossi. Questo passaggio è importante — le trascrizioni di parlanti frettolosi o poco chiari compromettono l’allineamento.

  3. Revocalizzazione zero-shot: un modello di conversione vocale prende l’audio multi-parlante filtrato e un breve estratto di voce donatrice, e risintetizza tutte le enunciazioni nella voce donatrice. Il risultato è un dataset coerente mono-parlante, in una voce consistente, delle stesse dimensioni della fonte multi-parlante originale.

  4. Addestramento VITS tramite phoonnx: VITS si addestra rapidamente, funziona senza GPU in inferenza, e i modelli risultanti si integrano in qualsiasi pipeline compatibile con phoonnx.

Risultati

“L’arcu la vieya ye un fenómenu ópticu y meteorolóxicu que produz l’apaición d’un espectru de lluz continu nel cielu cuando los rayos del sol trespasen pequeñes partícules de mugor conteníes n’atmósfera terrestre. La forma ye la d’un arcu multicolor col roxo hacia la parte esterior y el viola hacia la interior. El arco iris duble, ye menos avezau a vese, y tien los colores invertíos, esto ye, el roxo hacia dientro y el viola hacia l’esterior.”

Scarica: Asturiano — dii (femminile) e Asturiano — miro (maschile)

“L’arco de sant Chuan ye un fenomeno optico y meteorolochico que produce l’aparición d’un espectro de luz contino en o cielo cuan os rayos d’o sol trescruzan chicotas particlas d’humidat situatas por l’atmosfera terrestre. A forma suya ye a d’un arco multicolor con o royo en a parti exterior y o morau en a interior. No ye tan cutiano l’arco de sant Chuan dople, que incluye un segundo arco mas tenue con as colors chiratas, ye dicir o royo en l’interior y o morau en l’exterior.”

Scarica: Aragonese — dii (femminile) e Aragonese — miro (maschile)

La pipeline si convalida. La pronuncia è imperfetta — l’addestramento sui grafemi senza un fonemizzatore significa che il modello approssima la fonetica unicamente a partire dai pattern ortografici. Ciò che esiste ora è una base utilizzabile e un processo ripetibile.


Scarica i modelli e ascolta qui sopra. Se dispone di dati di pronuncia asturiana o aragonese, di un lessico G2P, o desidera contribuire con registrazioni vocali sotto licenza aperta, si metta in contatto — queste risorse migliorano direttamente la prossima iterazione.

Sostieni il progetto OpenVoiceOS