Alle Beiträge

· Casimiro Ferreira· 2 Min. Lesezeit

Synthetische Stimmen von Grund auf erstellen

  • TTS
  • Synthetic Data
  • Voice Cloning
  • OVOS

Dieser Blogbeitrag wurde ursprünglich im OpenVoiceOS-Blog veröffentlicht

Eine gute Offline-TTS-Stimme für europäisches Portugiesisch existierte nicht. Studioaufnahmen sind teuer, dauern Monate, und in den meisten Sprachen der Welt haben die Aufnahmen schlicht nie stattgefunden. Also haben wir vier von Grund auf gebaut — ohne Aufnahmekabine, ohne Sprecher, ohne Cloud.

Die dreistufige Pipeline

1. Synthetische Sprachpaare erzeugen. Wir verwenden eine vorhandene TTS-Stimme als Geber — jede Quelle, die verständliches Audio erzeugen kann — und lassen sie über ein großes Textkorpus laufen, um Tausende von Audio-/Text-Paaren zu produzieren. Die Geberstimme muss nicht von hoher Qualität sein. Sie muss nur kohärent genug sein, um daraus zu lernen.

2. Voice Conversion anwenden. Ein Voice-Conversion-Schritt verwandelt das Timbre des Gebers in eine neue Identität — anderes Geschlecht, Alter oder Charakter. Das resultierende Audio klingt nach der Zielstimme, nicht nach dem Geber. Hier wird eine neue Persönlichkeit geboren.

3. Ein kompaktes VITS-Modell trainieren. Das konvertierte Audio wird zum Trainingssatz für ein kleines Modell der VITS-Architektur über phoonnx_train. Das fertige Modell wird nach ONNX exportiert und läuft vollständig offline — bei Bedarf auf einem Raspberry Pi.

Ethische Leitplanken

Wenn der Geber die Stimme einer realen Person ist, holen wir zuerst eine ausdrückliche Erlaubnis ein. Wenn keine Erlaubnis möglich ist, verwenden wir gemeinfreie Aufnahmen oder erzeugen eine vollständig originale Stimme, die niemandes Identität kopiert. Der Voice-Conversion-Schritt hat außerdem eine nützliche Datenschutzeigenschaft: Die Ausgabe ist akustisch hinreichend verschieden vom Geber, sodass das Risiko der Nachahmung vernachlässigbar ist.

Angewendet auf europäisches Portugiesisch

Europäisches Portugiesisch hatte keine hochwertige offene Offline-Stimme. Wir haben vier Stimmen produziert — einschließlich der Identitäten Miro und Dii, die nun die Standard-OVOS-Stimmen für pt-PT sind — und zwar mit genau dieser Pipeline. Sie laufen problemlos auf bescheidener Hardware, benötigen keine Internetverbindung, und die Trainingsdaten sind offen veröffentlicht, sodass jeder sie reproduzieren oder erweitern kann.

Alle Modelle und Datensätze liegen unter huggingface.co/OpenVoiceOS und huggingface.co/TigreGotico.