Beluister ze nu: de Voices Demo draait Miro & Dii live in je browser — kies een taal, typ een zin, en luister. Geen installatie, geen server.
Mensen onthouden de stem van een assistent beter dan zijn naam. Dus de kernvraag van onze samenwerking met OpenVoiceOS is een praktische: op wie moet de assistent lijken, in elke taal?
Het antwoord is Miro (mannelijk) en Dii (vrouwelijk) — twee stemidentiteiten die dragen over elke taal die OpenVoiceOS ondersteunt. Een gebruiker die de assistent in Lissabon configureert en later overschakelt naar Duits, zou dezelfde vertrouwde spreker moeten horen. Eén merkstem, elke taal, in eigendom van de gemeenschap.
Eén identiteit, vele talen
De gebruikelijke manier om een meertalige stem te krijgen is om één enkel model tegelijk op vele talen te trainen. Het werkt, maar het neigt ertoe het resultaat uit te smeren: accenten bloeden door in andere talen, de uitspraak wordt bij benadering, en de stem verliest de scherpte van een moedertaalspreker.
Wij nemen de moeilijkere weg. Voor elke taal bouwen we een eentalig model — één model, één taal, getraind om die taal goed te doen. De truc die ze samenbindt is voice cloning: elk eentalig Miro-model wordt gekloond van dezelfde bronidentiteit, en evenzo voor Dii. Het resultaat is een familie van modellen per taal die elk als een moedertaalspreker klinken, maar allemaal hetzelfde timbre delen, hetzelfde karakter, dezelfde Miro-heid of Dii-heid. Je krijgt uitspraak van moedertaalkwaliteit én één herkenbare identiteit, in plaats van het één voor het ander in te ruilen.
Deze modellen worden getraind en geserveerd met phoonnx, ons open TTS-framework — VITS-gebaseerd, ONNX-geëxporteerd, alleen-CPU. De stemmen draaien volledig offline; geen cloud, geen API-sleutel, geen gegevens die je hardware verlaten. Binnen OpenVoiceOS handelt de plugin ovos-tts-plugin-phoonnx het ophalen en laden af. Voor het volledige verhaal over hardware en architectuur, zie TTS die op een aardappel draait.
Het G2P-onderzoek dat het mogelijk maakt
Een taal goed spreken gaat niet alleen over de stem — het gaat over weten hoe het schrift bedoeld is te klinken. Dat is de taak van grafeem-naar-foneem (G2P)-conversie: geschreven tekst omzetten in de reeks fonemen die het model daadwerkelijk uitspreekt. Elke nieuwe taal die we oppakken, komt met zijn eigen G2P-onderzoek, en in dat onderzoek zit veel van het echte werk.
phoonnx is hier bewust flexibel. Het kan een hele reeks fonemizers aandrijven — eSpeak, Gruut, Epitran, modelgebaseerde ByT5 G2P, en taalspecifieke tools waar algemene engines tekortschieten. Dit sluit rechtstreeks aan op onze bredere fonetiekstack: ons orthografie-naar-IPA-onderzoek en de Lusofone fonemizers die we voor de Portugese taalfamilie hebben gebouwd, voeden hetzelfde doel — accurate IPA voor talen die de grote TTS-leveranciers nooit de moeite hebben genomen zorgvuldig te modelleren. Wanneer een taal geen goede kant-en-klare fonemizer heeft, is dat gat het project. We doen eerst het spelling-naar-klank-onderzoek, dan volgt de stem.
Twee modellen voor elke gevraagde taal
Hier is het concrete aanbod, en het is het hart van de samenwerking: voor elke taal die iemand aanvraagt, bouwen we twee TTS-modellen — Miro en Dii. Geen roadmap vol misschientjes; een staande toezegging. Vraag om een taal, en het universele paar komt ernaartoe.
En we bedoelen elke taal, niet alleen de comfortabele, commercieel voor de hand liggende. De stemmen die in de wereld ontbreken, zijn zelden die met honderd miljoen sprekers — het zijn de bedreigde en minderheidstalen die reguliere TTS stilletjes negeert omdat de markt te klein is om er moeite voor te doen. Dat zijn precies de talen die we willen bereiken: gemeenschappen die nog nooit een hoogwaardige synthetische stem van zichzelf hebben gehad, en die geen enkele reden hebben om te verwachten dat een Silicon Valley-leverancier die ooit zal leveren.
Dit is geen belofte voor later. Op het moment van schrijven telt de phoonnx TTS models collection op Hugging Face 13 talen met minstens één uitgebrachte stem, en 8 daarvan — Baskisch, Arabisch, Europees Portugees, Asturisch, Aragonees, Fries, Occitaans en Colombiaans Spaans — hebben al zowel Miro als Dii beschikbaar.
Open en zelf-gehost
De stemmen zijn vrij en opensource, draaien offline en zelf-gehost zodat niets van wat je zegt je hardware verlaat, en de hele stack — de engine, de fonemizers, het G2P-onderzoek, de getrainde stemmen — is open, zodat een gemeenschap haar taal kan oppakken en behouden.
Als je taal er nog niet bij staat, is dat geen gesloten deur — het is een aanvraag die wacht om gedaan te worden.