Schrijven
Uit de werkplaats
Notities over spraak-AI, OpenVoiceOS-ontwikkeling, synthetische data en spraaktechnologie voor minderheidstalen.
- 7 min lezen
Open spraakmodellen exporteren en kwantiseren zodat ze echt draaien
Een getraind spraakmodel op een onderzoeks-GitHub-pagina is geen spraakassistent. Wij zetten open ASR- en TTS-checkpoints om naar ONNX, CoreML en GGUF, kwantiseren ze en valideren de uitvoer — en publiceren de resultaten vervolgens onder OpenVoiceOS, zodat elke taal die ze dekken terechtkomt in een echte, offline assistent.
- ONNX
- CoreML
- GGUF
- ASR
- 17 min lezen
Porten met machines, en de licentievraag die we niet konden beantwoorden
We herschreven meerdere C-, C++- en Java-programma's — de G2P van espeak-ng, Cotovia, AhoTTS, HermiT — als puur Python, met een AI die de originele bron las en een mens die orkestreerde. Dat roept twee vragen op: kan de output überhaupt bezit zijn, en is het een afgeleid werk? We behielden de upstream-licenties omdat dat goedkoper was dan antwoorden.
- FOSS
- Licensing
- Open Source
- Python
- 8 min lezen
Een familie van pure-ONNX-spraakbibliotheken
TigreGótico onderhoudt een reeks spraakbibliotheken — bandbreedte-extensie, voice cloning, sprekersembeddings, VAD, woordklemtoon, fonemisatie, TTS, en een metrics-bibliotheek om ze allemaal te scoren — die één runtime-regel delen: alleen onnxruntime en numpy, geen PyTorch, geen GPU vereist.
- ONNX
- TTS
- voice cloning
- VAD
- 10 min lezen
Hoe de fonologiestack in elkaar zit
Een architectuurrondleiding langs onze tekst-naar-uitspraak-stack: scriptconv voor notatie, orthography2ipa als de taaloverschrijdende grafeem-naar-IPA-engine, taalspecifieke frontends daarbovenop voor Portugees, Baskisch, Mirandees, Barranquenho en Arabisch, en phonematcher voor klankgebaseerd zoeken. Laat zien waarom de lagen bestaan, wat een kandidaat-lattice is, en echte dialectuitvoer.
- G2P
- IPA
- Phonetics
- NLP
- 9 min lezen
Een stemklonings-engine kiezen
voiceclonnx draait 10 stemconversie-engines achter één API, van kNN-feature-swap tot AR codec-LM. Dit is een gids voor de modelfamilies erachter, de echte gemeten afweging tussen verstaanbaarheid en sprekergelijkenis, en hoe u een engine kiest voor een specifieke taak.
- ONNX
- voice cloning
- voice conversion
- self-hosted
- 9 min lezen
Slechte audio opschonen: ruisonderdrukking en bandbreedte-extensie in audiosronnx
Een diepgaande blik op de twee aparte taken van audiosronnx — ruis verwijderen en ontbrekende hoge frequenties reconstrueren — met het echte engine-register, modelgroottes en licenties, de lijst met afgewezen modellen, en hoe u controleert of de output daadwerkelijk is verbeterd.
- ONNX
- denoising
- bandwidth extension
- speech
- 9 min lezen
Spraakkwaliteit meten zonder luisterpanel
Een praktische gids voor speechonnxmetrics: wat MOS, no-reference MOS-voorspellers, intrusieve signaalmetrieken en ASR-gebaseerde WER/CER daadwerkelijk meten, wanneer elk van toepassing is, echte scores op echte audio, en waarom een voorspelde MOS bewijs is, geen waarheid.
- speechonnxmetrics
- TTS
- ONNX
- evaluation
- 8 min lezen
Schriften en fonetische notaties: wat scriptconv daadwerkelijk converteert
Een diepgaande blik op scriptconv, de zero-dependency-bibliotheek die schriftsystemen detecteert en tussen fonetische notaties converteert. Behandelt IPA, ARPABET en X-SAMPA; ISO-15924-schriftdetectie; Buckwalter-transliteratie voor Arabisch; Hangeul-decompositie in jamo; en kana-conversie, met echte, uitgevoerde voorbeelden en eerlijke beperkingen.
- IPA
- Phonetics
- NLP
- Linguistics
- 12 min lezen
Je sentimentmodel kan een klacht niet onderscheiden van een afscheid
Twee boos ogende supportberichten. De ene klant staat op escaleren; de andere is weg zonder een woord. Bijna geen enkel emotiemodel kan ze uit elkaar houden — omdat ze allemaal dezelfde as missen. Maak kennis met emotion-algebra.
- Affective Computing
- Emotion
- Machine Learning
- LILACS
- 4 min lezen
Waarom we data hamsteren: van gescrapete catalogi naar slimmere spraak- en taalmodellen
Schone, getypeerde, goed van herkomst voorziene data is de grondstof van elk model dat we uitbrengen. Hoe de catalogi die onze scrapers bouwen ASR-bias-vocabulaires, intent-classificatoren, synthetische NER-corpora, G2P-lexicons, TTS-stemmen — en eerlijke brandstof voor LLM's worden.
- Datasets
- Data Collection
- ASR
- NLP
- 6 min lezen
Als iedereen een app uitbrengt, brengen wij stem uit: websites veranderen in spraakapps
Elke site die ertoe doet, werd verpakt in een mobiele app. Wij stellen de omgekeerde beweging voor voor het spraak- en CLI-tijdperk: een schone API plus een spraakskill per site, zodat het web doorbladerbaar wordt op het gehoor en met het toetsenbord. Eén site tegelijk telt het op tot een spraakbrowser.
- Voice
- Accessibility
- OpenVoiceOS
- Web Automation
- 2 min lezen
Usenet in 2026: een schoon, pre-AI-tekstcorpus voor training en evaluatie
Usenet is een ongerept archief van menselijke discussie van vóór de AI — decennia aan nieuwsgroepposts, allemaal door mensen geschreven, niets ervan aangeraakt door taalmodellen. Dat maakt het waardevolle trainings- en evaluatiedata voor taal- en spraakmodellen. We bouwden een kleine Python-tool om het te oogsten.
- Usenet
- Datasets
- NLP
- 4 min lezen
Twee stemmen, elke taal: Miro & Dii
TigreGótico werkt samen met OpenVoiceOS om de assistent twee consistente stemidentiteiten te geven — Miro en Dii — die in elke taal hetzelfde klinken, gebouwd met onze voice-cloning-technologie en de phoonnx-engine. Twee TTS-modellen voor elke taal die iemand aanvraagt, bedreigde talen inbegrepen.
- phoonnx
- TTS
- OVOS
- voice cloning
- 5 min lezen
Het goed uitspreken: Portugese heterofonen desambigueren voor TTS
Veel Europees-Portugese woorden worden hetzelfde gespeld maar afhankelijk van de betekenis anders uitgesproken — en de verkeerde klinker laat een TTS-stem het verkeerde woord zeggen. We bouwden bifonia-pt-homographs, een open betekenislabelede dataset van 56.891 zinnen over 27 woorden, en een piepkleine resolver zonder afhankelijkheden die ≈94% haalt waar zware POS-taggers blijven steken op ≈75%.
- Datasets
- Portuguese
- TTS
- Grapheme-to-Phoneme
- 5 min lezen
TTS-modellen die op een aardappel draaien
phoonnx is een onderzoeksframework voor VITS-gebaseerde tekst-naar-spraak, gebouwd om comfortabel op zwakke hardware te draaien. Geen GPU, geen cloud, geen API-sleutel — alleen een ONNX-stem van ~15,65 miljoen parameters en een CPU. Zo klein kan een goede stem zijn, en zo trainen we ze.
- phoonnx
- TTS
- ONNX
- VITS
- 6 min lezen
Wij stellen onze Muziekdatabase-Scrapers voor
Een rondleiding langs de familie getypeerde Python-clients die we onderhouden voor muziekbronnen — Bandcamp, SoundCloud, SomaFM, TuneIn, iHeartRadio en de grote muziekencyclopedieën — die allemaal consistente, getypeerde mediametadata uitsturen achter één schone interface en op dezelfde compliante HTTP-transportlaag met laag volume draaien.
- Scrapers
- Media Metadata
- Music
- Python
- 3 min lezen
Een meertalige dataset van zinstypen: vragen, commando's, uitspraken
We hebben sentence-types-multilingual gepubliceerd — bijna 70.000 zinnen in zeven talen, geclassificeerd naar grammaticaal type (vraag, commando, uitspraak, uitroep). Het is het trainingscorpus achter de routeringsbibliotheek little_questions.
- Datasets
- Multilingual
- NLP
- Intent
- 6 min lezen
Samenstelbare, kant-en-klare requests-sessies voor veerkrachtige toegang tot publieke data
Twee samenstelbare subklassen van requests.Session voor het betrouwbaar lezen van publieke webpagina's zonder headless browser in het kritieke pad: TLS-compatibel transport, een FlareSolverr-proxy voor JS-uitdagingen, een terugval op de Wayback Machine en IP-gediversifieerde verzoeken — unblock_requests en anon_requests.
- HTTP
- Scraping
- Cloudflare
- Anti-Bot
- 4 min lezen
Robots.txt, sitemaps en ethisch webscrapen
Voordat u een scraper bouwt, verken eerst de site. sitemapper leest robots.txt, haalt elke sitemap op en doorloopt optioneel de linkgraaf — zodat uw scraper vertrekt vanuit het eigen contract van de site in plaats van bruut geweld.
- Web Scraping
- Sitemaps
- Ethics
- Robots.txt
- 5 min lezen
Klassieke NLP voor het Portugees: lettergreepverdeling en grafeem-naar-foneem
Een blik op onze op regels gebaseerde, volledig offline Portugese NLP-stack — silabificador voor lettergreepverdeling en TugaPhone voor dialectbewuste grafeem-naar-foneem — en hoe deze aansluiten op het bredere orthography2ipa-werk voor Lusofone variëteiten. Geen deep-learning-blackboxes: deterministisch, snel en met weinig afhankelijkheden.
- NLP
- Portuguese
- Phonemization
- Grapheme-to-Phoneme
- 9 min lezen
Grafeem-naar-IPA voor 820 talen
orthography2ipa is een taalkundig gefundeerde bron van pure data die spelling op IPA afbeeldt en modelleert hoe fonemen als allofonen tot uiting komen over 909 taalspecificaties, 820 talen en meer dan 20 taalfamilies. Een kandidaat-lattice, een maximal-munch-tokenizer, fonologische en schriftafstandsmetrieken, dialectlijn en een schema-gevalideerde specificatieset, geciteerd naar de dialectologische literatuur — zonder getrainde gewichten, volledig zelf te hosten.
- G2P
- IPA
- Phonetics
- NLP
- 2 min lezen
Wij presenteren de eerste phonemizer voor het Barranquenho
g2p_barranquenho is de eerste open grafeem-naar-foneem-omzetter voor het Barranquenho, de Ibero-Romaanse contacttaal van Barrancos, Portugal — regels afgeleid van de onlangs door de gemeente gepubliceerde spellingsconventie, controleerbaar aan de hand van de in de repository opgenomen bronnen.
- Phonemization
- Barranquenho
- Minority Languages
- NLP
- 3 min lezen
Stemmen klonen voor bedreigde talen: een tekst-naar-spraakmodel bouwen voor het Asturisch en Aragonees
We brengen experimentele tekst-naar-spraakmodellen uit voor het Asturisch (ast) en het Aragonees (an) — twee Romaanse minderheidstalen zonder vrijwel enige commerciële stemdekking — gebouwd met een hybride pijplijn: gefilterde Common Voice-data, zero-shot-hervocalisatie en VITS-training via phoonnx.
- TTS
- Asturian
- Aragonese
- Minority Languages
- 3 min lezen
OVOS & HiveMind in de Maakindustrie
De EU-projecten COALA en WASABI hebben een compleet industrieel spraakassistent-framework rond OVOS + HiveMind gebouwd, en integreren die met hun eigen tools, UI en conversatie-engines.
- OVOS
- HiveMind
- Industry
- manufacturing
- 1 min lezen
Synthetische Wakeword-datasets: Zeven Assistentnamen, Eén Detector
We publiceerden zeven synthetische wakeword-datasets voor gangbare namen van spraakassistenten — hey_computer, hey_mycroft, hey_siri, alexa, home_assistant, voice_assistant, wake_up. Train een detector die overal werkt.
- Datasets
- Wakewords
- Speech
- Synthetic
- 4 min lezen
Introductie van phoonnx: het nieuwe TTS-framework van OpenVoiceOS
phoonnx is nu het primaire text-to-speech-framework voor OpenVoiceOS — een complete VITS/ONNX-stack voor training en inferentie — te beginnen met nieuwe Baskische stemmen voor Miro en Dii.
- phoonnx
- TTS
- OVOS
- ONNX
- 4 min lezen
OpenVoiceOS en Home Assistant: een droomteam voor spraakautomatisering
Home Assistant verzorgt de automatisering; OVOS verzorgt de spraak. Drie integratielagen maken de combinatie mogelijk: Wyoming-bruggen voor de spraakpijplijn van HA, ovos-persona-server als conversationele agent, en HiveMind om OVOS-apparaten als native HA-entiteiten weer te geven.
- OVOS
- Home Assistant
- Smart Home
- Voice Automation
- 2 min lezen
Synthetische stemmen vanaf nul maken
Een stem creëren voor een tekst-naar-spraaksysteem vereist normaal gesproken dat een echte persoon urenlang audio opneemt. Dat is duur, tijdrovend, en in veel talen of accenten bestaan de stemmen simpelweg helemaal niet
- TTS
- Synthetic Data
- Voice Cloning
- OVOS
- 2 min lezen
Miro & Dii TTS-trainingsdata: 40 open datasets in 20 locales
We publiceerden 40 synthetische trainingsdatasets voor de stemmen Miro en Dii in het Portugees, Nederlands, Duits, Frans, Italiaans, Japans, Spaans en meer. Voice cloning op schaal: elke taal krijgt twee consistente identiteiten.
- TTS
- Voice
- Datasets
- Miro & Dii
- 3 min lezen
Geen Taal Achtergelaten
Taalbarrières in OpenVoiceOS wegnemen via taaldetectie, vertaalplugins en bidirectionele vertaalmogelijkheden.
- OVOS
- multilingual
- language-detection
- translation