Texte
Aus der Werkstatt
Notizen zu Sprach-KI, OpenVoiceOS-Entwicklung, synthetischen Daten und Sprachtechnologie für Minderheitensprachen.
- 6 Min. Lesezeit
Offene Sprachmodelle exportieren und quantisieren, damit sie wirklich laufen
Ein trainiertes Sprachmodell auf einer Forschungs-GitHub-Seite ist kein Sprachassistent. Wir konvertieren offene ASR- und TTS-Checkpoints nach ONNX, CoreML und GGUF, quantisieren sie und validieren die Ausgabe — und veröffentlichen die Ergebnisse dann unter OpenVoiceOS, sodass jede von ihnen abgedeckte Sprache in einem echten, offline arbeitenden Assistenten landet.
- ONNX
- CoreML
- GGUF
- ASR
- 17 Min. Lesezeit
Portieren mit Maschinen, und die Lizenzfrage, die wir nicht beantworten konnten
Wir haben mehrere C-, C++- und Java-Programme — das G2P von espeak-ng, Cotovía, AhoTTS, HermiT — als reines Python neu geschrieben, mit einer KI als Leserin des Original-Quellcodes und einem Menschen als Dirigenten. Niemand auf unserer Seite hat die Originale gelesen. Das wirft zwei Fragen auf: Kann das Ergebnis überhaupt Eigentum sein, und ist es abgeleitet? Wir behielten die ursprünglichen Lizenzen, weil das billiger war als die Antwort. Wir halten die Frage für offen.
- FOSS
- Licensing
- Open Source
- Python
- 8 Min. Lesezeit
Eine Familie reiner ONNX-Sprachbibliotheken
TigreGótico pflegt eine Reihe von Sprachbibliotheken — Bandbreitenerweiterung, Voice Cloning, Sprecher-Embeddings, VAD, Wortbetonung, Phonemisierung, TTS und eine Metrik-Bibliothek, um sie alle zu bewerten — die sich an eine gemeinsame Laufzeitregel halten: nur onnxruntime und numpy, kein PyTorch, keine GPU erforderlich.
- ONNX
- TTS
- voice cloning
- VAD
- 10 Min. Lesezeit
Wie der Phonologie-Stack zusammenpasst
Eine Architektur-Führung durch unseren Text-zu-Aussprache-Stack: scriptconv für Notation, orthography2ipa als sprachübergreifende Graphem-zu-IPA-Engine, sprachspezifische Frontends darauf aufbauend für Portugiesisch, Baskisch, Mirandesisch, Barranquenho und Arabisch, sowie phonematcher für klangbasierte Suche. Zeigt, warum die Ebenen existieren, was ein Kandidatengitter ist, und echte Dialekt-Ausgaben.
- G2P
- IPA
- Phonetics
- NLP
- 9 Min. Lesezeit
Eine Voice-Cloning-Engine wählen
voiceclonnx betreibt 10 Voice-Conversion-Engines hinter einer API, vom kNN-Feature-Swap bis zum AR-Codec-LM. Dies ist ein Leitfaden zu den dahinterstehenden Modellfamilien, dem real gemessenen Kompromiss zwischen Verständlichkeit und Sprecherähnlichkeit, und wie man eine Engine für eine bestimmte Aufgabe auswählt.
- ONNX
- voice cloning
- voice conversion
- self-hosted
- 9 Min. Lesezeit
Schlechtes Audio bereinigen: Entrauschung und Bandbreitenerweiterung in audiosronnx
Eine Tiefenanalyse der zwei getrennten Aufgaben von audiosronnx — Rauschen entfernen und fehlende hohe Frequenzen wieder aufbauen — mit der tatsächlichen Engine-Registry, Modellgrößen und Lizenzen, der Liste abgelehnter Modelle und wie man prüft, ob sich die Ausgabe tatsächlich verbessert hat.
- ONNX
- denoising
- bandwidth extension
- speech
- 9 Min. Lesezeit
Sprachqualität messen ohne Hörer-Panel
Ein praxisnaher Leitfaden zu speechonnxmetrics: was MOS, referenzlose MOS-Schätzer, intrusive Signalmetriken und ASR-basierte WER/CER tatsächlich messen, wann welche gilt, echte Werte von echtem Audio, und warum ein vorhergesagter MOS Beweis ist, nicht Wahrheit.
- speechonnxmetrics
- TTS
- ONNX
- evaluation
- 7 Min. Lesezeit
Schriften und phonetische Notationen: Was scriptconv tatsächlich umwandelt
Eine Tiefenanalyse von scriptconv, der abhängigkeitsfreien Bibliothek, die Schriftsysteme erkennt und zwischen phonetischen Notationen umwandelt. Behandelt IPA, ARPABET und X-SAMPA; ISO-15924-Schrifterkennung; Buckwalter-Transliteration für Arabisch; Hangul-Zerlegung in Jamo; und Kana-Umwandlung, mit echten, ausgeführten Beispielen und ehrlichen Grenzen.
- IPA
- Phonetics
- NLP
- Linguistics
- 11 Min. Lesezeit
Dein Sentiment-Modell kann eine Beschwerde nicht von einem Abschied unterscheiden
Zwei wütend wirkende Support-Nachrichten. Ein Kunde will eskalieren; der andere geht einfach, ohne ein Wort. Kaum ein Emotionsmodell kann die beiden unterscheiden – weil allen dieselbe Achse fehlt. Einführung in emotion-algebra.
- Affective Computing
- Emotion
- Machine Learning
- LILACS
- 4 Min. Lesezeit
Warum wir Daten horten: Von gescrapten Katalogen zu intelligenteren Sprach- und Sprachmodellen
Saubere, typisierte Daten mit guter Provenienz sind das Rohmaterial jedes Modells, das wir ausliefern. Wie die Kataloge, die unsere Scraper aufbauen, zu Biasing-Vokabularen für ASR, Intent-Klassifikatoren, synthetischen NER-Korpora, G2P-Lexika, TTS-Stimmen werden – und zu ehrlichem Treibstoff für LLMs.
- Datasets
- Data Collection
- ASR
- NLP
- 6 Min. Lesezeit
Wenn alle eine App veröffentlichen, veröffentlichen wir Stimme: Websites in Sprach-Apps verwandeln
Jede Website, die zählt, wurde in eine mobile App verpackt. Wir schlagen den umgekehrten Schritt für das Zeitalter der Stimme und der Kommandozeile vor: eine saubere API plus eine Sprach-Skill pro Website, damit das Web per Ohr und per Tastatur durchsuchbar wird. Eine Website nach der anderen ergibt in der Summe einen Sprach-Browser.
- Voice
- Accessibility
- OpenVoiceOS
- Web Automation
- 2 Min. Lesezeit
Usenet im Jahr 2026: ein sauberer Textkorpus aus der Zeit vor der KI für Training und Evaluierung
Usenet ist ein unberührtes Archiv des menschlichen Diskurses aus der Zeit vor der KI — Jahrzehnte an Newsgroup-Beiträgen, alles von Menschen geschrieben, nichts davon von Sprachmodellen berührt. Das macht es zu wertvollen Trainings- und Evaluierungsdaten für Sprach- und Sprachmodelle. Wir haben ein kleines Python-Werkzeug gebaut, um es zu ernten.
- Usenet
- Datasets
- NLP
- 4 Min. Lesezeit
Zwei Stimmen, jede Sprache: Miro & Dii
TigreGótico geht eine Partnerschaft mit OpenVoiceOS ein, um dem Assistenten zwei konsistente Stimmidentitäten zu verleihen — Miro und Dii —, die in jeder Sprache gleich klingen, aufgebaut mit unserer Voice-Cloning-Technologie und dem phoonnx-Engine. Zwei TTS-Modelle für jede Sprache, die jemand anfragt, bedrohte Sprachen inbegriffen.
- phoonnx
- TTS
- OVOS
- voice cloning
- 5 Min. Lesezeit
Richtig ausgesprochen: Portugiesische Heterophone für TTS disambiguieren
Viele europäisch-portugiesische Wörter werden gleich geschrieben, aber je nach Bedeutung unterschiedlich ausgesprochen — und ein falscher Vokal lässt eine TTS-Stimme das falsche Wort sagen. Wir haben bifonia-pt-homographs erstellt, einen offenen, nach Bedeutung annotierten Datensatz mit 56.891 Sätzen über 27 Wörter, sowie einen winzigen, abhängigkeitsfreien Resolver, der ≈94 % erreicht, wo schwergewichtige POS-Tagger bei ≈75 % stagnieren.
- Datasets
- Portuguese
- TTS
- Grapheme-to-Phoneme
- 4 Min. Lesezeit
TTS-Modelle, die auf einer Kartoffel laufen
phoonnx ist ein Forschungs-Framework für VITS-basierte Sprachsynthese, gebaut, um bequem auf schwacher Hardware zu laufen. Keine GPU, keine Cloud, kein API-Schlüssel — nur eine ONNX-Stimme mit rund 15,65 Millionen Parametern und eine CPU. Hier erfahren Sie, wie klein eine gute Stimme sein kann und wie wir sie trainieren.
- phoonnx
- TTS
- ONNX
- VITS
- 5 Min. Lesezeit
Wir stellen vor: Unsere Scraper für Musikdatenbanken
Eine Führung durch die Familie typisierter Python-Clients, die wir für Musikquellen pflegen — Bandcamp, SoundCloud, SomaFM, TuneIn, iHeartRadio und die großen Musikenzyklopädien — die allesamt konsistente, typisierte Media-Metadaten hinter einer sauberen Schnittstelle ausgeben und auf demselben regelkonformen HTTP-Transport mit niedrigem Volumen aufsetzen.
- Scrapers
- Media Metadata
- Music
- Python
- 2 Min. Lesezeit
Ein mehrsprachiger Satztypen-Datensatz: Fragen, Befehle, Aussagen
Wir haben sentence-types-multilingual veröffentlicht — fast 70.000 Sätze über sieben Sprachen, klassifiziert nach grammatischem Typ (Frage, Befehl, Aussage, Ausruf). Es ist das Trainingskorpus hinter der Routing-Bibliothek little_questions.
- Datasets
- Multilingual
- NLP
- Intent
- 6 Min. Lesezeit
Kombinierbare, direkt einsetzbare requests-Sessions für widerstandsfähigen Zugriff auf öffentliche Daten
Zwei kombinierbare requests.Session-Subklassen, um öffentliche Webseiten zuverlässig zu lesen, ohne im heißen Pfad einen Headless-Browser zu starten: TLS-kompatibler Transport, ein FlareSolverr-Proxy für JS-Challenges, ein Wayback-Machine-Fallback und IP-diversifizierte Anfragen — unblock_requests und anon_requests.
- HTTP
- Scraping
- Cloudflare
- Anti-Bot
- 3 Min. Lesezeit
Robots.txt, Sitemaps und ethisches Web-Scraping
Bevor Sie einen Scraper bauen, erkunden Sie die Website. sitemapper liest robots.txt, ruft jede Sitemap ab und crawlt optional den Linkgraphen — sodass Ihr Scraper vom eigenen Vertrag der Website ausgeht statt von roher Gewalt.
- Web Scraping
- Sitemaps
- Ethics
- Robots.txt
- 5 Min. Lesezeit
Klassisches NLP für Portugiesisch: Silbentrennung und Graphem-zu-Phonem
Ein Blick auf unseren regelbasierten, vollständig offline arbeitenden portugiesischen NLP-Stack — silabificador für die Silbentrennung und TugaPhone für dialektbewusstes Graphem-zu-Phonem — und wie sie mit der breiteren orthography2ipa-Arbeit für lusophone Varietäten zusammenhängen. Keine Deep-Learning-Blackboxen: deterministisch, schnell und abhängigkeitsarm.
- NLP
- Portuguese
- Phonemization
- Grapheme-to-Phoneme
- 8 Min. Lesezeit
Graphem-zu-IPA für 820 Sprachen
orthography2ipa ist eine rein datenbasierte, linguistisch fundierte Ressource, die Schreibweise auf IPA abbildet und modelliert, wie Phoneme über 909 Sprachspezifikationen, 820 Sprachen und mehr als 20 Sprachfamilien hinweg als Allophone auftreten. Ein Kandidatengitter, dialektale Abstammung und ein schemavalidierter, mit der dialektologischen Literatur belegter Spezifikationssatz — keine trainierten Gewichte, vollständig selbst hostbar.
- G2P
- IPA
- Phonetics
- NLP
- 2 Min. Lesezeit
Der erste Phonemizer für Barranquenho
g2p_barranquenho ist der erste offene Graphem-zu-Phonem-Konverter für Barranquenho, die iberoromanische Kontaktsprache von Barrancos, Portugal — die Regeln stammen aus der neu veröffentlichten orthografischen Konvention der Gemeinde und sind anhand der beigefügten Quellen überprüfbar.
- Phonemization
- Barranquenho
- Minority Languages
- NLP
- 3 Min. Lesezeit
Stimmen für bedrohte Sprachen klonen: Ein Text-to-Speech-Modell für Asturisch und Aragonesisch
Wir veröffentlichen experimentelle Text-to-Speech-Modelle für Asturisch (ast) und Aragonesisch (an) — zwei romanische Minderheitensprachen ohne nennenswerte kommerzielle Sprachabdeckung — erstellt mit einer hybriden Pipeline: gefilterte Common-Voice-Daten, Zero-Shot-Revoicing und VITS-Training über phoonnx.
- TTS
- Asturian
- Aragonese
- Minority Languages
- 3 Min. Lesezeit
OVOS & HiveMind in der Fertigungsindustrie
Die EU-Projekte COALA und WASABI haben ein komplettes industrielles Sprachassistenten-Framework rund um OVOS + HiveMind aufgebaut und diese mit ihren eigenen Werkzeugen, ihrer Benutzeroberfläche und ihren Konversations-Engines integriert.
- OVOS
- HiveMind
- Industry
- manufacturing
- 1 Min. Lesezeit
Synthetische Wakeword-Datensätze: Sieben Assistentennamen, ein Detektor
Wir haben sieben synthetische Wakeword-Datensätze für gängige Sprachassistentennamen veröffentlicht — hey_computer, hey_mycroft, hey_siri, alexa, home_assistant, voice_assistant, wake_up. Trainieren Sie einen Detektor, der überall funktioniert.
- Datasets
- Wakewords
- Speech
- Synthetic
- 3 Min. Lesezeit
Wir stellen phoonnx vor: OpenVoiceOS' neues TTS-Framework
phoonnx ist nun das primäre Text-to-Speech-Framework für OpenVoiceOS — ein vollständiger VITS/ONNX-Trainings- und Inferenz-Stack — beginnend mit neuen baskischen Stimmen für Miro und Dii.
- phoonnx
- TTS
- OVOS
- ONNX
- 4 Min. Lesezeit
OpenVoiceOS und Home Assistant: Ein Traumteam der Sprachautomatisierung
Home Assistant übernimmt die Automatisierung; OVOS übernimmt die Sprache. Drei Integrationsebenen lassen die Kombination funktionieren: Wyoming-Brücken für die Sprachpipeline von HA, ovos-persona-server als Konversationsagent und HiveMind, um OVOS-Geräte als native HA-Entitäten sichtbar zu machen.
- OVOS
- Home Assistant
- Smart Home
- Voice Automation
- 2 Min. Lesezeit
Synthetische Stimmen von Grund auf erstellen
Eine Stimme für ein Text-to-Speech-System zu erstellen erfordert normalerweise, dass eine reale Person stundenlang Audio aufnimmt. Das ist teuer, zeitaufwendig, und in vielen Sprachen oder Akzenten existieren die Stimmen schlicht gar nicht
- TTS
- Synthetic Data
- Voice Cloning
- OVOS
- 2 Min. Lesezeit
Miro-&-Dii-TTS-Trainingsdaten: 40 offene Datensätze in 20 Locales
Wir haben 40 synthetische Trainingsdatensätze für die Stimmen Miro und Dii in Portugiesisch, Niederländisch, Deutsch, Französisch, Italienisch, Japanisch, Spanisch und mehr veröffentlicht. Voice Cloning im großen Maßstab: Jede Sprache erhält zwei konsistente Identitäten.
- TTS
- Voice
- Datasets
- Miro & Dii
- 2 Min. Lesezeit
Keine Sprache zurücklassen
Beseitigung von Sprachbarrieren in OpenVoiceOS durch Spracherkennung, Übersetzungs-Plugins und bidirektionale Übersetzungsfunktionen.
- OVOS
- multilingual
- language-detection
- translation