Écrits
Depuis l'atelier
Notes sur l'IA vocale, le développement d'OpenVoiceOS, les données synthétiques et la technologie vocale pour les langues minoritaires.
- 8 min de lecture
Exporter et quantifier des modèles de parole ouverts pour qu'ils tournent vraiment
Un modèle de parole entraîné sur une page GitHub de recherche n'est pas un assistant vocal. Nous convertissons des checkpoints ASR et TTS ouverts vers ONNX, CoreML et GGUF, nous les quantifions et validons la sortie — puis publions les résultats sous OpenVoiceOS afin que chaque langue couverte s'exécute dans un véritable assistant hors ligne.
- ONNX
- CoreML
- GGUF
- ASR
- 20 min de lecture
Porter avec des machines, et la question de licence à laquelle nous n'avons pas pu répondre
Nous avons réécrit plusieurs programmes en C, C++ et Java — le G2P d'espeak-ng, Cotovia, AhoTTS, HermiT — en Python pur, avec une IA lisant la source et un humain orchestrant. Cela soulève deux questions : le résultat peut-il être possédé, et est-il une œuvre dérivée ? Nous avons gardé les licences amont, faute de mieux.
- FOSS
- Licensing
- Open Source
- Python
- 10 min de lecture
Une famille de bibliothèques de parole en ONNX pur
TigreGótico maintient un ensemble de bibliothèques de parole — extension de bande passante, clonage vocal, empreintes de locuteur, VAD, accentuation lexicale, phonémisation, TTS, et une bibliothèque de métriques pour toutes les évaluer — qui partagent une seule règle d'exécution : uniquement onnxruntime et numpy, pas de PyTorch, aucun GPU requis.
- ONNX
- TTS
- voice cloning
- VAD
- 12 min de lecture
Comment s'articule notre pile de phonologie
Une visite architecturale de notre pile texte-vers-prononciation : scriptconv pour la notation, orthography2ipa comme moteur graphème-vers-IPA multilingue, des frontends spécifiques à chaque langue construits par-dessus pour le portugais, le basque, le mirandais, le barranquenho et l'arabe, et phonematcher pour la recherche fondée sur le son. Explique pourquoi ces couches existent, ce qu'est un treillis de candidats, et donne des sorties dialectales réelles.
- G2P
- IPA
- Phonetics
- NLP
- 11 min de lecture
Choisir un moteur de clonage vocal
voiceclonnx fait tourner 10 moteurs de conversion vocale derrière une seule API, du feature-swap kNN au codec-LM autorégressif. Voici un guide des familles de modèles derrière eux, le vrai compromis mesuré entre intelligibilité et similarité de locuteur, et comment choisir un moteur pour une tâche précise.
- ONNX
- voice cloning
- voice conversion
- self-hosted
- 11 min de lecture
Nettoyer un audio dégradé : débruitage et extension de bande passante dans audiosronnx
Une plongée dans les deux tâches distinctes d'audiosronnx — retirer le bruit et reconstruire les hautes fréquences manquantes — avec le vrai registre de moteurs, les tailles de modèles et licences, la liste des modèles rejetés, et comment vérifier si la sortie s'est réellement améliorée.
- ONNX
- denoising
- bandwidth extension
- speech
- 10 min de lecture
Mesurer la qualité de la parole sans panel d'écoute
Un guide pratique de speechonnxmetrics : ce que mesurent réellement le MOS, les prédicteurs MOS sans référence, les métriques de signal intrusives et le WER/CER basé sur l'ASR, quand chacun s'applique, de vrais scores sur de vrais audios, et pourquoi un MOS prédit est une preuve, pas une vérité.
- speechonnxmetrics
- TTS
- ONNX
- evaluation
- 9 min de lecture
Écritures et notations phonétiques : ce que convertit réellement scriptconv
Une plongée dans scriptconv, la bibliothèque sans dépendance qui détecte les systèmes d'écriture et convertit entre notations phonétiques. Couvre l'IPA, l'ARPABET et le X-SAMPA ; la détection de script ISO-15924 ; la translittération Buckwalter pour l'arabe ; la décomposition du hangeul en jamo ; et la conversion des kana, avec de vrais exemples exécutés et des limites honnêtement énoncées.
- IPA
- Phonetics
- NLP
- Linguistics
- 13 min de lecture
Votre modèle de sentiment ne sait pas distinguer une plainte d'un au revoir
Deux messages de support qui ont l'air en colère. L'un est sur le point d'escalader ; l'autre est sur le point de partir sans un mot. Presque aucun modèle d'émotion ne peut les distinguer — parce qu'ils leur manquent tous le même axe. Présentation de emotion-algebra.
- Affective Computing
- Emotion
- Machine Learning
- LILACS
- 5 min de lecture
Pourquoi nous accumulons les données : des catalogues extraits aux modèles de parole et de langage plus intelligents
Des données propres, typées et à la provenance bien établie sont la matière première de chaque modèle que nous livrons. Comment les catalogues que construisent nos scrapers deviennent des vocabulaires de biasing pour l'ASR, des classificateurs d'intention, des corpus NER synthétiques, des lexiques G2P, des voix TTS — et un carburant honnête pour les LLM.
- Datasets
- Data Collection
- ASR
- NLP
- 7 min de lecture
Si tout le monde lance une app, nous lancerons la voix : transformer les sites web en applications vocales
Chaque site qui compte a fini enveloppé dans une app mobile. Nous proposons le mouvement inverse pour l'ère de la voix et de la ligne de commande : une API propre plus une skill vocale par site, pour que le web devienne navigable à l'oreille et au clavier. Un site à la fois, tout cela finit par former un navigateur vocal.
- Voice
- Accessibility
- OpenVoiceOS
- Web Automation
- 2 min de lecture
Usenet en 2026 : un corpus de texte propre et d'avant l'IA pour l'entraînement et l'évaluation
Usenet est une archive intacte du discours humain d'avant l'IA — des décennies de messages de newsgroups, tous écrits par des humains, aucun touché par des modèles de langage. Cela en fait des données précieuses d'entraînement et d'évaluation pour les modèles de langue et de parole. Nous avons construit un petit outil Python pour la collecter.
- Usenet
- Datasets
- NLP
- 4 min de lecture
Deux voix, toutes les langues : Miro & Dii
TigreGótico s'associe à OpenVoiceOS pour doter l'assistant de deux identités vocales cohérentes — Miro et Dii — qui sonnent de la même façon dans chaque langue, construites avec notre technologie de clonage vocal et le moteur phoonnx. Deux modèles de TTS pour chaque langue demandée, langues menacées comprises.
- phoonnx
- TTS
- OVOS
- voice cloning
- 5 min de lecture
Le dire correctement : désambiguïser les hétérophones portugais pour la TTS
De nombreux mots du portugais européen s'écrivent de la même façon mais se prononcent différemment selon le sens — et se tromper de voyelle fait dire le mauvais mot à une voix de TTS. Nous avons construit bifonia-pt-homographs, un jeu de données ouvert étiqueté par sens de 56 891 phrases sur 27 mots, et un résolveur minuscule et sans aucune dépendance qui atteint ≈94 % là où les étiqueteurs morphosyntaxiques lourds plafonnent à ≈75 %.
- Datasets
- Portuguese
- TTS
- Grapheme-to-Phoneme
- 5 min de lecture
Des modèles de TTS qui tournent sur une patate
phoonnx est un cadriciel de recherche pour la synthèse vocale basée sur VITS, conçu pour tourner confortablement sur du matériel bas de gamme. Pas de GPU, pas de cloud, pas de clé d'API — juste une voix ONNX d'environ 15,65 millions de paramètres et un CPU. Voici à quel point une bonne voix peut être petite, et comment nous les entraînons.
- phoonnx
- TTS
- ONNX
- VITS
- 7 min de lecture
Nous vous présentons nos scrapers de bases de données musicales
Une visite guidée de la famille de clients Python typés que nous maintenons pour les sources musicales — Bandcamp, SoundCloud, SomaFM, TuneIn, iHeartRadio, et les grandes encyclopédies musicales — tous produisant des métadonnées média cohérentes et typées derrière une interface propre et unique, et roulant sur le même transport HTTP conforme et à faible volume.
- Scrapers
- Media Metadata
- Music
- Python
- 3 min de lecture
Un jeu de données multilingue de types de phrases : questions, ordres, affirmations
Nous avons publié sentence-types-multilingual — près de 70 000 phrases dans sept langues, classées par type grammatical (question, ordre, affirmation, exclamation). C'est le corpus d'entraînement derrière la bibliothèque de routage little_questions.
- Datasets
- Multilingual
- NLP
- Intent
- 7 min de lecture
Des sessions requests composables et prêtes à l'emploi pour un accès résilient aux données publiques
Deux sous-classes composables de requests.Session pour lire de façon fiable des pages web publiques sans navigateur headless dans le chemin critique : un transport compatible TLS, un proxy FlareSolverr pour les défis JS, un repli sur la Wayback Machine et des requêtes à IP diversifiées — unblock_requests et anon_requests.
- HTTP
- Scraping
- Cloudflare
- Anti-Bot
- 4 min de lecture
Robots.txt, sitemaps et scraping web éthique
Avant de construire un scraper, faites la reconnaissance du site. sitemapper lit le robots.txt, récupère tous les sitemaps et, en option, parcourt le graphe de liens — pour que votre scraper parte du propre contrat du site plutôt que de la force brute.
- Web Scraping
- Sitemaps
- Ethics
- Robots.txt
- 6 min de lecture
NLP classique pour le portugais : syllabation et graphème-vers-phonème
Un aperçu de notre stack de NLP portugais fondée sur des règles et entièrement hors ligne — silabificador pour la syllabation et TugaPhone pour la conversion graphème-vers-phonème sensible au dialecte — et de la façon dont elles se relient au travail plus large d'orthography2ipa pour les variétés lusophones. Aucune boîte noire de deep learning : déterministe, rapide et avec peu de dépendances.
- NLP
- Portuguese
- Phonemization
- Grapheme-to-Phoneme
- 10 min de lecture
Graphème-vers-IPA pour 820 langues
orthography2ipa est une ressource en données pures, ancrée linguistiquement, qui associe l'orthographe à l'IPA et modélise la façon dont les phonèmes se réalisent en tant qu'allophones à travers 909 spécifications de langue, 820 langues et plus de 20 familles linguistiques. Un treillis de candidats, une lignée dialectale et un ensemble de spécifications validé par schéma et cité à la littérature dialectologique — sans poids entraînés, entièrement auto-hébergeable.
- G2P
- IPA
- Phonetics
- NLP
- 2 min de lecture
Présentation du premier phonémiseur pour le barranquenho
g2p_barranquenho est le premier convertisseur graphème-phonème ouvert pour le barranquenho, la langue de contact ibéro-romane de Barrancos, au Portugal — des règles dérivées de la convention orthographique récemment publiée par la municipalité, vérifiables au regard des sources incluses dans le dépôt.
- Phonemization
- Barranquenho
- Minority Languages
- NLP
- 3 min de lecture
Cloner des voix pour les langues menacées : construire un modèle de synthèse vocale pour l'asturien et l'aragonais
Nous publions des modèles expérimentaux de synthèse vocale pour l'asturien (ast) et l'aragonais (an) — deux langues romanes minoritaires ne bénéficiant pratiquement d'aucune couverture vocale commerciale — construits avec un pipeline hybride : données filtrées de Common Voice, revocalisation zero-shot et entraînement VITS via phoonnx.
- TTS
- Asturian
- Aragonese
- Minority Languages
- 4 min de lecture
OVOS & HiveMind dans l'industrie manufacturière
Les projets européens COALA et WASABI ont construit toute une framework d'assistant vocal industriel autour d'OVOS + HiveMind, en les intégrant avec leurs propres outils, interface et moteurs de conversation.
- OVOS
- HiveMind
- Industry
- manufacturing
- 1 min de lecture
Jeux de données de wakeword synthétiques : sept noms d'assistant, un seul détecteur
Nous avons publié sept jeux de données de wakeword synthétiques pour des noms d'assistant vocal courants — hey_computer, hey_mycroft, hey_siri, alexa, home_assistant, voice_assistant, wake_up. Entraînez un détecteur qui fonctionne partout.
- Datasets
- Wakewords
- Speech
- Synthetic
- 4 min de lecture
Présentation de phoonnx : le nouveau framework TTS d'OpenVoiceOS
phoonnx est désormais la principale framework de synthèse vocale d'OpenVoiceOS — une stack complète d'entraînement et d'inférence VITS/ONNX — à commencer par de nouvelles voix en basque pour Miro et Dii.
- phoonnx
- TTS
- OVOS
- ONNX
- 5 min de lecture
OpenVoiceOS et Home Assistant : l'équipe de rêve de l'automatisation vocale
Home Assistant gère l'automatisation ; OVOS gère la voix. Trois couches d'intégration font fonctionner la combinaison : les ponts Wyoming pour le pipeline vocal de HA, ovos-persona-server comme agent conversationnel, et HiveMind pour exposer les appareils OVOS en tant qu'entités natives de HA.
- OVOS
- Home Assistant
- Smart Home
- Voice Automation
- 2 min de lecture
Créer des voix synthétiques de toutes pièces
Créer une voix pour un système de synthèse vocale exige normalement qu'une personne réelle passe des heures à enregistrer de l'audio. C'est coûteux, long, et dans de nombreuses langues ou accents les voix n'existent tout simplement pas
- TTS
- Synthetic Data
- Voice Cloning
- OVOS
- 2 min de lecture
Données d'entraînement TTS Miro & Dii : 40 datasets ouverts pour 20 locales
Nous avons publié 40 datasets d'entraînement synthétiques pour les voix Miro et Dii en portugais, néerlandais, allemand, français, italien, japonais, espagnol et bien d'autres. Le clonage vocal à grande échelle : chaque langue reçoit deux identités cohérentes.
- TTS
- Voice
- Datasets
- Miro & Dii
- 3 min de lecture
Aucune langue laissée pour compte
Éliminer les barrières linguistiques dans OpenVoiceOS grâce à la détection de langue, aux plugins de traduction et aux capacités de traduction bidirectionnelle.
- OVOS
- multilingual
- language-detection
- translation