Escritos
Desde el taller
Notas sobre IA de voz, desarrollo de OpenVoiceOS, datos sintéticos y tecnología del habla para lenguas minoritarias.
- 8 min de lectura
Exportar y Cuantizar Modelos de Voz Abiertos para que Realmente Funcionen
Un modelo de voz entrenado en una página de investigación de GitHub no es un asistente de voz. Convertimos checkpoints abiertos de ASR y TTS a ONNX, CoreML y GGUF, los cuantizamos y validamos la salida — y luego publicamos los resultados bajo OpenVoiceOS para que cada lengua que cubren llegue a un asistente real y sin conexión.
- ONNX
- CoreML
- GGUF
- ASR
- 19 min de lectura
Portar con Máquinas, y la Pregunta de Licencia que No Pudimos Responder
Reescribimos varios programas en C, C++ y Java — el G2P de espeak-ng, Cotovía, AhoTTS, HermiT — como Python puro, con una IA leyendo el código fuente original y un humano orquestando el trabajo. Nadie de nuestro lado leyó los originales. Eso plantea dos preguntas separadas: ¿puede el resultado ser propiedad de alguien siquiera, y es una obra derivada de la entrada? Mantuvimos las licencias originales porque era más barato que responder. Seguimos pensando que la pregunta está abierta.
- FOSS
- Licensing
- Open Source
- Python
- 10 min de lectura
Una Familia de Bibliotecas de Voz en ONNX Puro
TigreGótico mantiene un conjunto de bibliotecas de voz — extensión de ancho de banda, clonación de voz, embeddings de hablante, VAD, acentuación de palabras, fonemización, TTS y una biblioteca de métricas para puntuarlas todas — que comparten una regla en tiempo de ejecución: solo onnxruntime y numpy, sin PyTorch, sin GPU necesaria.
- ONNX
- TTS
- voice cloning
- VAD
- 12 min de lectura
Cómo Encaja la Pila de Fonología
Un recorrido arquitectónico por nuestra pila de texto a pronunciación: scriptconv para la notación, orthography2ipa como motor translingüe de grafema a IPA, frontends específicos por lengua construidos sobre él para portugués, euskera, mirandés, barranqueño y árabe, y phonematcher para la búsqueda basada en sonido. Explica por qué existen las capas, qué es un enrejado de candidatos, y salida real por dialecto.
- G2P
- IPA
- Phonetics
- NLP
- 11 min de lectura
Eligiendo un Motor de Clonación de Voz
voiceclonnx ejecuta 10 motores de conversión de voz tras una sola API, desde el intercambio de características kNN hasta el codec-LM autorregresivo. Esta es una guía de las familias de modelos que hay detrás, el compromiso real medido entre inteligibilidad y similitud de hablante, y cómo elegir un motor para un trabajo concreto.
- ONNX
- voice cloning
- voice conversion
- self-hosted
- 11 min de lectura
Limpiando Audio Deficiente: Eliminación de Ruido y Extensión de Ancho de Banda en audiosronnx
Un análisis en profundidad de las dos tareas independientes de audiosronnx — eliminar ruido y reconstruir frecuencias altas ausentes — con el registro real de motores, tamaños y licencias de los modelos, la lista de modelos rechazados, y cómo comprobar si la salida realmente mejoró.
- ONNX
- denoising
- bandwidth extension
- speech
- 10 min de lectura
Medir la Calidad del Habla Sin un Panel de Escucha
Una guía práctica de speechonnxmetrics: qué miden realmente el MOS, los predictores de MOS sin referencia, las métricas intrusivas de señal y el WER/CER basado en ASR, cuándo aplica cada uno, puntuaciones reales de audio real, y por qué un MOS predicho es evidencia, no verdad.
- speechonnxmetrics
- TTS
- ONNX
- evaluation
- 8 min de lectura
Escrituras y Notaciones Fonéticas: Qué Convierte Realmente scriptconv
Un análisis en profundidad de scriptconv, la biblioteca sin dependencias que detecta sistemas de escritura y convierte entre notaciones fonéticas. Cubre IPA, ARPABET y X-SAMPA; detección de escritura ISO-15924; transliteración Buckwalter para el árabe; descomposición de hangul en jamo; y conversión de kana, con ejemplos reales, ejecutados, y límites honestos.
- IPA
- Phonetics
- NLP
- Linguistics
- 12 min de lectura
Tu modelo de sentimientos no distingue una queja de una despedida
Dos mensajes de soporte que parecen furiosos. Un cliente está a punto de escalar; el otro está a punto de irse sin decir palabra. Casi ningún modelo de emociones puede distinguirlos — porque a todos les falta el mismo eje. Presentamos emotion-algebra.
- Affective Computing
- Emotion
- Machine Learning
- LILACS
- 5 min de lectura
Por Qué Acumulamos Datos: De Catálogos Extraídos a Modelos de Voz y Lenguaje Más Inteligentes
Datos limpios, tipados y con procedencia clara son la materia prima de todos los modelos que publicamos. Cómo los catálogos que construyen nuestros scrapers se convierten en vocabularios de sesgo para ASR, clasificadores de intención, corpus sintéticos de NER, léxicos G2P, voces TTS — y combustible honesto para LLM.
- Datasets
- Data Collection
- ASR
- NLP
- 7 min de lectura
Si Todos Publican una App, Nosotros Publicaremos Voz: Convertir Sitios Web en Apps de Voz
Todo sitio que importa acabó envuelto en una app móvil. Proponemos el movimiento opuesto para la era de la voz y la CLI: una API limpia más una skill de voz por sitio, para que la web se pueda navegar de oído y con el teclado. Un sitio cada vez, suma hasta un navegador de voz.
- Voice
- Accessibility
- OpenVoiceOS
- Web Automation
- 2 min de lectura
Usenet en 2026: un corpus de texto limpio y previo a la IA para entrenamiento y evaluación
Usenet es un archivo prístino del discurso humano previo a la IA — décadas de publicaciones en grupos de noticias, todas escritas por humanos, ninguna tocada por modelos de lenguaje. Eso lo convierte en datos valiosos de entrenamiento y evaluación para modelos de lenguaje y de voz. Construimos una pequeña herramienta en Python para recolectarlo.
- Usenet
- Datasets
- NLP
- 4 min de lectura
Dos Voces, Todas las Lenguas: Miro y Dii
TigreGótico se asocia con OpenVoiceOS para dar al asistente dos identidades de voz consistentes — Miro y Dii — que suenan igual en todas las lenguas, construidas con nuestra tecnología de clonación de voz y el motor phoonnx. Dos modelos de TTS para cada lengua que alguien solicite, lenguas en peligro incluidas.
- phoonnx
- TTS
- OVOS
- voice cloning
- 5 min de lectura
Decirlo Bien: Desambiguar Heterófonos del Portugués para TTS
Muchas palabras del portugués europeo se escriben igual pero se pronuncian de forma diferente según su significado — y equivocar la vocal hace que una voz TTS diga la palabra equivocada. Construimos bifonia-pt-homographs, un conjunto de datos abierto etiquetado por significado con 56 891 frases sobre 27 palabras, y un resolutor diminuto y sin dependencias que alcanza ≈94 % donde los etiquetadores POS pesados se estancan en ≈75 %.
- Datasets
- Portuguese
- TTS
- Grapheme-to-Phoneme
- 5 min de lectura
Modelos de TTS que Funcionan en una Patata
phoonnx es un framework de investigación para síntesis de voz basada en VITS, construido para funcionar cómodamente en hardware modesto. Sin GPU, sin nube, sin clave de API — solo una voz ONNX de ~15,65 millones de parámetros y una CPU. Aquí explicamos lo pequeña que puede ser una buena voz, y cómo las entrenamos.
- phoonnx
- TTS
- ONNX
- VITS
- 7 min de lectura
Presentamos nuestros scrapers de bases de datos de música
Un recorrido por la familia de clientes Python tipados que mantenemos para fuentes de música — Bandcamp, SoundCloud, SomaFM, TuneIn, iHeartRadio y las grandes enciclopedias musicales — todos emitiendo metadatos de medios consistentes y tipados tras una única interfaz limpia y circulando sobre el mismo transporte HTTP conforme y de bajo volumen.
- Scrapers
- Media Metadata
- Music
- Python
- 3 min de lectura
Un dataset multilingüe de tipos de oración: preguntas, órdenes, afirmaciones
Publicamos sentence-types-multilingual — casi 70.000 oraciones en siete lenguas, clasificadas por tipo gramatical (pregunta, orden, afirmación, exclamación). Es el corpus de entrenamiento tras la biblioteca de enrutamiento little_questions.
- Datasets
- Multilingual
- NLP
- Intent
- 7 min de lectura
Sesiones requests componibles y directas para un acceso resiliente a datos públicos
Dos subclases componibles de requests.Session para leer páginas web públicas de forma fiable sin un navegador headless en la ruta caliente: transporte compatible con TLS, un proxy FlareSolverr para los desafíos JS, un respaldo a Wayback Machine, y peticiones con IP diversificada — unblock_requests y anon_requests.
- HTTP
- Scraping
- Cloudflare
- Anti-Bot
- 4 min de lectura
Robots.txt, sitemaps y scraping web ético
Antes de construir un scraper, explora el sitio. sitemapper lee robots.txt, obtiene todos los sitemaps y, opcionalmente, rastrea el grafo de enlaces — para que tu scraper parta del propio contrato del sitio en vez de la fuerza bruta.
- Web Scraping
- Sitemaps
- Ethics
- Robots.txt
- 6 min de lectura
NLP clásico para el portugués: silabificación y grafema a fonema
Un vistazo a nuestra pila de NLP para el portugués, basada en reglas y totalmente sin conexión — silabificador para la silabificación y TugaPhone para el grafema a fonema con conciencia dialectal — y cómo se conectan con el trabajo más amplio de orthography2ipa para las variedades lusófonas. Sin cajas negras de aprendizaje profundo: determinista, rápido y con pocas dependencias.
- NLP
- Portuguese
- Phonemization
- Grapheme-to-Phoneme
- 10 min de lectura
Grafema a IPA para 820 lenguas
orthography2ipa es un recurso de datos puros, con fundamento lingüístico, que mapea la ortografía a IPA y modela cómo los fonemas se realizan como alófonos a lo largo de 909 especificaciones, 820 lenguas y más de 20 familias lingüísticas. Enrejado de candidatos, tokenizador de máxima coincidencia, métricas de distancia fonológica y de escritura, linaje dialectal, y especificaciones citadas a la literatura dialectológica — sin pesos entrenados, totalmente autoalojable.
- G2P
- IPA
- Phonetics
- NLP
- 2 min de lectura
Presentamos el primer fonemizador para el barranqueño
g2p_barranquenho es el primer conversor abierto de grafema a fonema para el barranqueño, la lengua de contacto iberorrománica de Barrancos, Portugal — reglas derivadas de la recién publicada convención ortográfica del municipio, auditables frente a las fuentes incluidas en el repositorio.
- Phonemization
- Barranquenho
- Minority Languages
- NLP
- 3 min de lectura
Clonar voces para lenguas amenazadas: construir un modelo de texto a voz para el asturiano y el aragonés
Publicamos modelos experimentales de texto a voz para el asturiano (ast) y el aragonés (an) — dos lenguas románicas minoritarias sin prácticamente ninguna cobertura de voz comercial — construidos con una pipeline híbrida: datos filtrados de Common Voice, revocalización zero-shot y entrenamiento VITS mediante phoonnx.
- TTS
- Asturian
- Aragonese
- Minority Languages
- 3 min de lectura
OVOS y HiveMind en la Industria Manufacturera
Los proyectos europeos COALA y WASABI han construido todo un framework de asistente de voz industrial en torno a OVOS + HiveMind, integrándolos con sus propias herramientas, interfaz y motores de conversación.
- OVOS
- HiveMind
- Industry
- manufacturing
- 1 min de lectura
Datasets Sintéticos de Wakeword: Siete Nombres de Asistente, Un Detector
Hemos publicado siete datasets sintéticos de wakeword para nombres comunes de asistentes de voz — hey_computer, hey_mycroft, hey_siri, alexa, home_assistant, voice_assistant, wake_up. Entrena un detector que funciona en todas partes.
- Datasets
- Wakewords
- Speech
- Synthetic
- 4 min de lectura
Presentamos phoonnx: El Nuevo Framework de TTS de OpenVoiceOS
phoonnx es ahora el framework principal de text-to-speech de OpenVoiceOS — una stack completa de entrenamiento e inferencia VITS/ONNX — comenzando por nuevas voces en euskera para Miro y Dii.
- phoonnx
- TTS
- OVOS
- ONNX
- 5 min de lectura
OpenVoiceOS y Home Assistant: El Equipo de Ensueño de la Automatización por Voz
Home Assistant se encarga de la automatización; OVOS se encarga de la voz. Tres capas de integración hacen que la combinación funcione: puentes Wyoming para la canalización de voz de HA, ovos-persona-server como agente conversacional y HiveMind para exponer los dispositivos OVOS como entidades nativas de HA.
- OVOS
- Home Assistant
- Smart Home
- Voice Automation
- 2 min de lectura
Crear Voces Sintéticas desde Cero
Crear una voz para un sistema de texto a voz normalmente exige que una persona real dedique horas a grabar audio. Eso es caro, lento y, en muchos idiomas o acentos, las voces sencillamente no existen
- TTS
- Synthetic Data
- Voice Cloning
- OVOS
- 2 min de lectura
Datos de Entrenamiento de TTS Miro & Dii: 40 Datasets Abiertos en 20 Locales
Hemos publicado 40 datasets de entrenamiento sintéticos para las voces Miro y Dii en portugués, neerlandés, alemán, francés, italiano, japonés, español y más. Clonación de voz a escala: cada idioma obtiene dos identidades consistentes.
- TTS
- Voice
- Datasets
- Miro & Dii
- 3 min de lectura
Ninguna Lengua Dejada Atrás
Eliminar las barreras lingüísticas en OpenVoiceOS mediante la detección de idioma, los plugins de traducción y las capacidades de traducción bidireccional.
- OVOS
- multilingual
- language-detection
- translation