Escrita
Da oficina
Notas sobre IA de voz, desenvolvimento do OpenVoiceOS, dados sintéticos e tecnologia de fala para línguas minoritárias. Os artigos são publicados em inglês.
- 7 min de leitura
Exportar e Quantizar Modelos de Fala Abertos Para Que Realmente Funcionem
Um modelo de fala treinado numa página de investigação do GitHub não é um assistente de voz. Convertemos checkpoints abertos de ASR e TTS para ONNX, CoreML e GGUF, quantizamo-los e validamos o resultado. Depois publicamos os resultados sob o OpenVoiceOS para que cada língua que cobrem chegue a um assistente real e offline.
- ONNX
- CoreML
- GGUF
- ASR
- 13 min de leitura
Portar com Máquinas, e a Questão de Licenciamento que Não Conseguimos Responder
Reescrevemos vários programas em C, C++ e Java (o G2P do espeak-ng, o Cotovía, o AhoTTS, o HermiT) como Python puro, com uma IA a ler o código-fonte original e um humano a orquestrar. Ninguém do nosso lado leu os originais. Isso levanta duas questões separadas: o resultado pode sequer ser propriedade de alguém, e é derivado do que lhe deu origem? Mantivemos as licenças a montante porque isso saiu mais barato do que responder. Continuamos a achar que a questão está em aberto.
- FOSS
- Licensing
- Open Source
- Python
- 10 min de leitura
Uma Família de Bibliotecas de Fala em ONNX Puro
A TigreGótico mantém um conjunto de bibliotecas de fala — extensão de largura de banda, clonagem de voz, embeddings de locutor, VAD, acento tónico, fonemização, TTS, e uma biblioteca de métricas para as avaliar a todas — que partilham uma regra de runtime: apenas onnxruntime e numpy, sem PyTorch, sem necessidade de GPU.
- ONNX
- TTS
- voice cloning
- VAD
- 12 min de leitura
Como a Stack de Fonologia se Encaixa
Uma visita à arquitetura da nossa stack de texto-para-pronúncia: o scriptconv para notação, o orthography2ipa como motor interlinguístico de grafema-para-IPA, frontends específicos de língua construídos sobre ele para português, basco, mirandês, barranquenho e árabe, e o phonematcher para pesquisa baseada em som. Mostra porque existem as camadas, o que é uma lattice de candidatos, e resultados reais por dialeto.
- G2P
- IPA
- Phonetics
- NLP
- 11 min de leitura
Escolher um Motor de Clonagem de Voz
O voiceclonnx corre 10 motores de conversão de voz por trás de uma única API, desde troca de características kNN até AR codec-LM. Isto é um guia às famílias de modelos por trás deles, ao verdadeiro compromisso medido entre inteligibilidade e semelhança de locutor, e a como escolher um motor para uma tarefa específica.
- ONNX
- voice cloning
- voice conversion
- self-hosted
- 11 min de leitura
Limpar Áudio Mau: Redução de Ruído e Extensão de Largura de Banda no audiosronnx
O audiosronnx trata a redução de ruído e a extensão de largura de banda como duas tarefas separadas: o registo real de motores, tamanhos e licenças de modelos, a lista de modelos rejeitados, e como verificar se o resultado realmente melhorou.
- ONNX
- denoising
- bandwidth extension
- speech
- 10 min de leitura
Medir a Qualidade da Fala Sem um Painel de Audição
Um guia prático ao speechonnxmetrics: o que o MOS, os preditores de MOS sem referência, as métricas intrusivas de sinal e o WER/CER baseado em ASR realmente medem, quando cada um se aplica, pontuações reais de áudio real, e porque um MOS previsto é evidência, não verdade.
- speechonnxmetrics
- TTS
- ONNX
- evaluation
- 8 min de leitura
Escritas e Notações Fonéticas: O Que o scriptconv Realmente Converte
Uma visita ao scriptconv, a biblioteca sem dependências que deteta sistemas de escrita e converte entre notações fonéticas. Cobre IPA, ARPABET e X-SAMPA, deteção de escrita ISO-15924, transliteração Buckwalter para árabe, decomposição de Hangul em jamo, e conversão de kana, com exemplos reais e executados e limites honestos.
- IPA
- Phonetics
- NLP
- Linguistics
- 12 min de leitura
O teu modelo de sentimento não distingue uma queixa de uma despedida
Duas mensagens de apoio ao cliente com ar zangado. Um cliente está prestes a escalar; o outro está prestes a ir-se embora sem dizer nada. Quase nenhum modelo de emoções os consegue distinguir — porque falta-lhes a todos o mesmo eixo. Apresentamos a emotion-algebra.
- Affective Computing
- Emotion
- Machine Learning
- LILACS
- 5 min de leitura
Porque Acumulamos Dados: De Catálogos Extraídos a Modelos de Fala e Linguagem Mais Inteligentes
Dados limpos, tipados e com boa proveniência são a matéria-prima de todos os modelos que disponibilizamos. Como os catálogos que os nossos scrapers constroem se tornam vocabulários de biasing para ASR, classificadores de intenção, corpora sintéticos de NER, léxicos de G2P, vozes de TTS, e combustível honesto para LLMs.
- Datasets
- Data Collection
- ASR
- NLP
- 7 min de leitura
Se Toda a Gente Lança uma App, Nós Lançamos Voz: Transformar Websites em Aplicações de Voz
Todos os sites que importam acabaram embrulhados numa app móvel. Propomos o movimento inverso para a era da voz e da linha de comandos: uma API limpa mais uma skill de voz por site, para que a web se torne navegável de ouvido e por teclado. Um site de cada vez, tudo somado dá um navegador de voz.
- Voice
- Accessibility
- OpenVoiceOS
- Web Automation
- 2 min de leitura
A Usenet em 2026: um corpus de texto limpo e pré-IA para treino e avaliação
A Usenet é um arquivo intacto do discurso humano pré-IA: décadas de publicações em newsgroups, tudo escrito por humanos, nada disso tocado por modelos de linguagem. Isso torna-a valiosa como dados de treino e avaliação para modelos de linguagem e de fala. Construímos uma pequena ferramenta em Python para a recolher.
- Usenet
- Datasets
- NLP
- 3 min de leitura
Duas Vozes, Todas as Línguas: Miro & Dii
A TigreGótico está a associar-se ao OpenVoiceOS para dar ao assistente duas identidades de voz consistentes, Miro e Dii, que soam da mesma forma em todas as línguas, construídas com a nossa tecnologia de clonagem de voz e o motor phoonnx. Dois modelos de TTS para cada língua que alguém peça, línguas ameaçadas incluídas.
- phoonnx
- TTS
- OVOS
- voice cloning
- 5 min de leitura
Dizê-lo Corretamente: Desambiguar Heterófonos do Português para TTS
Muitas palavras do português europeu escrevem-se da mesma forma mas pronunciam-se de modo diferente consoante o significado, e errar a vogal faz uma voz de TTS dizer a palavra errada. Construímos o bifonia-pt-homographs, um dataset aberto e anotado por significado com 56.891 frases sobre 27 palavras, e um resolvedor minúsculo e sem dependências que atinge ≈94% onde etiquetadores morfossintáticos pesados estagnam nos ≈75%.
- Datasets
- Portuguese
- TTS
- Grapheme-to-Phoneme
- 5 min de leitura
Modelos de TTS Que Correm numa Batata
O phoonnx é um framework de investigação para síntese de fala baseada em VITS, construído para correr confortavelmente em hardware modesto. Sem GPU, sem nuvem, sem chave de API: apenas uma voz ONNX de ~15,65 milhões de parâmetros e um CPU. Aqui fica quão pequena pode ser uma boa voz, e como as treinamos.
- phoonnx
- TTS
- ONNX
- VITS
- 6 min de leitura
Apresentamos os Nossos Scrapers de Bases de Dados de Música
Uma visita guiada à família de clientes Python tipados que mantemos para fontes de música — Bandcamp, SoundCloud, SomaFM, TuneIn, iHeartRadio, e as grandes enciclopédias musicais — todos a emitir metadados de media consistentes e tipados por trás de uma interface limpa e a andar sobre o mesmo transporte HTTP conforme e de baixo volume.
- Scrapers
- Media Metadata
- Music
- Python
- 3 min de leitura
Um Dataset Multilingue de Tipos de Frase: Perguntas, Comandos, Afirmações
Publicámos o sentence-types-multilingual — quase 70.000 frases em sete línguas, classificadas por tipo gramatical (pergunta, comando, afirmação, exclamação). É o corpus de treino por detrás da biblioteca de encaminhamento little_questions.
- Datasets
- Multilingual
- NLP
- Intent
- 7 min de leitura
Sessões requests Componíveis e Prontas a Usar para Acesso Resiliente a Dados Públicos
Duas subclasses componíveis de requests.Session para ler páginas web públicas de forma fiável sem um navegador headless no caminho crítico: transporte compatível com TLS, um proxy FlareSolverr para desafios JS, um recurso à Wayback Machine e pedidos com IP diversificado: unblock_requests e anon_requests.
- HTTP
- Scraping
- Cloudflare
- Anti-Bot
- 4 min de leitura
Robots.txt, Sitemaps e Scraping Ético
Antes de construir um scraper, faça o reconhecimento do site. O sitemapper lê o robots.txt, obtém todos os sitemaps e, opcionalmente, percorre o grafo de ligações, para que o seu scraper parta do próprio contrato do site em vez da força bruta.
- Web Scraping
- Sitemaps
- Ethics
- Robots.txt
- 6 min de leitura
NLP Clássico para Português: Silabação e Grafema-para-Fonema
Um olhar sobre a nossa stack de NLP para português, baseada em regras e totalmente offline: o silabificador para silabação e o TugaPhone para grafema-para-fonema sensível ao dialeto, e como se ligam ao trabalho mais alargado do orthography2ipa para as variedades lusófonas. Sem caixas negras de deep learning: determinístico, rápido e com poucas dependências.
- NLP
- Portuguese
- Phonemization
- Grapheme-to-Phoneme
- 10 min de leitura
Grafema-para-IPA para 820 Línguas
O orthography2ipa é um recurso de dados puros, linguisticamente fundamentado, que mapeia a grafia para IPA e modela alofones ao longo de 909 especificações, 820 línguas e mais de 20 famílias linguísticas. Lattice de candidatos, tokenizador maximal-munch, métricas de distância e linhagem dialetal — sem pesos treinados, totalmente auto-hospedável.
- G2P
- IPA
- Phonetics
- NLP
- 2 min de leitura
Apresentamos o Primeiro Phonemizer para Barranquenho
O g2p_barranquenho é o primeiro conversor aberto de grafema-para-fonema para barranquenho, a língua de contacto ibero-românica de Barrancos, Portugal — regras derivadas da convenção ortográfica recém-publicada pelo município, auditáveis face às fontes incluídas no repositório.
- Phonemization
- Barranquenho
- Minority Languages
- NLP
- 3 min de leitura
Clonar Vozes para Línguas Ameaçadas: Construir um Modelo de Texto-para-Fala para Asturiano e Aragonês
Estamos a lançar modelos experimentais de texto-para-fala para o asturiano (ast) e o aragonês (an), duas línguas românicas minoritárias sem praticamente nenhuma cobertura de voz comercial. Construímo-los com uma pipeline híbrida: dados filtrados do Common Voice, revocalização zero-shot e treino VITS através do phoonnx.
- TTS
- Asturian
- Aragonese
- Minority Languages
- 3 min de leitura
OVOS & HiveMind na Indústria Transformadora
Os projetos europeus COALA e WASABI construíram toda uma framework de assistente de voz industrial em torno do OVOS + HiveMind, integrando-os com as suas próprias ferramentas, interface e motores de conversação.
- OVOS
- HiveMind
- Industry
- manufacturing
- 1 min de leitura
Datasets Sintéticos de Wakeword: Sete Nomes de Assistente, Um Detetor
Publicámos sete datasets sintéticos de wakeword para nomes comuns de assistentes de voz: hey_computer, hey_mycroft, hey_siri, alexa, home_assistant, voice_assistant, wake_up. Treina um detetor que funciona em todo o lado.
- Datasets
- Wakewords
- Speech
- Synthetic
- 4 min de leitura
Apresentamos o phoonnx: A Nova Framework de TTS do OpenVoiceOS
O phoonnx é agora a principal framework de text-to-speech do OpenVoiceOS: uma stack completa de treino e inferência VITS/ONNX, a começar por novas vozes em basco para o Miro e a Dii.
- phoonnx
- TTS
- OVOS
- ONNX
- 5 min de leitura
OpenVoiceOS e Home Assistant: A Equipa de Sonho da Automação por Voz
O Home Assistant trata da automação. O OVOS trata da voz. Três camadas de integração fazem a combinação funcionar: pontes Wyoming para a pipeline de voz do HA, o ovos-persona-server como agente conversacional e o HiveMind para expor dispositivos OVOS como entidades nativas do HA.
- OVOS
- Home Assistant
- Smart Home
- Voice Automation
- 2 min de leitura
Criar Vozes Sintéticas do Zero
Criar uma voz para um sistema de texto-para-fala normalmente exige que uma pessoa real passe horas a gravar áudio. Isso é caro, moroso, e em muitas línguas ou sotaques as vozes simplesmente não existem de todo
- TTS
- Synthetic Data
- Voice Cloning
- OVOS
- 2 min de leitura
Dados de Treino de TTS Miro & Dii: 40 Datasets Abertos em 20 Locales
Publicámos 40 datasets de treino sintéticos para as vozes Miro e Dii em português, neerlandês, alemão, francês, italiano, japonês, espanhol e mais. Cada língua ganha duas identidades de voz consistentes, construídas com clonagem de voz.
- TTS
- Voice
- Datasets
- Miro & Dii
- 3 min de leitura
Nenhuma Língua Deixada para Trás
Eliminar barreiras linguísticas no OpenVoiceOS através de deteção de língua, plugins de tradução e capacidades de tradução bidirecional.
- OVOS
- multilingual
- language-detection
- translation