Scritti
Dall'officina
Note su IA vocale, sviluppo di OpenVoiceOS, dati sintetici e tecnologia vocale per lingue minoritarie.
- 7 min di lettura
Esportare e Quantizzare Modelli Vocali Aperti Perché Funzionino Davvero
Un modello vocale addestrato su una pagina GitHub di ricerca non è un assistente vocale. Convertiamo checkpoint aperti di ASR e TTS in ONNX, CoreML e GGUF, li quantizziamo e ne validiamo l'output — poi pubblichiamo i risultati sotto OpenVoiceOS, così che ogni lingua che coprono giri in un assistente reale e offline.
- ONNX
- CoreML
- GGUF
- ASR
- 19 min di lettura
Portare Codice con le Macchine, e la Domanda sulla Licenza a Cui Non Abbiamo Saputo Rispondere
Abbiamo riscritto diversi programmi in C, C++ e Java — il G2P di espeak-ng, Cotovia, AhoTTS, HermiT — come puro Python, con un'IA che leggeva il codice sorgente originale e un essere umano a orchestrare il lavoro. Nessuno di noi ha letto gli originali. Questo solleva due domande distinte: il risultato può essere posseduto da qualcuno, ed è un'opera derivata dell'originale? Abbiamo mantenuto le licenze originali perché era più economico che rispondere. Pensiamo ancora che la domanda resti aperta.
- FOSS
- Licensing
- Open Source
- Python
- 9 min di lettura
Una Famiglia di Librerie Vocali Pure-ONNX
TigreGótico mantiene un insieme di librerie vocali — estensione di banda, clonazione vocale, embedding del parlante, VAD, accento di parola, fonemizzazione, TTS e una libreria di metriche per valutarle tutte — che condividono un'unica regola di runtime: solo onnxruntime e numpy, niente PyTorch, nessuna GPU richiesta.
- ONNX
- TTS
- voice cloning
- VAD
- 11 min di lettura
Come si Incastra lo Stack di Fonologia
Un tour architetturale del nostro stack testo-in-pronuncia: scriptconv per la notazione, orthography2ipa come motore grafema-in-IPA multilingue, frontend specifici per lingua costruiti sopra di esso per portoghese, basco, mirandese, barranquenho e arabo, e phonematcher per la ricerca basata sul suono. Mostra perché esistono i livelli, cos'è una lattice di candidati e output dialettali reali.
- G2P
- IPA
- Phonetics
- NLP
- 10 min di lettura
Scegliere un Motore di Clonazione Vocale
voiceclonnx esegue 10 motori di conversione vocale dietro un'unica API, dallo scambio di feature kNN al codec-LM autoregressivo. Questa è una guida alle famiglie di modelli che ci sono dietro, al vero compromesso misurato tra intelligibilità e somiglianza del parlante, e a come scegliere un motore per un compito specifico.
- ONNX
- voice cloning
- voice conversion
- self-hosted
- 10 min di lettura
Ripulire l'Audio Difettoso: Denoising ed Estensione della Banda in audiosronnx
Un approfondimento sui due compiti separati di audiosronnx — rimuovere il rumore e ricostruire le alte frequenze mancanti — con il registro reale dei motori, dimensioni dei modelli e licenze, l'elenco dei modelli scartati, e come verificare se l'output è davvero migliorato.
- ONNX
- denoising
- bandwidth extension
- speech
- 9 min di lettura
Misurare la Qualità del Parlato Senza un Panel di Ascolto
Una guida pratica a speechonnxmetrics: cosa misurano davvero MOS, predittori MOS senza riferimento, metriche di segnale intrusive e WER/CER basati su ASR, quando ciascuno si applica, punteggi reali su audio reale, e perché un MOS predetto è evidenza, non verità.
- speechonnxmetrics
- TTS
- ONNX
- evaluation
- 8 min di lettura
Scritture e Notazioni Fonetiche: Cosa Converte Davvero scriptconv
Un approfondimento su scriptconv, la libreria a dipendenza zero che rileva i sistemi di scrittura e converte tra notazioni fonetiche. Copre IPA, ARPABET e X-SAMPA; il rilevamento di scrittura ISO-15924; la traslitterazione Buckwalter per l'arabo; la scomposizione dell'Hangul in jamo; e la conversione kana, con esempi reali, eseguiti, e limiti onesti.
- IPA
- Phonetics
- NLP
- Linguistics
- 12 min di lettura
Il tuo modello di sentiment non sa distinguere un reclamo da un addio
Due messaggi di supporto che sembrano arrabbiati. Uno sta per scalare l'escalation; l'altro sta per andarsene senza una parola. Quasi nessun modello di emozioni riesce a distinguerli — perché a tutti manca lo stesso asse. Presentiamo emotion-algebra.
- Affective Computing
- Emotion
- Machine Learning
- LILACS
- 5 min di lettura
Perché Accumuliamo Dati: Dai Cataloghi Scrapati a Modelli Vocali e Linguistici più Intelligenti
Dati puliti, tipizzati e con buona provenienza sono la materia prima di ogni modello che spediamo. Come i cataloghi costruiti dai nostri scraper diventano vocabolari di biasing per ASR, classificatori di intenti, corpora NER sintetici, lessici G2P, voci TTS — e carburante onesto per gli LLM.
- Datasets
- Data Collection
- ASR
- NLP
- 6 min di lettura
Se Tutti Lanciano un'App, Noi Lanciamo la Voce: Trasformare i Siti Web in App Vocali
Ogni sito che conta è finito avvolto in un'app mobile. Proponiamo la mossa opposta per l'era della voce e della CLI: un'API pulita più una skill vocale per sito, così che il web diventi navigabile con l'orecchio e con la tastiera. Un sito alla volta, tutto sommato dà un browser vocale.
- Voice
- Accessibility
- OpenVoiceOS
- Web Automation
- 2 min di lettura
Usenet nel 2026: un corpus testuale pulito e pre-IA per addestramento e valutazione
Usenet è un archivio incontaminato del discorso umano pre-IA — decenni di post di newsgroup, tutti scritti da esseri umani, nessuno toccato dai modelli linguistici. Questo la rende un dato prezioso per l'addestramento e la valutazione di modelli linguistici e vocali. Abbiamo costruito un piccolo strumento Python per raccoglierla.
- Usenet
- Datasets
- NLP
- 4 min di lettura
Due Voci, Tutte le Lingue: Miro & Dii
TigreGótico si sta associando a OpenVoiceOS per dare all'assistente due identità vocali coerenti — Miro e Dii — che suonano allo stesso modo in ogni lingua, costruite con la nostra tecnologia di clonazione vocale e il motore phoonnx. Due modelli TTS per ogni lingua richiesta, lingue in via di estinzione incluse.
- phoonnx
- TTS
- OVOS
- voice cloning
- 5 min di lettura
Pronunciarlo Bene: Disambiguare gli Eterofoni Portoghesi per il TTS
Molte parole del portoghese europeo si scrivono allo stesso modo ma si pronunciano diversamente a seconda del significato — e sbagliare la vocale fa dire alla voce TTS la parola sbagliata. Abbiamo costruito bifonia-pt-homographs, un dataset aperto etichettato per significato di 56.891 frasi su 27 parole, e un minuscolo risolutore a zero dipendenze che raggiunge ≈94% dove i pesanti tagger POS si fermano a ≈75%.
- Datasets
- Portuguese
- TTS
- Grapheme-to-Phoneme
- 5 min di lettura
Modelli di TTS che Girano su una Patata
phoonnx è un framework di ricerca per la sintesi vocale basata su VITS, costruito per girare comodamente su hardware di fascia bassa. Nessuna GPU, nessun cloud, nessuna chiave API — solo una voce ONNX da ~15,65 milioni di parametri e una CPU. Ecco quanto può essere piccola una buona voce, e come le addestriamo.
- phoonnx
- TTS
- ONNX
- VITS
- 6 min di lettura
Presentiamo i Nostri Scraper di Database Musicali
Una panoramica della famiglia di client Python tipizzati che manteniamo per le fonti musicali — Bandcamp, SoundCloud, SomaFM, TuneIn, iHeartRadio e le grandi enciclopedie musicali — che emettono tutti metadati multimediali coerenti e tipizzati dietro un'unica interfaccia pulita e viaggiano sullo stesso trasporto HTTP conforme e a basso volume.
- Scrapers
- Media Metadata
- Music
- Python
- 3 min di lettura
Un Dataset Multilingue di Tipi di Frase: Domande, Comandi, Affermazioni
Abbiamo pubblicato sentence-types-multilingual — quasi 70.000 frasi in sette lingue, classificate per tipo grammaticale (domanda, comando, affermazione, esclamazione). È il corpus di addestramento dietro la libreria di instradamento little_questions.
- Datasets
- Multilingual
- NLP
- Intent
- 7 min di lettura
Sessioni requests Componibili e Pronte all'Uso per un Accesso Resiliente ai Dati Pubblici
Due sottoclassi componibili di requests.Session per leggere pagine web pubbliche in modo affidabile senza un browser headless nel percorso critico: trasporto compatibile con TLS, un proxy FlareSolverr per le sfide JS, un ripiego sulla Wayback Machine e richieste diversificate per IP — unblock_requests e anon_requests.
- HTTP
- Scraping
- Cloudflare
- Anti-Bot
- 4 min di lettura
Robots.txt, Sitemap e Scraping Web Etico
Prima di costruire uno scraper, esplora il sito. sitemapper legge il robots.txt, recupera tutte le sitemap e, opzionalmente, percorre il grafo dei collegamenti — così che il tuo scraper parta dal contratto stesso del sito anziché dalla forza bruta.
- Web Scraping
- Sitemaps
- Ethics
- Robots.txt
- 6 min di lettura
NLP Classico per il Portoghese: Sillabazione e Grafema-in-Fonema
Uno sguardo al nostro stack di NLP per il portoghese, basato su regole e completamente offline — silabificador per la sillabazione e TugaPhone per il grafema-in-fonema sensibile al dialetto — e come si collegano al più ampio lavoro di orthography2ipa per le varietà lusofone. Nessuna scatola nera di deep learning: deterministico, veloce e con poche dipendenze.
- NLP
- Portuguese
- Phonemization
- Grapheme-to-Phoneme
- 9 min di lettura
Grafema-in-IPA per 820 Lingue
orthography2ipa è una risorsa a dati puri, linguisticamente fondata, che mappa l'ortografia in IPA e modella come i fonemi si realizzano come allofoni attraverso 909 specifiche di lingua, 820 lingue e più di 20 famiglie linguistiche. Una lattice di candidati, lignaggio dialettale e un insieme di specifiche validato tramite schema e citato alla letteratura dialettologica — senza pesi addestrati, completamente auto-ospitabile.
- G2P
- IPA
- Phonetics
- NLP
- 2 min di lettura
Presentiamo il Primo Fonemizzatore per il Barranquenho
g2p_barranquenho è il primo convertitore aperto grafema-fonema per il barranquenho, la lingua di contatto ibero-romanza di Barrancos, Portogallo — regole derivate dalla convenzione ortografica recentemente pubblicata dal comune, verificabili rispetto alle fonti incluse nel repository.
- Phonemization
- Barranquenho
- Minority Languages
- NLP
- 3 min di lettura
Clonare Voci per Lingue in via di Estinzione: Costruire un Modello Text-to-Speech per Asturiano e Aragonese
Rilasciamo modelli sperimentali di text-to-speech per l'asturiano (ast) e l'aragonese (an) — due lingue romanze minoritarie praticamente prive di copertura vocale commerciale — costruiti con una pipeline ibrida: dati filtrati di Common Voice, revocalizzazione zero-shot e addestramento VITS tramite phoonnx.
- TTS
- Asturian
- Aragonese
- Minority Languages
- 3 min di lettura
OVOS e HiveMind nell'Industria Manifatturiera
I progetti europei COALA e WASABI hanno costruito un intero framework di assistente vocale industriale attorno a OVOS + HiveMind, integrandoli con i propri strumenti, interfaccia e motori di conversazione.
- OVOS
- HiveMind
- Industry
- manufacturing
- 1 min di lettura
Dataset Sintetici di Wakeword: Sette Nomi di Assistente, Un Rilevatore
Abbiamo pubblicato sette dataset sintetici di wakeword per i nomi più comuni degli assistenti vocali — hey_computer, hey_mycroft, hey_siri, alexa, home_assistant, voice_assistant, wake_up. Addestra un rilevatore che funziona ovunque.
- Datasets
- Wakewords
- Speech
- Synthetic
- 4 min di lettura
Presentiamo phoonnx: il nuovo framework TTS di OpenVoiceOS
phoonnx è ora il principale framework di text-to-speech di OpenVoiceOS — uno stack completo di addestramento e inferenza VITS/ONNX — a partire da nuove voci in basco per Miro e Dii.
- phoonnx
- TTS
- OVOS
- ONNX
- 5 min di lettura
OpenVoiceOS e Home Assistant: la Dream Team dell'automazione vocale
Home Assistant si occupa dell'automazione; OVOS si occupa della voce. Tre livelli di integrazione fanno funzionare la combinazione: i ponti Wyoming per la pipeline vocale di HA, ovos-persona-server come agente conversazionale e HiveMind per esporre i dispositivi OVOS come entità native di HA.
- OVOS
- Home Assistant
- Smart Home
- Voice Automation
- 2 min di lettura
Creare Voci Sintetiche da Zero
Creare una voce per un sistema di sintesi vocale richiede di solito che una persona reale trascorra ore a registrare audio. È costoso, richiede tempo e, in molte lingue o accenti, le voci semplicemente non esistono affatto
- TTS
- Synthetic Data
- Voice Cloning
- OVOS
- 2 min di lettura
Dati di Addestramento TTS Miro & Dii: 40 Dataset Aperti in 20 Locale
Abbiamo pubblicato 40 dataset di addestramento sintetici per le voci Miro e Dii in portoghese, neerlandese, tedesco, francese, italiano, giapponese, spagnolo e altro ancora. Clonazione vocale su larga scala: ogni lingua ottiene due identità coerenti.
- TTS
- Voice
- Datasets
- Miro & Dii
- 3 min di lettura
Nessuna Lingua Lasciata Indietro
Eliminare le barriere linguistiche in OpenVoiceOS tramite rilevamento della lingua, plugin di traduzione e capacità di traduzione bidirezionale.
- OVOS
- multilingual
- language-detection
- translation