Alpha Cephei
Una partnership sul riconoscimento vocale che porta decenni di competenza nel riconoscimento vocale automatico (ASR) — il team dietro Vosk e i modelli basati su Kaldi — al nostro lavoro di fine-tuning dei modelli vocali e sui dataset.
Portfolio
Il nostro lavoro open source — librerie e strumenti FOSS e auto-ospitabili che spaziano dall'IA vocale all'estrazione dati, dataset, NLP e giochi, oltre all'ecosistema OpenVoiceOS e HiveMind che aiutiamo a costruire. Nessun lock-in, nessun cloud obbligatorio.
Oltre al codice, i nostri dataset e modelli aperti sono pubblicati suHugging Face,e i nostri notebook di addestramento risiedono nel repositoryml-notebooks.
Comunità
Contribuiamo a partner indipendenti e doniamo il lavoro finanziato con fondi pubblici alla fondazione OpenVoiceOS.
Una partnership sul riconoscimento vocale che porta decenni di competenza nel riconoscimento vocale automatico (ASR) — il team dietro Vosk e i modelli basati su Kaldi — al nostro lavoro di fine-tuning dei modelli vocali e sui dataset.
Programma spagnolo che promuove la tecnologia linguistica per le lingue ufficiali del paese (spagnolo, catalano, basco, galiziano). Finanzia lo sviluppo di OVOS per creare assistenti vocali scaricabili e rispettosi della privacy che funzionano su Raspberry Pi e personal computer. Finanziato dal Ministero spagnolo della Trasformazione Digitale e dal Piano di Ripresa dell'UE.
Programma Next Generation Internet della Commissione Europea (con cofinanziamento svizzero SERI) che supporta OpenVoiceOS come alternativa stabile e attenta alla privacy agli assistenti vocali delle Big Tech. Obiettivo: supporto multilingue, onboarding degli utenti, stabilizzazione della piattaforma e documentazione.
Una fondazione indipendente senza scopo di lucro che costruisce una piattaforma di IA vocale open source, guidata dalla comunità e rispettosa della privacy. TigreGótico è un contributore fondamentale di OpenVoiceOS e il suo fondatore fa parte del consiglio della fondazione.
Esplora
Filtra per area per esplorare di più — tutto è open source.
Wrapper Python asincrono per le CLI di agenti di coding (Claude Code, Gemini, opencode, Antigravity) dietro un'unica Provider API — sessioni one-shot e multi-turno, eventi di streaming tipizzati e pattern di pipeline fan-out/delegate/retry.
Riconoscimento di entità nominate tramite l'algoritmo di Aho-Corasick.
Grafema-fonema in puro Python, senza dipendenze e consapevole della versione per il basco e lo spagnolo — riproduce fedelmente il front-end di AhoTTS ed emette la stringa IPA a carattere singolo usata per addestrare le voci StyleTTS2/VITS.
Uno strumento basato su browser per allineare audio con trascrizioni testuali e IPA a livello di parola, grafema e frase. Funziona interamente lato client, senza server, senza dipendenze, senza fase di build.
HTTP anonimo con rotazione degli IP; si combina con unblock_requests per unire rotazione e aggiramento dei muri anti-bot.
Conversione testo-IPA per l'arabo (MSA) basata su regole con diacritizzazione tashkeel, costruita su orthography2ipa — un albero di token sensibile al contesto gestisce l'assimilazione delle lettere solari, la hamzat al-waṣl, il tanwīn e la tāʾ marbūṭa, diacritizzando prima il testo nudo tramite modelli ONNX inclusi.
Cerca e riproduci audiolibri di pubblico dominio da LibriVox e fonti simili.
Restauro vocale, riduzione del rumore ed estensione di banda in puro ONNX — porta il parlato a banda stretta a 48 kHz senza torch a runtime.
Libreria client HTTP minimale per Python — alternativa leggera a requests.
Disambiguazione degli omografi eterofonici per il portoghese europeo nel TTS — sceglie la pronuncia corretta di parole scritte allo stesso modo ma lette diversamente a seconda del significato (sede = sete vs sede aziendale, forma = stampo vs forma). Regole in puro Python più modelli addestrati, con dataset aperti.
Etichettatori delle parti del discorso di Brill pre-addestrati per 11 lingue, forniti come modelli pickle pronti all'uso su NLTK — etichetta il testo senza addestramento.
Motore di inferenza basato su ONNX per l'IA conversazionale.
Pacchetto Python per recuperare informazioni sui compositori classici da Classical Archives.
Estrattore multilingue di parole chiave/termini di ricerca basato su CRF — estrae la query da una domanda in linguaggio naturale tramite un CRF su feature POS e ortografiche, con modelli pre-addestrati per lingua.
Previsione di emozioni/emoji DeepMoji in ONNX.
Rileva e converte tra sette norme ortografiche portoghesi — la scrittura etimologica pre-1911, le riforme del 1911/1943/1945/1971/1973 e l'Acordo Ortográfico del 1990 con le sue sotto-varianti europea e brasiliana.
Strumenti per guidare le conversazioni verso un obiettivo.
Dati strutturati e operazioni per lavorare con le emozioni umane.
Reimplementazione in puro Python e priva di dipendenze del front-end grafema-fonema di espeak-ng — solo da testo a fonemi, senza estensione C. Riproduce il binario di espeak-ng byte per byte su una sweep di headword in 86 lingue e un corpus di frasi in 31 lingue; 117 lingue incluse.
Fonemizzatore basco testo-IPA sensibile ai dialetti, costruito sul reticolo di pronuncia condiviso orthography2ipa — aperto, ispezionabile e con fonti citate.
Grafema-fonema per il barranchegno.
Un protocollo per costruire reti gerarchiche di agenti — dispositivi satellite leggeri si collegano tramite una mesh cifrata a qualsiasi agente conversazionale, da OpenVoiceOS alle persona LLM fino ad agenti A2A arbitrari. L'ecosistema comprende protocolli di trasporto, satelliti vocali, bridge di chat, crittografia e discovery a zero configurazione.
Plugin di protocollo agente A2A per hivemind-core — collega la hive a server esterni Agent-to-Agent (A2A) via JSON-RPC 2.0, trasmettendo le risposte ai satelliti.
Un semplice database su file JSON per Python.
Un motore di intent leggero.
Motore di corrispondenza di template di parole chiave per il riconoscimento degli intent.
Rilevatore di lingua in puro Python, estremamente semplice e basato su liste di parole.
Pubblica la telemetria di potenza e di sistema di un Linux/SBC su Home Assistant tramite MQTT — CPU/GPU/RAM/disco, temperature, throttling, audio + MPRIS, WiFi/Bluetooth — tutto con auto-discovery. Costruito su powerguess.
Analizza e classifica le domande.
Generazione di testo con catene di Markov a partire da dati JSON.
Modelli a catena di Markov esportati in ONNX.
Indicizza, canonicalizza, deduplica e distribuisce cataloghi multimediali da YouTube e altre fonti.
Un vocabolario condiviso di metadati multimediali e uno strato di normalizzazione che unifica il modo in cui titoli, artisti e identificatori vengono mappati tra i client multimediali e le integrazioni con Music Assistant.
Client di metadati multimediali basati su Pydantic e un risolutore di entità cross-source senza chiavi.
Fonemizzatore basato su regole per la lingua mirandese.
Una libreria di machine learning e reti neurali in stile scikit-learn, con solo numpy e scipy come dipendenze — scritta per essere letta.
Client SoundCloud che emette rilasci tipizzati di metadati multimediali.
Piattaforma di assistente vocale open source, guidata dalla community e attenta alla privacy. TigreGótico è un contributore centrale dell'intero ecosistema — mantenendo plugin vocali, servizi STT/TTS, strumenti per sviluppatori e lavoro di specifica formale su decine di repository.
Toolkit di trasmissione dati tramite suono in puro Python — trasporta testo e dati attraverso un canale audio (DTMF e altro) usando primitive condivise WAV/sinusoide/Goertzel. Gli schemi principali sono privi di dipendenze.
Mappature grafema-IPA e allofoniche per oltre 350 lingue di più di 20 famiglie — un tokenizzatore IPA a maximal munch, metriche di distanza fonologica e tra sistemi di scrittura, trasformazioni dialettali e un backend G2P a plugin.
Framework di integrazione di agenti per OpenVoiceOS — abilita flussi di lavoro agentici guidati dalla voce.
Monitor del messagebus per OpenVoiceOS — osserva il traffico del bus dal vivo per fare debug di skill, intent e servizi.
Plugin di embedding vettoriali ChromaDB per OpenVoiceOS.
Plugin OVOS che normalizza il testo del dialogo prima della sintesi TTS (espansione dei numeri, abbreviazioni).
Suddivisione di documenti per recupero/RAG in OpenVoiceOS.
Plugin di riordinamento semantico veloce per i risultati delle query OVOS.
Plugin di embedding GGUF locali per OpenVoiceOS.
Plugin LLM locale (GGUF) per OpenVoiceOS.
Solver LLM locale che usa modelli GGUF in OpenVoiceOS.
Una piattaforma di localizzazione GitHub-native per skill e plugin OpenVoiceOS — gestisci le traduzioni interamente tramite Git, senza servizi esterni da eseguire.
Pipeline di intent Model2Vec per la gestione degli intent in OpenVoiceOS.
Plugin ChatEngine di OVOS che inoltra i turni di conversazione attraverso il messagebus di OVOS — collega interfacce di chat direttamente a un assistente in esecuzione.
Server di metriche open-data per OpenVoiceOS — raccoglie metriche d'uso anonime e le pubblica come dataset aperti; sviluppato nell'ambito del progetto ILENIA.
Arena di benchmarking per i plugin OVOS — sfide dirette con classifiche ELO per confrontare implementazioni STT, TTS e altri plugin su carichi reali.
Plugin di embedding con database vettoriale Qdrant per OpenVoiceOS.
Plugin ASR OVOS che usa il modello acustico Citrinet, addestrato su dati vocali ILENIA.
Plugin ASR OVOS che usa i modelli Faster-Whisper ottimizzati da Zuazo per il basco.
Plugin ASR OVOS per il riconoscimento vocale HiTZ in basco.
Plugin ASR OVOS che usa Meta MMS per il riconoscimento vocale massicciamente multilingue.
Plugin ASR OVOS che usa i modelli ASR NVIDIA NeMo.
Plugin ASR OVOS per il riconoscimento vocale NOS in galiziano.
Plugin di riconoscimento vocale per OVOS basato su onnx-asr — ASR leggero da modelli ONNX, senza torch.
Plugin ASR OVOS che usa modelli wav2vec 2.0 per lo spagnolo e le lingue co-ufficiali.
Plugin ASR OVOS che combina Whisper con un modello linguistico per una maggiore accuratezza.
Ospita qualsiasi plugin STT di OpenVoiceOS come servizio di rete — un piccolo server che espone il riconoscimento vocale via HTTP per satelliti e client di terze parti.
Plugin TTS OVOS per AhoTTS, un sistema di sintesi vocale basca sviluppato nell'ambito di ILENIA.
Plugin TTS OVOS che integra Coqui TTS per le voci in lingua spagnola.
Plugin TTS OVOS per Cotovia, un motore di sintesi vocale galiziano.
Plugin TTS OVOS per la sintesi Matxa multispeaker in catalano.
Plugin TTS OVOS per la sintesi vocale NOS in galiziano.
Ospita qualsiasi plugin TTS di OpenVoiceOS come servizio — un semplice server flask che trasforma qualunque plugin TTS in un'API di sintesi vocale self-hosted.
Super-risoluzione audio per il TTS di OVOS — FlashSR porta il parlato sintetizzato da 16 kHz a 48 kHz via ONNX prima della riproduzione, rendendo più brillante qualsiasi voce esistente senza riaddestramento.
Super-risoluzione audio per il TTS di OVOS — NovaSR porta il parlato sintetizzato da 16 kHz a 48 kHz con il veloce upsampler FastSR, saltando l'audio già a 48 kHz.
Configurazione Docker per OpenVoiceOS con i servizi Wyoming.
Framework di test end-to-end per skill OVOS con un runtime in-process leggero.
Parser di intent basato su parole chiave, semplicissimo — sostituto diretto di Adapt che confronta gli enunciati con slot di parole chiave obbligatorie/opzionali; nato in TigreGótico e donato a OpenVoiceOS.
Ricerca fonetica fuzzy e distanza da segmento a segmento.
Una libreria Python per la fonemizzazione multilingue e la sintesi vocale (TTS) tramite modelli ONNX.
Add-on per lo screen reader Windows NVDA che parla tramite le voci neurali ONNX di phoonnx, dimostrando phoonnx come backend TTS per l'accessibilità.
Inferenza TTS VITS nel browser con onnxruntime-web. Percorsi Unicode ed espeak-ng. Nessun server, nessuna API.
Controller automatizzato del browser costruito su Selenium e Selenium Wire — sessioni, gestione degli eventi, interazione con gli elementi e gestione delle estensioni per lo scraping e i test dove un browser completo è inevitabile.
Stima o misura l'assorbimento di potenza di un dispositivo Linux — una libreria Python con poche dipendenze e provenienza su ogni lettura (INA219, RAPL, PMIC Raspberry Pi, batteria o una stima calibrata e delimitata).
Port per Browser/Node.js del rilevamento di wake word precise-onnx. Estrazione di feature MFCC e rilevamento basato su ONNX compatibile con i modelli Precise .onnx.
Risoluzione della coreferenza tramite POS dei pronomi ed euristiche sul genere delle parole.
Scraper Bandcamp che emette rilasci tipizzati di metadati multimediali.
Client HTTP Python e bridge mediavocab per un server Music Assistant — lo strato condiviso di transport e conversione alla base dell'integrazione OVOS con Music Assistant.
Libreria Python per la sintesi vocale AhoTTS.
Port in Python di AhoTTS Iparrahotsa, un motore di sintesi vocale per il basco settentrionale (continentale) — il corrispettivo in dialetto iparralde di pyAhoTTS, con hts_engine e il vocoder AhoCoder. Sviluppato con Aholab (UPV/EHU).
Client Python tipizzato per Classical Archives.
Port in puro Python del front-end G2P Cotovia per il galiziano e lo spagnolo. Riproduce la pipeline di sillabazione, accento e trascrizione del binario C compilato senza subprocess.
Client Python in streaming per i dump di dati mensili di Discogs.
Client Python tipizzato + esportatore di dataset in markdown per Erowid (erowid.org).
Port in puro Python del motore di ragionamento EYE N3 — forniscigli fatti e regole in Notation3 e deriva nuovi fatti tramite forward/backward chaining, entailment RDFS e OWL 2 RL, alberi di dimostrazione e oltre 280 built-in. Una sola dipendenza (rdflib).
Client di scraping per fanedit.org / IFDB.
Wrapper Python per un motore di narrativa interattiva.
Client Python per Project Gutenberg — metadati dei libri tramite il catalogo aperto.
Client API per iHeartRadio.
Port in puro Python di HermiT, il ragionatore OWL 2 DL di Oxford — coerenza, classificazione e recupero di istanze tramite un tableau a iperrisoluzione, senza JVM e con zero dipendenze a runtime.
Client Python di metadati per IMDb. Risolve query in testo libero in titoli IMDb canonici.
Client Python tipizzato per Infopédia, il dizionario di portoghese europeo di Porto Editora — analizza ogni voce in pronunce IPA, sillabazione, etimologia e accezioni, separando correttamente gli omografi eterofonici per il lavoro di G2P e disambiguazione.
Un pacchetto Python per interagire con InspiroBot (inspirobot.me).
Client Python tipizzato per Jazz Music Archives.
Client Python per LiveATC.net — scopri, riproduci in streaming e archivia feed audio di controllo del traffico aereo dal vivo e storici, con esportazione di dataset per l'addestramento ASR.
Scraper / client API per MyAnimeList — anime e manga.
Client API per Encyclopaedia Metallum (Metal Archives).
Client Python di metadati per MusicBrainz — l'enciclopedia musicale aperta.
Client Python tipizzato per il Portal da Lingua Portuguesa.
Client Python tipizzato per Prog Archives.
Client Python tipizzato + esportatore di dataset in markdown per PsychonautWiki (psychonautwiki.org).
Scraper HTML in Python per rateyourmusic.com.
Scraper Python per romhacking.net (RHDN) — il database della comunità di ROM hack, traduzioni amatoriali, utilità di patching e documentazione.
Un client Python modulare e asincrono per l'API di Shazam, costruito su shazamio_core per un robusto fingerprinting audio.
Client Python per l'API JSON pubblica di smwcentral.net — accesso paginato al catalogo di ROM hacking di Super Mario World / SM64 / Yoshi's Island.
Client per schede informative sulle sostanze e matrice di interazioni di TripSit (riduzione del danno).
Scraper HTML in Python per il PmWiki di tvtropes.org.
Client Python per l'API JSON pubblica kana di VNDB (Visual Novel Database).
Client Python per WikiHow.
Client Python tipizzato per l'API MediaWiki del Wiktionary inglese.
Client aggregatore multilingue di Word-of-the-Day.
Client SomaFM che emette rilasci tipizzati di metadati multimediali.
Implementazione di Rapid Automatic Keyword Extraction.
Libreria di auto-configurazione audio per raspOVOS — rileva schede audio, HAT e dispositivi USB su Raspberry Pi e li configura per l'assistente vocale; sviluppata nell'ambito del progetto ILENIA.
Client di remailer email anonimi con supporto per i protocolli Cypherpunk e Mixmaster.
Nucleo senza dipendenze per scritture e notazioni fonemiche — rilevamento ISO-15924, IPA ↔ ARPABET/X-SAMPA/Kirshenbaum/Cotovía, Buckwalter ↔ arabo, Hangul → jamo, kana.
Bridge containerizzato che identifica l'audio ambientale con Shazam e pubblica i metadati dei brani (titolo, artista, copertina, testo, link Apple Music / Spotify / Deezer) su MQTT con auto-discovery di Home Assistant.
Strumento di sillabazione del testo portoghese.
Semplice riconoscimento di entità nominate basato su regole.
Utilità di ricognizione dei siti per apprenderne la struttura prima di costruire scraper. Mappa robots.txt, sitemap e grafi di collegamenti usando il transport unblock_requests per un'esplorazione resiliente di siti protetti o complessi.
Fonemizzatore per gli accenti regionali del portoghese europeo.
Libreria di embedding del parlante in puro onnxruntime — estrai embedding del parlante, calcola la similarità coseno e verifica l'identità del parlante da modelli ONNX, senza alcun PyTorch a runtime.
Metriche unificate di valutazione del parlato — MOS neurale (UTMOS, NISQA, SIGMOS, DNSMOS), intrusive (STOI, SI-SDR, MCD) e ASR (WER/CER) — solo con numpy e onnxruntime.
Un daemon che monitora i mount SSHFS/rclone e li rimonta automaticamente quando cadono — con dashboard web in tempo reale, API REST, metriche Prometheus, webhook e processi programmati di sincronizzazione rsync/rclone.
Posizionamento multilingue dell'accento lessicale per front-end TTS, usando solo onnxruntime e numpy.
Libreria unificata di astrazione meteo multi-provider per Python. Interroga OpenWeatherMap, Open-Meteo, MetNo, IPMA, NWS e altri tramite un'unica API coerente.
Diacritizzazione leggera dell'arabo (tashkeel) — un'unica API minimale su modelli ONNX intercambiabili che ripristinano i segni vocalici mancanti, senza PyTorch e offline per impostazione predefinita. Alimenta la fase di diacritizzazione di arbtok.
Un gestore di lessico e utilità linguistica per i dialetti portoghesi.
Analizzatore morfologico basato su regole per il portoghese — segmenta le parole in morfemi.
Strumenti grafema-fonema per il portoghese.
Etichettatore leggero delle parti del discorso (POS) per il portoghese.
Scraper radio TuneIn che emette rilasci tipizzati di metadati multimediali.
Scraper YouTube leggero che emette rilasci tipizzati di metadati multimediali.
Una sottoclasse di requests.Session che aggira Cloudflare (impersonation con curl_cffi, FlareSolverr, fallback su Wayback) — il transport anti-bot alla base dei nostri scraper.
Lettore USENET in tempo reale e scraper di articoli per la ricerca su protocolli alternativi e l'archiviazione.
Bridge di rilevamento dell'attività vocale in tempo reale basato su ovos-plugin-manager. Pubblica la probabilità di parlato (0–100 %), il livello di rumore (dB) e un sensore binario di parlato con debounce su MQTT — con auto-discovery di Home Assistant.
Rilevamento dell'attività vocale alla maniera di ONNX — carica qualsiasi modello VAD dietro un'unica API di streaming con un runtime minimale (numpy + onnxruntime). Il corrispettivo VAD di phoonnx; la maggior parte dei backend sono dati, non codice.
Conversione vocale multi-motore in puro ONNX — trasforma qualsiasi voce in quella di un parlante di riferimento senza alcun PyTorch in inferenza. 14 motori (kNN-VC, FreeVC, OpenVoice, RVC, CosyVoice…) dietro un'unica API VoiceCloner, più una CLI e build INT8.
Un addestratore di modelli di wake word sviluppato nell'ambito di un finanziamento NLnet per OpenVoiceOS — crea wake word personalizzate e on-device dai tuoi campioni.
Web app Flask per l'etichettatura manuale di audio di wake word — riproduci ogni clip ed etichetta parola, genere del parlante e tipo di rumore, costruendo un corpus pronto per l'addestramento o la valutazione.
Servizio ASR di OpenVoiceOS per il protocollo Wyoming — riconoscimento vocale leggero.
Servizio TTS di OpenVoiceOS per il protocollo Wyoming — sintesi vocale leggera.
Servizio di rilevamento delle wake word di OpenVoiceOS per il protocollo Wyoming.
Client Python modulare e asincrono per l'API di Shazam — fingerprinting audio tramite shazamio-core con modelli tipizzati Track/Artist e uno scraper di catalogo.
Libreria compatta di codifica binario-testo (Base91, Z85B, Z85P) — implementazioni C veloci con fallback in puro Python, tutte più compatte di base64.