Alpha Cephei
एक भाषण-पहचान साझेदारी जो दशकों की स्वचालित भाषण पहचान (ASR) विशेषज्ञता लाती है — Vosk और Kaldi-आधारित मॉडल के पीछे की टीम — हमारे वॉइस-मॉडल फ़ाइन-ट्यूनिंग और डेटासेट कार्य में।
पोर्टफोलियो
हमारा ओपन-सोर्स कार्य — FOSS, स्व-होस्ट करने योग्य लाइब्रेरी और उपकरण जो वॉइस AI, डेटा निष्कर्षण, डेटासेट, NLP और गेम्स तक फैले हैं, साथ ही OpenVoiceOS और HiveMind पारिस्थितिकी तंत्र जिसे बनाने में हम मदद करते हैं। कोई लॉक-इन नहीं, कोई अनिवार्य क्लाउड नहीं।
कोड से परे, हमारे ओपन डेटासेट और मॉडल प्रकाशित हैंHugging Face,और हमारी प्रशिक्षण नोटबुक्स रहती हैंml-notebooksरिपॉज़िटरी में।
समुदाय
हम स्वतंत्र भागीदारों में योगदान करते हैं और सार्वजनिक रूप से वित्तपोषित कार्य को OpenVoiceOS फाउंडेशन को दान करते हैं।
एक भाषण-पहचान साझेदारी जो दशकों की स्वचालित भाषण पहचान (ASR) विशेषज्ञता लाती है — Vosk और Kaldi-आधारित मॉडल के पीछे की टीम — हमारे वॉइस-मॉडल फ़ाइन-ट्यूनिंग और डेटासेट कार्य में।
स्पेनिश कार्यक्रम जो देश की आधिकारिक भाषाओं (स्पेनिश, कैटलन, बास्क, गैलिशियन) में भाषा प्रौद्योगिकी को आगे बढ़ाता है। Raspberry Pi और व्यक्तिगत कंप्यूटरों पर चलने वाले डाउनलोड करने योग्य, गोपनीयता का सम्मान करने वाले वॉइस असिस्टेंट बनाने के लिए OVOS विकास को वित्तपोषित करता है। स्पेन के डिजिटल परिवर्तन मंत्रालय और EU रिकवरी प्लान द्वारा वित्तपोषित।
यूरोपीय आयोग का Next Generation Internet कार्यक्रम (स्विस SERI सह-वित्तपोषण के साथ) OpenVoiceOS को Big Tech वॉइस असिस्टेंट के एक स्थिर, गोपनीयता-प्रथम विकल्प के रूप में समर्थन देता है। फ़ोकस: बहु-भाषा समर्थन, उपयोगकर्ता ऑनबोर्डिंग, प्लेटफ़ॉर्म स्थिरीकरण और दस्तावेज़ीकरण।
एक स्वतंत्र गैर-लाभकारी फ़ाउंडेशन जो एक समुदाय-संचालित, गोपनीयता का सम्मान करने वाला ओपन-सोर्स वॉइस-AI प्लेटफ़ॉर्म बना रहा है। TigreGótico OpenVoiceOS का एक कोर योगदानकर्ता है, और इसके संस्थापक फ़ाउंडेशन के बोर्ड में सेवा देते हैं।
अन्वेषण करें
अधिक अन्वेषण के लिए क्षेत्र के अनुसार फ़िल्टर करें — सब कुछ ओपन सोर्स है।
कोडिंग-एजेंट CLIs (Claude Code, Gemini, opencode, Antigravity) के लिए एक Provider API के पीछे async Python रैपर — वन-शॉट, बहु-टर्न सत्र, टाइप की गई स्ट्रीमिंग इवेंट, और fan-out/delegate/retry पाइपलाइन पैटर्न।
Aho-Corasick एल्गोरिदम का उपयोग करके नामित इकाई पहचान।
बास्क और स्पेनिश के लिए शुद्ध-Python, शून्य-निर्भरता, संस्करण-सजग grapheme-to-phoneme — AhoTTS फ्रंट-एंड को विश्वसनीय रूप से पुनर्निर्मित करता है और StyleTTS2/VITS आवाज़ों को प्रशिक्षित करने के लिए उपयोग की जाने वाली single-char IPA स्ट्रिंग उत्सर्जित करता है।
शब्द, ग्राफ़ीम और वाक्य स्तर पर ऑडियो को टेक्स्ट ट्रांसक्रिप्शन और IPA के साथ संरेखित करने के लिए एक ब्राउज़र-आधारित उपकरण। पूरी तरह क्लाइंट-साइड चलता है, कोई सर्वर नहीं, कोई निर्भरता नहीं, कोई बिल्ड चरण नहीं।
IP रोटेशन के साथ अनाम HTTP; रोटेशन के साथ-साथ बॉट-वॉल बायपास के लिए unblock_requests के साथ संयोजित होता है।
orthography2ipa पर निर्मित tashkeel विशेषकीकरण के साथ नियम-आधारित अरबी (MSA) text-to-IPA — एक संदर्भ-संवेदनशील टोकन वृक्ष sun-letter समीकरण, hamzat al-waṣl, tanwīn और tāʾ marbūṭa को संभालता है, बंडल किए गए ONNX मॉडल के माध्यम से पहले बेयर टेक्स्ट को विशेषकित करता है।
LibriVox और समान स्रोतों से सार्वजनिक-डोमेन ऑडियोबुक खोजें और स्ट्रीम करें।
शुद्ध ONNX में वाक् पुनर्स्थापन, शोर हटाना और बैंडविड्थ विस्तार — रनटाइम पर torch के बिना संकीर्ण-बैंड वाक् को 48 kHz तक बढ़ाता है।
Python के लिए न्यूनतम HTTP क्लाइंट लाइब्रेरी — requests का हल्का विकल्प।
TTS के लिए यूरोपीय-पुर्तगाली विषमस्वनिक समरूप-शब्द असंदिग्धीकरण — एक जैसे लिखे पर अर्थ के अनुसार भिन्न पढ़े जाने वाले शब्दों का सही उच्चारण चुनता है (sede = प्यास बनाम मुख्यालय, forma = साँचा बनाम आकार)। शुद्ध-Python नियम और प्रशिक्षित मॉडल, खुले डेटासेट के साथ।
11 भाषाओं के लिए पूर्व-प्रशिक्षित Brill part-of-speech टैगर, NLTK पर तैयार-उपयोग pickled मॉडल के रूप में — बिना प्रशिक्षण के टेक्स्ट टैग करें।
संवादी AI के लिए ONNX-आधारित अनुमान इंजन।
Classical Archives से शास्त्रीय संगीतकारों के बारे में जानकारी प्राप्त करने के लिए Python पैकेज।
बहुभाषी CRF कीवर्ड/खोज-शब्द निष्कर्षक — POS और वर्तनी विशेषताओं पर एक CRF का उपयोग करके प्राकृतिक-भाषा प्रश्न से क्वेरी निकालता है, पूर्व-प्रशिक्षित प्रति-भाषा मॉडल के साथ।
ONNX में DeepMoji भावना/इमोजी भविष्यवाणी।
सात पुर्तगाली वर्तनी मानदंडों के बीच पता लगाएं और परिवर्तित करें — 1911-पूर्व व्युत्पत्तिपरक लेखन, 1911/1943/1945/1971/1973 सुधार, और Acordo Ortográfico de 1990 अपने यूरोपीय और ब्राज़ीलियाई उप-प्रकारों के साथ।
किसी उद्देश्य की ओर बातचीत का मार्गदर्शन करने के उपकरण।
मानवीय भावनाओं के साथ काम करने के लिए संरचित डेटा और संचालन।
espeak-ng के grapheme-to-phoneme फ्रंट-एंड का शुद्ध-Python, निर्भरता-मुक्त पुनःकार्यान्वयन — केवल टेक्स्ट से फ़ोनीम, कोई C एक्सटेंशन नहीं। 86-भाषा headword स्वीप और 31-भाषा वाक्य कॉर्पस में espeak-ng बाइनरी को byte-for-byte पुनर्निर्मित करता है; 117 भाषाएं बंडल।
साझा orthography2ipa उच्चारण लैटिस पर बना बोली-सचेत बास्क टेक्स्ट-से-IPA फ़ोनेमाइज़र — खुला, निरीक्षण-योग्य और स्रोत-उद्धृत।
Barranquenho के लिए grapheme-to-phoneme।
एजेंटों के पदानुक्रमित नेटवर्क बनाने का प्रोटोकॉल — हल्के सैटेलाइट उपकरण एन्क्रिप्टेड मेश से किसी भी संवादी एजेंट से जुड़ते हैं: OpenVoiceOS से लेकर LLM पर्सोना और मनमाने A2A एजेंटों तक। पारिस्थितिकी तंत्र में ट्रांसपोर्ट प्रोटोकॉल, वॉइस सैटेलाइट, चैट ब्रिज, क्रिप्टोग्राफ़ी और ज़ीरो-कॉन्फ़िग खोज शामिल हैं।
hivemind-core के लिए A2A एजेंट प्रोटोकॉल प्लगइन — JSON-RPC 2.0 पर बाहरी Agent-to-Agent (A2A) सर्वरों से hive को जोड़ता है, उत्तर सैटेलाइट्स को स्ट्रीम होते हैं।
Python के लिए एक सरल JSON-फ़ाइल डेटाबेस।
एक हल्का इंटेंट इंजन।
इंटेंट पहचान के लिए कीवर्ड टेम्पलेट मिलान इंजन।
बेहद सरल शब्द-सूची-आधारित शुद्ध-Python भाषा पहचानकर्ता।
किसी Linux/SBC की बिजली और सिस्टम टेलीमेट्री को MQTT पर Home Assistant पर प्रकाशित करें — CPU/GPU/RAM/डिस्क, तापमान, थ्रॉटलिंग, ऑडियो + MPRIS, WiFi/Bluetooth — सभी स्वतः-खोजे गए। powerguess पर निर्मित।
प्रश्नों को पार्स और वर्गीकृत करें।
JSON डेटा से Markov शृंखला टेक्स्ट जनरेशन।
ONNX में निर्यात किए गए Markov-शृंखला मॉडल।
YouTube और अन्य स्रोतों से मीडिया कैटलॉग को अनुक्रमित, कैनोनिकलाइज़, डीडुप्लिकेट और सर्व करें।
एक साझा मीडिया-मेटाडेटा शब्दावली और सामान्यीकरण परत जो एकीकृत करती है कि शीर्षक, कलाकार और पहचानकर्ता मीडिया क्लाइंट और Music Assistant एकीकरण में कैसे मैप होते हैं।
Pydantic-संचालित मीडिया-मेटाडेटा क्लाइंट और एक कीलेस क्रॉस-स्रोत इकाई रिज़ॉल्वर।
Mirandese भाषा के लिए नियम-आधारित फ़ोनमाइज़र।
केवल numpy और scipy पर निर्भर scikit-learn-शैली की मशीन-लर्निंग और न्यूरल-नेटवर्क लाइब्रेरी — पढ़े जाने के लिए लिखी गई।
SoundCloud क्लाइंट जो टाइप किए गए मीडिया-मेटाडेटा रिलीज़ उत्सर्जित करता है।
समुदाय-संचालित, गोपनीयता-प्रथम ओपन-सोर्स वॉइस असिस्टेंट प्लेटफ़ॉर्म। TigreGótico पूरे पारिस्थितिकी तंत्र का कोर योगदानकर्ता है — दर्जनों रिपॉज़िटरी में वाक् प्लगइन, STT/TTS सेवाएँ, डेवलपर टूलिंग और औपचारिक विनिर्देश कार्य का रखरखाव करता है।
शुद्ध Python में ध्वनि-पर-डेटा टूलकिट — साझा WAV/sine/Goertzel प्रिमिटिव्स का उपयोग करके एक ऑडियो चैनल (DTMF और अधिक) के माध्यम से टेक्स्ट और डेटा वहन करें। मुख्य योजनाएं निर्भरता-मुक्त हैं।
20+ परिवारों की 350+ भाषाओं के लिए Grapheme-to-IPA और एलोफ़ोन मैपिंग — एक maximal-munch IPA टोकनाइज़र, ध्वनिवैज्ञानिक और लिपि दूरी मीट्रिक, बोली रूपांतरण, और एक प्लगेबल G2P बैकएंड।
OpenVoiceOS के लिए एजेंट एकीकरण फ़्रेमवर्क — वॉइस-संचालित एजेंटिक वर्कफ़्लो सक्षम करें।
OpenVoiceOS के लिए मैसेजबस मॉनिटर — स्किल्स, इंटेंट्स और सेवाओं की डिबगिंग हेतु बस ट्रैफ़िक लाइव देखें।
OpenVoiceOS के लिए ChromaDB वेक्टर एम्बेडिंग प्लगइन।
TTS संश्लेषण से पहले डायलॉग टेक्स्ट को सामान्य करने वाला OVOS प्लगइन (संख्या विस्तार, संक्षिप्ताक्षर)।
OpenVoiceOS में पुनर्प्राप्ति/RAG के लिए दस्तावेज़ चंकिंग।
OVOS क्वेरी परिणामों के लिए तेज़ सिमेंटिक पुनर्रैंकिंग प्लगइन।
OpenVoiceOS के लिए स्थानीय GGUF एम्बेडिंग प्लगइन।
OpenVoiceOS के लिए स्थानीय LLM (GGUF) प्लगइन।
OpenVoiceOS में GGUF मॉडल का उपयोग करने वाला स्थानीय LLM सॉल्वर।
OpenVoiceOS स्किल और प्लगइन के लिए एक GitHub-नेटिव स्थानीयकरण प्लेटफ़ॉर्म — अनुवाद पूरी तरह Git के माध्यम से प्रबंधित करें, चलाने के लिए कोई बाहरी सेवा नहीं।
OpenVoiceOS इंटेंट हैंडलिंग के लिए Model2Vec इंटेंट पाइपलाइन।
OVOS ChatEngine प्लगइन जो OVOS मैसेजबस से संवाद के दौर आगे बढ़ाता है — चैट इंटरफ़ेस को सीधे चल रहे सहायक से जोड़ें।
OpenVoiceOS के लिए ओपन-डेटा मेट्रिक्स सर्वर — अनाम उपयोग मेट्रिक्स एकत्र कर उन्हें ओपन डेटासेट के रूप में प्रकाशित करता है; ILENIA परियोजना के अंतर्गत विकसित।
OVOS प्लगइन्स के लिए बेंचमार्किंग एरिना — वास्तविक कार्यभार पर STT, TTS और अन्य प्लगइन कार्यान्वयनों की तुलना हेतु ELO रैंकिंग वाले आमने-सामने मुक़ाबले।
OpenVoiceOS के लिए Qdrant वेक्टर डेटाबेस एम्बेडिंग प्लगइन।
ILENIA भाषण डेटा पर प्रशिक्षित Citrinet ध्वनिक मॉडल का उपयोग करने वाला OVOS ASR प्लगइन।
बास्क के लिए Zuazo फ़ाइन-ट्यून किए गए Faster-Whisper मॉडल का उपयोग करने वाला OVOS ASR प्लगइन।
HiTZ बास्क भाषण पहचान के लिए OVOS ASR प्लगइन।
Meta MMS विशाल बहुभाषी भाषण पहचान का उपयोग करने वाला OVOS ASR प्लगइन।
NVIDIA NeMo ASR मॉडल का उपयोग करने वाला OVOS ASR प्लगइन।
NOS गैलिशियन भाषण पहचान के लिए OVOS ASR प्लगइन।
onnx-asr पर आधारित OVOS वाक्-से-पाठ प्लगइन — ONNX मॉडलों से हल्का ASR, torch की आवश्यकता नहीं।
स्पेनिश और सह-आधिकारिक भाषाओं के लिए wav2vec 2.0 मॉडल का उपयोग करने वाला OVOS ASR प्लगइन।
बेहतर सटीकता के लिए Whisper को एक भाषा मॉडल के साथ संयोजित करने वाला OVOS ASR प्लगइन।
किसी भी OpenVoiceOS STT प्लगइन को नेटवर्क सेवा के रूप में होस्ट करें — एक छोटा सर्वर जो सैटेलाइट्स और थर्ड-पार्टी क्लाइंट्स के लिए HTTP पर वाक्-से-पाठ उपलब्ध कराता है।
AhoTTS के लिए OVOS TTS प्लगइन, ILENIA के तहत विकसित एक बास्क वाक् संश्लेषण प्रणाली।
स्पेनिश-भाषा आवाज़ों के लिए Coqui TTS को लपेटने वाला OVOS TTS प्लगइन।
Cotovia के लिए OVOS TTS प्लगइन, एक गैलिशियन text-to-speech इंजन।
Matxa multispeaker कैटलन संश्लेषण के लिए OVOS TTS प्लगइन।
NOS गैलिशियन वाक् संश्लेषण के लिए OVOS TTS प्लगइन।
किसी भी OpenVoiceOS TTS प्लगइन को सेवा के रूप में होस्ट करें — एक सरल flask सर्वर जो किसी भी TTS प्लगइन को सेल्फ़-होस्टेड वाक्-संश्लेषण API बना देता है।
OVOS TTS के लिए ऑडियो सुपर-रेज़ोल्यूशन — FlashSR प्लेबैक से पहले ONNX से संश्लेषित वाक् को 16 kHz से 48 kHz तक बढ़ाता है, बिना पुनःप्रशिक्षण किसी भी आवाज़ को उज्जवल बनाता है।
OVOS TTS के लिए ऑडियो सुपर-रेज़ोल्यूशन — NovaSR तेज़ FastSR अपसैम्पलर से संश्लेषित वाक् को 16 kHz से 48 kHz तक बढ़ाता है; पहले से 48 kHz ऑडियो को छोड़ देता है।
Wyoming सेवाओं के साथ OpenVoiceOS के लिए Docker सेटअप।
हल्के इन-प्रोसेस रनटाइम के साथ OVOS स्किल के लिए एंड-टू-एंड परीक्षण फ़्रेमवर्क।
अत्यंत सरल कीवर्ड-आधारित इंटेंट पार्सर — Adapt का ड्रॉप-इन विकल्प जो उक्तियों को अनिवार्य/वैकल्पिक कीवर्ड स्लॉट्स से मिलाता है; TigreGótico में जन्मा और OpenVoiceOS को दान किया गया।
ध्वन्यात्मक फ़ज़ी खोज और सेगमेंट-से-सेगमेंट दूरी।
ONNX मॉडल का उपयोग करके बहुभाषी फ़ोनमीकरण और Text-to-Speech (TTS) के लिए एक Python लाइब्रेरी।
Windows NVDA स्क्रीन-रीडर ऐड-ऑन जो phoonnx न्यूरल ONNX आवाज़ों के माध्यम से बोलता है, phoonnx को एक सुलभता TTS बैकएंड के रूप में प्रदर्शित करता है।
onnxruntime-web के साथ ब्राउज़र में VITS TTS अनुमान। Unicode और espeak-ng पथ। कोई सर्वर नहीं, कोई API नहीं।
Selenium और Selenium Wire पर निर्मित स्वचालित ब्राउज़र नियंत्रक — सत्र, इवेंट हैंडलिंग, एलिमेंट इंटरैक्शन, और एक्सटेंशन प्रबंधन, जहां पूर्ण ब्राउज़र अपरिहार्य हो वहां स्क्रैपिंग और परीक्षण के लिए।
किसी Linux उपकरण की बिजली खपत का अनुमान या माप लगाएं — प्रत्येक रीडिंग पर प्रोवेनेंस के साथ एक निर्भरता-हल्की Python लाइब्रेरी (INA219, RAPL, Raspberry Pi PMIC, बैटरी, या एक कैलिब्रेटेड सीमित अनुमान)।
precise-onnx वेक-वर्ड डिटेक्शन का Browser/Node.js पोर्ट। MFCC फ़ीचर निष्कर्षण + Precise .onnx मॉडल के अनुकूल ONNX-आधारित डिटेक्शन।
सर्वनाम POS और शब्द-लिंग अनुमानों के माध्यम से संदर्भ समाधान।
Bandcamp स्क्रैपर जो टाइप किए गए मीडिया-मेटाडेटा रिलीज़ उत्सर्जित करता है।
किसी Music Assistant सर्वर के लिए Python HTTP क्लाइंट और mediavocab ब्रिज — OVOS Music Assistant एकीकरण के पीछे की साझा ट्रांसपोर्ट और रूपांतरण परत।
AhoTTS Text-to-Speech संश्लेषण के लिए Python लाइब्रेरी।
AhoTTS Iparrahotsa का Python पोर्ट, उत्तरी (महाद्वीपीय) बास्क के लिए एक Text-to-Speech इंजन — pyAhoTTS का Iparralde-बोली समकक्ष, hts_engine और AhoCoder वोकोडर के साथ। Aholab (UPV/EHU) के साथ विकसित।
Classical Archives के लिए टाइप किया गया Python क्लाइंट।
गैलिशियन और स्पेनिश के लिए Cotovia G2P फ्रंट-एंड का शुद्ध-Python पोर्ट। संकलित C बाइनरी की शब्दांश-विभाजन, बलाघात और ट्रांसक्रिप्शन पाइपलाइन को बिना subprocess के पुनर्निर्मित करता है।
Discogs मासिक डेटा डंप के लिए स्ट्रीमिंग Python क्लाइंट।
Erowid (erowid.org) के लिए टाइप किया गया Python क्लाइंट + markdown डेटासेट डंपर।
EYE N3 तर्क इंजन का शुद्ध-Python पोर्ट — इसे Notation3 तथ्य और नियम दें और यह forward/backward chaining, RDFS और OWL 2 RL अनुमान, प्रमाण वृक्ष और 280+ बिल्ट-इन के माध्यम से नए तथ्य निकालता है। एक निर्भरता (rdflib)।
fanedit.org / IFDB के लिए स्क्रैपिंग क्लाइंट।
एक इंटरैक्टिव फ़िक्शन इंजन के लिए Python रैपर।
Project Gutenberg के लिए Python क्लाइंट — खुले कैटलॉग के माध्यम से पुस्तक मेटाडेटा।
iHeartRadio API क्लाइंट।
Oxford के OWL 2 DL रीज़नर HermiT का शुद्ध-Python पोर्ट — एक हाइपररेज़ोल्यूशन टैब्लो के माध्यम से संगतता, वर्गीकरण और इंस्टेंस पुनर्प्राप्ति, बिना JVM और शून्य रनटाइम निर्भरताओं के।
IMDb के लिए Python मेटाडेटा क्लाइंट। मुक्त-टेक्स्ट क्वेरी को कैनोनिकल IMDb शीर्षकों में हल करता है।
Infopédia, Porto Editora के यूरोपीय-पुर्तगाली शब्दकोश के लिए टाइप किया गया Python क्लाइंट — प्रत्येक प्रविष्टि को IPA उच्चारण, शब्दांश-विभाजन, व्युत्पत्ति और अर्थों में पार्स करता है, G2P और असंदिग्धीकरण कार्य के लिए विषमस्वनिक समरूप-शब्दों को सही ढंग से अलग करता है।
InspiroBot (inspirobot.me) के साथ इंटरैक्ट करने के लिए एक Python पैकेज।
Jazz Music Archives के लिए टाइप किया गया Python क्लाइंट।
LiveATC.net के लिए Python क्लाइंट — लाइव और ऐतिहासिक Air Traffic Control ऑडियो फ़ीड खोजें, स्ट्रीम करें और अभिलेखित करें, ASR प्रशिक्षण के लिए डेटासेट निर्यात के साथ।
MyAnimeList के लिए स्क्रैपर / API क्लाइंट — एनीमे और मंगा।
Encyclopaedia Metallum (Metal Archives) API क्लाइंट।
MusicBrainz के लिए Python मेटाडेटा क्लाइंट — खुला संगीत विश्वकोश।
Portal da Lingua Portuguesa के लिए टाइप किया गया Python क्लाइंट।
Prog Archives के लिए टाइप किया गया Python क्लाइंट।
PsychonautWiki (psychonautwiki.org) के लिए टाइप किया गया Python क्लाइंट + markdown डेटासेट डंपर।
rateyourmusic.com के लिए Python HTML स्क्रैपर।
romhacking.net (RHDN) के लिए Python स्क्रैपर — ROM हैक, फ़ैन अनुवाद, पैचिंग उपयोगिताओं और दस्तावेज़ीकरण का सामुदायिक डेटाबेस।
Shazam API के लिए एक मॉड्यूलर, async Python क्लाइंट, मज़बूत ऑडियो फ़िंगरप्रिंटिंग के लिए shazamio_core के ऊपर निर्मित।
smwcentral.net सार्वजनिक JSON API के लिए Python क्लाइंट — Super Mario World / SM64 / Yoshi's Island ROM-हैकिंग कैटलॉग तक पेजिनेटेड पहुंच।
TripSit ड्रग तथ्यपत्र + इंटरैक्शन मैट्रिक्स क्लाइंट (हानि-न्यूनीकरण)।
tvtropes.org PmWiki के लिए Python HTML स्क्रैपर।
VNDB (Visual Novel Database) kana सार्वजनिक JSON API के लिए Python क्लाइंट।
WikiHow के लिए Python क्लाइंट।
अंग्रेज़ी Wiktionary MediaWiki API के लिए टाइप किया गया Python क्लाइंट।
बहुभाषी Word-of-the-Day समग्रक क्लाइंट।
SomaFM क्लाइंट जो टाइप किए गए मीडिया-मेटाडेटा रिलीज़ उत्सर्जित करता है।
Rapid Automatic Keyword Extraction का कार्यान्वयन।
raspOVOS के लिए ऑडियो स्व-कॉन्फ़िगरेशन लाइब्रेरी — Raspberry Pi पर साउंड कार्ड, HAT और USB उपकरण पहचानकर उन्हें वॉइस असिस्टेंट के लिए सेट करती है; ILENIA परियोजना के अंतर्गत विकसित।
Cypherpunk और Mixmaster प्रोटोकॉल के समर्थन के साथ अनाम ईमेल रीमेलर क्लाइंट।
शून्य-निर्भरता लिपि और स्वनिम-नोटेशन कोर — ISO-15924 पहचान, IPA ↔ ARPABET/X-SAMPA/Kirshenbaum/Cotovía, Buckwalter ↔ अरबी, हांगुल → जामो, काना।
Docker-आधारित ब्रिज जो Shazam के साथ कमरे के ऑडियो को फ़िंगरप्रिंट करता है और ट्रैक मेटाडेटा (शीर्षक, कलाकार, आर्टवर्क, गीत, Apple Music / Spotify / Deezer लिंक) को Home Assistant ऑटो-डिस्कवरी के साथ MQTT पर प्रकाशित करता है।
पुर्तगाली टेक्स्ट शब्दांश-विभाजन उपकरण।
सरल नियम-आधारित नामित-इकाई पहचान।
स्क्रैपर बनाने से पहले साइट संरचना सीखने के लिए साइट पुनरीक्षण उपयोगिता। संरक्षित या जटिल साइटों की सुदृढ़ खोज के लिए unblock_requests ट्रांसपोर्ट का उपयोग करके robots.txt, sitemaps और लिंक ग्राफ़ को मैप करती है।
यूरोपीय पुर्तगाली क्षेत्रीय उच्चारणों के लिए फ़ोनमाइज़र।
शुद्ध-onnxruntime वक्ता-एम्बेडिंग लाइब्रेरी — ONNX मॉडल से वक्ता एम्बेडिंग निकालें, कोसाइन समानता की गणना करें और वक्ता पहचान सत्यापित करें, रनटाइम पर बिना PyTorch के।
एकीकृत वाक् मूल्यांकन मेट्रिक्स — न्यूरल MOS (UTMOS, NISQA, SIGMOS, DNSMOS), इंट्रूसिव (STOI, SI-SDR, MCD) और ASR (WER/CER) — केवल numpy और onnxruntime पर।
एक डेमन जो SSHFS/rclone माउंट की निगरानी करता है और गिरने पर उन्हें स्वतः पुनः माउंट करता है — एक लाइव वेब डैशबोर्ड, REST API, Prometheus मीट्रिक, वेबहुक और शेड्यूल किए गए rsync/rclone सिंक जॉब के साथ।
TTS फ्रंट-एंड के लिए बहुभाषी शब्द-बलाघात निर्धारण, केवल onnxruntime और numpy पर चलता है।
Python के लिए एकीकृत बहु-प्रदाता मौसम अमूर्तीकरण लाइब्रेरी। एक सुसंगत API के माध्यम से OpenWeatherMap, Open-Meteo, MetNo, IPMA, NWS और अधिक को क्वेरी करें।
हल्का अरबी विशेषकीकरण (tashkeel) — विनिमेय ONNX मॉडल पर एक एकल छोटी API जो लुप्त स्वर चिह्नों को पुनर्स्थापित करती है, कोई PyTorch नहीं और डिफ़ॉल्ट रूप से ऑफ़लाइन। arbtok के विशेषकीकरण चरण को शक्ति देती है।
पुर्तगाली बोलियों के लिए एक लेक्सिकॉन हैंडलर और भाषाई उपयोगिता।
पुर्तगाली के लिए नियम-आधारित रूपात्मक विश्लेषक — शब्दों को morphemes में विभाजित करता है।
पुर्तगाली grapheme-to-phoneme उपकरण।
हल्का पुर्तगाली part-of-speech (POS) टैगर।
TuneIn रेडियो स्क्रैपर जो टाइप किए गए मीडिया-मेटाडेटा रिलीज़ उत्सर्जित करता है।
हल्का YouTube स्क्रैपर जो टाइप किए गए मीडिया-मेटाडेटा रिलीज़ उत्सर्जित करता है।
एक requests.Session उपवर्ग जो Cloudflare को बायपास करता है (curl_cffi इम्पर्सनेशन, FlareSolverr, Wayback फ़ॉलबैक) — हमारे स्क्रैपर के पीछे का एंटी-बॉट ट्रांसपोर्ट।
वैकल्पिक प्रोटोकॉल अनुसंधान और अभिलेखन के लिए लाइव USENET रीडर और आर्टिकल स्क्रैपर।
ovos-plugin-manager का उपयोग करके रीयल-टाइम Voice Activity Detection ब्रिज। भाषण संभावना (0–100 %), शोर स्तर (dB), और एक डिबाउंस्ड speech-detected बाइनरी सेंसर को Home Assistant ऑटो-डिस्कवरी के साथ MQTT पर प्रकाशित करता है।
ONNX तरीके से Voice Activity Detection — किसी भी VAD मॉडल को एक स्ट्रीमिंग API के पीछे एक छोटे रनटाइम (numpy + onnxruntime) के साथ लोड करें। phoonnx का VAD समकक्ष; अधिकांश बैकएंड कोड नहीं बल्कि डेटा हैं।
शुद्ध-ONNX, बहु-इंजन आवाज़ रूपांतरण — अनुमान के समय शून्य PyTorch के साथ किसी भी भाषण को एक संदर्भ वक्ता की आवाज़ में पुनर्गठित करें। एक VoiceCloner API के पीछे 14 इंजन (kNN-VC, FreeVC, OpenVoice, RVC, CosyVoice…), साथ ही एक CLI और INT8 बिल्ड।
OpenVoiceOS के लिए एक NLnet अनुदान के तहत विकसित वेक-वर्ड मॉडल ट्रेनर — अपने स्वयं के नमूनों से कस्टम, ऑन-डिवाइस वेक वर्ड बनाएं।
वेक-वर्ड ऑडियो को हाथ से लेबल करने के लिए Flask वेब ऐप — प्रत्येक क्लिप चलाएं और शब्द, वक्ता लिंग और शोर प्रकार टैग करें, प्रशिक्षण या मूल्यांकन के लिए तैयार एक कॉर्पस बनाए रखते हुए।
Wyoming प्रोटोकॉल के लिए OpenVoiceOS ASR सेवा — हल्की भाषण पहचान।
Wyoming प्रोटोकॉल के लिए OpenVoiceOS TTS सेवा — हल्की text-to-speech।
Wyoming प्रोटोकॉल के लिए OpenVoiceOS वेक-वर्ड डिटेक्शन सेवा।
Shazam API के लिए मॉड्यूलर, async Python क्लाइंट — टाइप किए गए Track/Artist मॉडल और एक कैटलॉग स्क्रैपर के साथ shazamio-core के माध्यम से ऑडियो फ़िंगरप्रिंटिंग।
कॉम्पैक्ट बाइनरी-से-टेक्स्ट एन्कोडिंग लाइब्रेरी (Base91, Z85B, Z85P) — तेज़ C कार्यान्वयन और शुद्ध-Python विकल्प, सभी base64 से अधिक कॉम्पैक्ट।