लेखन
कार्यशाला से
वॉइस AI, OpenVoiceOS विकास, सिंथेटिक डेटा और अल्पसंख्यक-भाषा वाक् तकनीक पर टिप्पणियाँ।
- 8 मिनट का पठन
ओपन स्पीच मॉडलों का निर्यात और क्वांटाइज़ेशन ताकि वे वास्तव में चलें
किसी रिसर्च GitHub पेज पर पड़ा एक प्रशिक्षित स्पीच मॉडल कोई वॉयस असिस्टेंट नहीं है। हम ओपन ASR और TTS चेकपॉइंट्स को ONNX, CoreML और GGUF में बदलते हैं, उन्हें क्वांटाइज़ करते हैं, और आउटपुट को सत्यापित करते हैं — फिर परिणामों को OpenVoiceOS के अंतर्गत प्रकाशित करते हैं ताकि वे जिन भाषाओं को कवर करते हैं वे सभी एक वास्तविक, ऑफ़लाइन असिस्टेंट में पहुँचें।
- ONNX
- CoreML
- GGUF
- ASR
- 20 मिनट का पठन
मशीनों के साथ पोर्टिंग, और वह लाइसेंस सवाल जिसका हम जवाब नहीं दे सके
हमने कई C, C++ और Java प्रोग्राम — espeak-ng का G2P, Cotovia, AhoTTS, HermiT — शुद्ध Python में फिर से लिखे, जिसमें एक AI ने मूल स्रोत पढ़ा और एक मानव ने काम का निर्देशन किया। हमारी तरफ़ किसी भी मानव ने मूल नहीं पढ़ा। इससे दो अलग सवाल उठते हैं: क्या आउटपुट का बिलकुल स्वामित्व हो सकता है, और क्या यह इनपुट का व्युत्पन्न (derivative) है? हमने अपस्ट्रीम लाइसेंस बनाए रखे क्योंकि यह जवाब देने से सस्ता था। हम अब भी मानते हैं कि सवाल खुला है।
- FOSS
- Licensing
- Open Source
- Python
- 10 मिनट का पठन
शुद्ध-ONNX स्पीच लाइब्रेरियों का एक परिवार
TigreGótico स्पीच लाइब्रेरियों का एक समूह बनाए रखता है — बैंडविड्थ विस्तार, वॉयस क्लोनिंग, स्पीकर एम्बेडिंग, VAD, शब्द बल, फ़ोनेमाइज़ेशन, TTS, और उन सभी को स्कोर करने के लिए एक मेट्रिक्स लाइब्रेरी — जो एक रनटाइम नियम साझा करते हैं: केवल onnxruntime और numpy, कोई PyTorch नहीं, कोई GPU आवश्यक नहीं।
- ONNX
- TTS
- voice cloning
- VAD
- 12 मिनट का पठन
ध्वनिविज्ञान स्टैक कैसे एक साथ फ़िट होता है
हमारे टेक्स्ट-टू-उच्चारण स्टैक का एक आर्किटेक्चर दौरा: नोटेशन के लिए scriptconv, क्रॉस-भाषा ग्रैफ़ीम-टू-IPA इंजन के रूप में orthography2ipa, पुर्तगाली, बास्क, मिरांडीज़, बारांकेन्यो और अरबी के लिए इसके ऊपर बने भाषा-विशिष्ट फ़्रंटएंड, और ध्वनि-आधारित खोज के लिए phonematcher। यह दिखाता है कि परतें क्यों मौजूद हैं, एक उम्मीदवार लैटिस क्या है, और असली बोली आउटपुट।
- G2P
- IPA
- Phonetics
- NLP
- 11 मिनट का पठन
एक वॉयस-क्लोनिंग इंजन चुनना
voiceclonnx एक API के पीछे 10 वॉयस-कन्वर्शन इंजन चलाता है, kNN फ़ीचर-स्वैप से लेकर AR कोडेक-LM तक। यह उनके पीछे के मॉडल परिवारों, सुबोधता और स्पीकर समानता के बीच असली मापे गए समझौते, और किसी विशेष काम के लिए इंजन चुनने के तरीक़े की एक गाइड है।
- ONNX
- voice cloning
- voice conversion
- self-hosted
- 11 मिनट का पठन
ख़राब ऑडियो साफ़ करना: audiosronnx में डिनॉइज़िंग और बैंडविड्थ विस्तार
audiosronnx के दो अलग-अलग कामों — शोर हटाना और लापता उच्च फ़्रीक्वेंसियों का पुनर्निर्माण — में एक गहरी झाँक, असली इंजन रजिस्ट्री, मॉडल आकार और लाइसेंसों के साथ, अस्वीकृत-मॉडलों की सूची, और यह जाँचने का तरीक़ा कि आउटपुट असल में बेहतर हुआ या नहीं।
- ONNX
- denoising
- bandwidth extension
- speech
- 10 मिनट का पठन
बिना किसी सुनने वाले पैनल के स्पीच गुणवत्ता मापना
speechonnxmetrics के लिए एक कार्यशील गाइड: MOS, संदर्भ-रहित MOS अनुमानक, intrusive सिग्नल मेट्रिक्स, और ASR-आधारित WER/CER असल में क्या मापते हैं, हर एक कब लागू होता है, असली ऑडियो से असली स्कोर, और एक पूर्वानुमानित MOS प्रमाण क्यों है, सत्य नहीं।
- speechonnxmetrics
- TTS
- ONNX
- evaluation
- 9 मिनट का पठन
स्क्रिप्ट और ध्वन्यात्मक नोटेशन: scriptconv असल में क्या रूपांतरित करता है
scriptconv पर एक गहरी झाँक, वह शून्य-निर्भरता वाली लाइब्रेरी जो लेखन प्रणालियों का पता लगाती है और ध्वन्यात्मक नोटेशनों के बीच रूपांतरित करती है। IPA, ARPABET, और X-SAMPA को कवर करती है; ISO-15924 स्क्रिप्ट पहचान; अरबी के लिए Buckwalter लिप्यंतरण; jamo में Hangul विघटन; और kana रूपांतरण, असली, निष्पादित उदाहरणों और ईमानदार सीमाओं के साथ।
- IPA
- Phonetics
- NLP
- Linguistics
- 14 मिनट का पठन
आपका सेंटिमेंट मॉडल शिकायत और विदाई में फ़र्क नहीं कर सकता
दो गुस्से भरे सपोर्ट मैसेज। एक ग्राहक शिकायत बढ़ाने वाला है; दूसरा बिना एक शब्द कहे चुपचाप जाने वाला है। लगभग कोई इमोशन मॉडल इनमें फ़र्क नहीं कर सकता — क्योंकि सबमें एक ही अक्ष गायब है। परिचय emotion-algebra से।
- Affective Computing
- Emotion
- Machine Learning
- LILACS
- 5 मिनट का पठन
हम डेटा क्यों संचित करते हैं: स्क्रेप किए गए कैटलॉग से लेकर अधिक स्मार्ट स्पीच और भाषा मॉडल तक
स्वच्छ, टाइप्ड, अच्छे उद्गम वाला डेटा हर उस मॉडल का कच्चा माल है जिसे हम भेजते हैं। हमारे स्क्रेपर्स जो कैटलॉग बनाते हैं वे कैसे ASR बायसिंग शब्दावलियाँ, इंटेंट वर्गीकारक, सिंथेटिक NER कॉर्पोरा, G2P लेक्सिकन, TTS आवाज़ें — और LLMs के लिए ईमानदार ईंधन — बन जाते हैं।
- Datasets
- Data Collection
- ASR
- NLP
- 7 मिनट का पठन
अगर हर कोई एक ऐप भेजता है, तो हम वॉइस भेजेंगे: वेबसाइटों को वॉइस ऐप्स में बदलना
जो भी साइट मायने रखती है वह एक मोबाइल ऐप में लपेट दी गई। हम वॉइस और CLI युग के लिए उल्टा क़दम प्रस्तावित करते हैं: प्रति साइट एक साफ़ API और एक वॉइस स्किल, ताकि वेब कान से और कीबोर्ड से ब्राउज़ करने योग्य हो जाए। एक बार में एक साइट, यह जुड़कर एक वॉइस ब्राउज़र बनता है।
- Voice
- Accessibility
- OpenVoiceOS
- Web Automation
- 2 मिनट का पठन
2026 में Usenet: प्रशिक्षण और मूल्यांकन के लिए एक स्वच्छ, पूर्व-AI टेक्स्ट कॉर्पस
Usenet पूर्व-AI मानव विमर्श का एक निर्मल अभिलेख है — दशकों की न्यूज़ग्रुप पोस्ट, सब मानव-लिखित, जिनमें से कोई भी भाषा-मॉडल से अछूता। इससे यह भाषा और स्पीच मॉडलों के लिए मूल्यवान प्रशिक्षण और मूल्यांकन डेटा बनता है। हमने इसे बटोरने के लिए एक छोटा Python टूल बनाया है।
- Usenet
- Datasets
- NLP
- 4 मिनट का पठन
दो आवाज़ें, हर भाषा: Miro और Dii
TigreGótico, OpenVoiceOS के साथ साझेदारी कर रहा है ताकि असिस्टेंट को दो सुसंगत वॉयस पहचानें दी जा सकें — Miro और Dii — जो हर भाषा में एक जैसी सुनाई दें, हमारी वॉयस-क्लोनिंग तकनीक और phoonnx इंजन से बनी। जिस भी भाषा की माँग हो उसके लिए दो TTS मॉडल, लुप्तप्राय भाषाएँ भी शामिल।
- phoonnx
- TTS
- OVOS
- voice cloning
- 5 मिनट का पठन
सही बोलना: TTS के लिए पुर्तगाली heterophones को स्पष्ट करना
कई यूरोपीय पुर्तगाली शब्दों की वर्तनी एक जैसी है पर अर्थ के अनुसार उच्चारण अलग होता है — और गलत स्वर चुनने से TTS आवाज़ गलत शब्द बोल देती है। हमने bifonia-pt-homographs बनाया, 27 शब्दों पर 56,891 वाक्यों का एक खुला अर्थ-लेबल किया गया डेटासेट, और एक नन्हा निर्भरता-रहित resolver जो ≈94% तक पहुँचता है जबकि भारी-भरकम POS taggers ≈75% पर ठहर जाते हैं।
- Datasets
- Portuguese
- TTS
- Grapheme-to-Phoneme
- 5 मिनट का पठन
ऐसे TTS मॉडल जो आलू पर भी चलें
phoonnx VITS-आधारित टेक्स्ट-टू-स्पीच के लिए एक शोध फ़्रेमवर्क है, जो कम-क्षमता वाले हार्डवेयर पर आराम से चलने के लिए बनाया गया है। कोई GPU नहीं, कोई क्लाउड नहीं, कोई API key नहीं — बस ~1.565 करोड़ पैरामीटर वाली एक ONNX आवाज़ और एक CPU। यहाँ बताया गया है कि एक अच्छी आवाज़ कितनी छोटी हो सकती है, और हम उन्हें कैसे प्रशिक्षित करते हैं।
- phoonnx
- TTS
- ONNX
- VITS
- 7 मिनट का पठन
प्रस्तुत हैं हमारे म्यूज़िक डेटाबेस स्क्रेपर्स
म्यूज़िक स्रोतों के लिए हम जिन टाइप्ड पायथन क्लाइंट्स का परिवार बनाए रखते हैं उनकी एक झलक — Bandcamp, SoundCloud, SomaFM, TuneIn, iHeartRadio, और महान म्यूज़िक विश्वकोश — सभी एक साफ़ इंटरफ़ेस के पीछे एकसमान, टाइप्ड मीडिया मेटाडेटा उत्सर्जित करते हैं और वही अनुपालनशील, कम-मात्रा वाला HTTP ट्रांसपोर्ट इस्तेमाल करते हैं।
- Scrapers
- Media Metadata
- Music
- Python
- 3 मिनट का पठन
एक बहुभाषी वाक्य-प्रकार डेटासेट: प्रश्न, आदेश, कथन
हमने sentence-types-multilingual प्रकाशित किया — सात भाषाओं में लगभग 70,000 वाक्य, व्याकरणिक प्रकार (प्रश्न, आदेश, कथन, विस्मयादिबोधक) के अनुसार वर्गीकृत। यह little_questions रूटिंग लाइब्रेरी के पीछे का प्रशिक्षण कॉर्पस है।
- Datasets
- Multilingual
- NLP
- Intent
- 7 मिनट का पठन
सुदृढ़ सार्वजनिक-डेटा पहुँच के लिए कंपोज़ेबल, ड्रॉप-इन requests सेशन्स
सार्वजनिक वेब पेज भरोसेमंद ढंग से पढ़ने के लिए दो कंपोज़ेबल requests.Session सबक्लासेस, हॉट पाथ में हेडलेस ब्राउज़र के बिना: TLS-संगत ट्रांसपोर्ट, JS चैलेंज के लिए एक FlareSolverr प्रॉक्सी, एक Wayback Machine फ़ॉलबैक, और IP-विविधीकृत अनुरोध — unblock_requests और anon_requests।
- HTTP
- Scraping
- Cloudflare
- Anti-Bot
- 4 मिनट का पठन
Robots.txt, साइटमैप्स, और नैतिक वेब स्क्रैपिंग
स्क्रैपर बनाने से पहले, साइट की टोह लें। sitemapper robots.txt पढ़ता है, हर साइटमैप लाता है, और वैकल्पिक रूप से लिंक ग्राफ़ को क्रॉल करता है — ताकि आपका स्क्रैपर क्रूर बल के बजाय साइट के अपने अनुबंध से शुरू हो।
- Web Scraping
- Sitemaps
- Ethics
- Robots.txt
- 6 मिनट का पठन
पुर्तगाली के लिए क्लासिकल NLP: अक्षर-विभाजन और ग्रैफ़ीम-टू-फ़ोनीम
हमारे नियम-आधारित, पूरी तरह से ऑफ़लाइन पुर्तगाली NLP स्टैक पर एक नज़र — अक्षर-विभाजन के लिए silabificador और बोली-जागरूक ग्रैफ़ीम-टू-फ़ोनीम के लिए TugaPhone — और वे लुसोफ़ोन विभिन्नताओं के लिए व्यापक orthography2ipa कार्य से कैसे जुड़ते हैं। कोई डीप-लर्निंग ब्लैक बॉक्स नहीं: नियतात्मक, तेज़, और निर्भरता-हल्का।
- NLP
- Portuguese
- Phonemization
- Grapheme-to-Phoneme
- 9 मिनट का पठन
820 भाषाओं के लिए ग्रैफ़ीम-टू-IPA
orthography2ipa एक शुद्ध-डेटा, भाषाई रूप से आधारित संसाधन है जो वर्तनी को IPA में मैप करता है और मॉडल करता है कि 909 भाषा स्पेक्स, 820 भाषाओं, और 20+ भाषा परिवारों में फ़ोनीम कैसे एलोफ़ोन के रूप में सतह पर आते हैं। एक उम्मीदवार लैटिस, एक maximal-munch टोकनाइज़र, ध्वनिविज्ञान और स्क्रिप्ट दूरी मेट्रिक्स, बोली वंशावली, और बोलीविज्ञान साहित्य से उद्धृत एक स्कीमा-प्रमाणित स्पेक सेट — कोई प्रशिक्षित वेट्स नहीं, पूरी तरह से स्व-होस्ट करने योग्य।
- G2P
- IPA
- Phonetics
- NLP
- 2 मिनट का पठन
बारांकेन्यो के लिए पहला फ़ोनमाइज़र प्रस्तुत है
g2p_barranquenho बारांकेन्यो के लिए पहला ओपन ग्रैफ़ीम-टू-फ़ोनीम कन्वर्टर है, जो पुर्तगाल के बारांकोस की इबेरो-रोमांस संपर्क भाषा है — नियम नगरपालिका के नए प्रकाशित वर्तनी सम्मेलन से व्युत्पन्न, कमिट किए गए स्रोतों के विरुद्ध ऑडिट योग्य।
- Phonemization
- Barranquenho
- Minority Languages
- NLP
- 3 मिनट का पठन
लुप्तप्राय भाषाओं के लिए आवाज़ों का क्लोनिंग: अस्तूरियन और आरागोनी के लिए एक टेक्स्ट-टू-स्पीच मॉडल बनाना
हम अस्तूरियन (ast) और आरागोनी (an) के लिए प्रायोगिक टेक्स्ट-टू-स्पीच मॉडल जारी कर रहे हैं — दो अल्पसंख्यक रोमांस भाषाएँ जिनमें व्यावसायिक आवाज़ कवरेज लगभग शून्य है — जिन्हें एक हाइब्रिड पाइपलाइन से बनाया गया है: फ़िल्टर किया गया Common Voice डेटा, ज़ीरो-शॉट रीवॉइसिंग, और phoonnx के माध्यम से VITS प्रशिक्षण।
- TTS
- Asturian
- Aragonese
- Minority Languages
- 4 मिनट का पठन
विनिर्माण उद्योग में OVOS और HiveMind
यूरोपीय संघ की COALA और WASABI परियोजनाओं ने OVOS + HiveMind के इर्द-गिर्द एक संपूर्ण औद्योगिक वॉइस-असिस्टेंट फ्रेमवर्क तैयार किया है, जिसे उन्होंने अपने स्वयं के उपकरणों, UI और वार्तालाप इंजनों के साथ एकीकृत किया है।
- OVOS
- HiveMind
- Industry
- manufacturing
- 1 मिनट का पठन
सिंथेटिक वेकवर्ड डेटासेट: सात असिस्टेंट नाम, एक डिटेक्टर
हमने सामान्य वॉइस असिस्टेंट नामों के लिए सात सिंथेटिक वेकवर्ड डेटासेट प्रकाशित किए हैं — hey_computer, hey_mycroft, hey_siri, alexa, home_assistant, voice_assistant, wake_up। एक ऐसा डिटेक्टर प्रशिक्षित करें जो हर जगह काम करे।
- Datasets
- Wakewords
- Speech
- Synthetic
- 4 मिनट का पठन
phoonnx का परिचय: OpenVoiceOS का नया TTS फ्रेमवर्क
phoonnx अब OpenVoiceOS के लिए प्राथमिक टेक्स्ट-टू-स्पीच फ्रेमवर्क है — एक संपूर्ण VITS/ONNX प्रशिक्षण और अनुमान स्टैक — जिसकी शुरुआत Miro और Dii के लिए नई बास्क आवाज़ों से हो रही है।
- phoonnx
- TTS
- OVOS
- ONNX
- 5 मिनट का पठन
OpenVoiceOS और Home Assistant: वॉइस ऑटोमेशन की ड्रीम टीम
Home Assistant ऑटोमेशन संभालता है; OVOS आवाज़ संभालता है। तीन एकीकरण परतें इस संयोजन को कारगर बनाती हैं: HA की वॉइस पाइपलाइन के लिए Wyoming ब्रिज, संवादात्मक एजेंट के रूप में ovos-persona-server, और OVOS उपकरणों को HA की नेटिव एंटिटी के रूप में प्रस्तुत करने के लिए HiveMind।
- OVOS
- Home Assistant
- Smart Home
- Voice Automation
- 2 मिनट का पठन
शून्य से सिंथेटिक आवाज़ें बनाना
टेक्स्ट-टू-स्पीच सिस्टम के लिए आवाज़ बनाने में आमतौर पर किसी वास्तविक व्यक्ति को घंटों ऑडियो रिकॉर्ड करना पड़ता है। यह महंगा और समय लेने वाला है, और कई भाषाओं या लहजों में तो ये आवाज़ें बिल्कुल भी मौजूद नहीं हैं
- TTS
- Synthetic Data
- Voice Cloning
- OVOS
- 2 मिनट का पठन
Miro & Dii TTS प्रशिक्षण डेटा: 20 लोकेल में 40 ओपन डेटासेट
हमने Miro और Dii आवाज़ों के लिए 40 सिंथेटिक प्रशिक्षण डेटासेट प्रकाशित किए हैं, जो पुर्तगाली, डच, जर्मन, फ़्रेंच, इतालवी, जापानी, स्पेनिश और अन्य भाषाओं में फैले हैं। पैमाने पर आवाज़ क्लोनिंग: हर भाषा को दो सुसंगत पहचानें मिलती हैं।
- TTS
- Voice
- Datasets
- Miro & Dii
- 3 मिनट का पठन
कोई भाषा पीछे न छूटे
भाषा पहचान, अनुवाद प्लगइन और द्विदिशात्मक अनुवाद क्षमताओं के माध्यम से OpenVoiceOS में भाषा की बाधाओं को समाप्त करना।
- OVOS
- multilingual
- language-detection
- translation