अभी सुनें: Voices Demo आपके ब्राउज़र में Miro और Dii को सजीव चलाता है — एक भाषा चुनें, एक वाक्य टाइप करें, और सुनें। कोई इंस्टॉल नहीं, कोई सर्वर नहीं।
लोग किसी असिस्टेंट की आवाज़ को उसके नाम से अधिक याद रखते हैं। इसलिए OpenVoiceOS के साथ हमारी साझेदारी का मूल सवाल एक व्यावहारिक सवाल है: असिस्टेंट को हर भाषा में किस जैसा सुनाई देना चाहिए?
उत्तर है Miro (पुरुष) और Dii (महिला) — दो वॉयस पहचानें जो OpenVoiceOS द्वारा समर्थित हर भाषा में साथ चलती हैं। जो उपयोगकर्ता लिस्बन में असिस्टेंट कॉन्फ़िगर करता है और बाद में जर्मन पर स्विच करता है, उसे वही परिचित वक्ता सुनाई देना चाहिए। एक ब्रांड आवाज़, हर भाषा, समुदाय के स्वामित्व में।
एक पहचान, कई भाषाएँ
बहुभाषी आवाज़ पाने का सामान्य तरीका है एक अकेले मॉडल को एकसाथ कई भाषाओं पर प्रशिक्षित करना। यह काम करता है, पर परिणाम को धुँधला कर देता है: लहजे भाषाओं में रिस जाते हैं, उच्चारण अनुमानित हो जाता है, और आवाज़ किसी मूल वक्ता की स्पष्टता खो देती है।
हम कठिन रास्ता अपनाते हैं। हर भाषा के लिए हम एक एकभाषी मॉडल बनाते हैं — एक मॉडल, एक भाषा, उस भाषा को अच्छी तरह करने के लिए प्रशिक्षित। जो तरकीब उन्हें आपस में बाँधती है वह है वॉयस क्लोनिंग: हर एकभाषी Miro मॉडल उसी स्रोत पहचान से क्लोन किया जाता है, और Dii के लिए भी वैसे ही। नतीजा प्रति-भाषा मॉडलों का एक परिवार है जिनमें से हर एक किसी मूल वक्ता जैसा बोलता है, फिर भी सभी वही timbre, वही चरित्र, वही Miro-पन या Dii-पन साझा करते हैं। आपको एक को दूसरे के बदले देने के बजाय मूल-गुणवत्ता का उच्चारण और एक अकेली पहचानने योग्य पहचान दोनों मिलते हैं।
ये मॉडल phoonnx से प्रशिक्षित और परोसे जाते हैं, जो हमारा खुला TTS फ़्रेमवर्क है — VITS-आधारित, ONNX-निर्यात, केवल-CPU। आवाज़ें पूरी तरह ऑफ़लाइन चलती हैं; कोई क्लाउड नहीं, कोई API key नहीं, कोई डेटा आपके हार्डवेयर से बाहर नहीं जाता। OpenVoiceOS के भीतर, ovos-tts-plugin-phoonnx प्लगइन उन्हें लाने और लोड करने का काम संभालता है। पूरी हार्डवेयर और आर्किटेक्चर कहानी के लिए, देखें ऐसे TTS मॉडल जो आलू पर भी चलें।
वह G2P शोध जो इसे संभव बनाता है
किसी भाषा को अच्छी तरह बोलना केवल आवाज़ के बारे में नहीं है — यह जानने के बारे में है कि लेखन को कैसा सुनाई देना चाहिए। यही ग्राफ़ीम-टू-फ़ोनीम (G2P) रूपांतरण का काम है: लिखित टेक्स्ट को उन फ़ोनीमों के अनुक्रम में बदलना जिन्हें मॉडल असल में उच्चारित करता है। हर नई भाषा जो हम लेते हैं वह अपने साथ अपना G2P शोध लाती है, और वही शोध वह जगह है जहाँ असली काम का बड़ा हिस्सा बसता है।
phoonnx यहाँ जानबूझकर लचीला है। यह phonemizer की एक पूरी श्रृंखला चला सकता है — eSpeak, Gruut, Epitran, मॉडल-आधारित ByT5 G2P, और भाषा-विशिष्ट औज़ार जहाँ सामान्य इंजन कम पड़ते हैं। यह सीधे हमारे व्यापक ध्वन्यात्मकता स्टैक से जुड़ता है: हमारा वर्तनी-से-IPA शोध और वे लूज़ोफ़ोन phonemizers जो हमने पुर्तगाली परिवार के लिए बनाए हैं, एक ही लक्ष्य को खिलाते हैं — उन भाषाओं के लिए सटीक IPA जिन्हें बड़े TTS प्रदाताओं ने कभी ध्यान से मॉडल करने की परवाह नहीं की। जब किसी भाषा के पास कोई अच्छा तैयार-मिला phonemizer नहीं होता, तो वही खाई ही परियोजना है। हम पहले वर्तनी-से-ध्वनि का शोध करते हैं, फिर आवाज़ पीछे आती है।
हर माँगी गई भाषा के लिए दो मॉडल
यह रही ठोस पेशकश, और यही साझेदारी का दिल है: जिस भी भाषा की कोई माँग करता है, हम उसके लिए दो TTS मॉडल बनाएँगे — Miro और Dii। किसी-दिन-शायद का रोडमैप नहीं; एक स्थायी प्रतिबद्धता। एक भाषा माँगिए, और वह सार्वभौमिक जोड़ी उस तक आती है।
और हमारा मतलब हर भाषा से है, केवल सहज, व्यावसायिक रूप से स्पष्ट भाषाओं से नहीं। दुनिया से गायब आवाज़ें शायद ही कभी वे होती हैं जिनके दस करोड़ वक्ता हों — वे लुप्तप्राय और अल्पसंख्यक भाषाएँ हैं जिन्हें मुख्यधारा का TTS चुपचाप अनदेखा कर देता है क्योंकि बाज़ार परवाह करने के लिए बहुत छोटा है। वे ठीक वही भाषाएँ हैं जिन तक हम पहुँचना चाहते हैं: ऐसे समुदाय जिनके पास अपनी कहने के लिए कभी कोई उच्च-गुणवत्ता वाली कृत्रिम आवाज़ नहीं रही, और जिनके पास यह उम्मीद करने का कोई कारण नहीं कि कोई सिलिकॉन-वैली विक्रेता कभी उसे मुहैया कराएगा।
यह बाद के लिए किया गया कोई वादा नहीं है। इसे लिखे जाने तक, Hugging Face पर phoonnx TTS मॉडल संग्रह 13 भाषाओं को सूचीबद्ध करता है जिनमें कम से कम एक भेजी गई आवाज़ है, और उनमें से 8 — बास्क, अरबी, यूरोपीय पुर्तगाली, अस्तूरियन, अरागोनी, फ़्रीज़ियन, ओक्सितान, और कोलंबियाई स्पेनिश — के पास पहले से Miro और Dii दोनों उपलब्ध हैं।
खुला और स्वयं-होस्ट
आवाज़ें मुफ़्त और ओपन सोर्स हैं, ऑफ़लाइन और स्वयं-होस्ट चलती हैं ताकि आपके हार्डवेयर से कुछ भी बाहर न जाए, और पूरा स्टैक — इंजन, phonemizers, G2P शोध, प्रशिक्षित आवाज़ें — किसी समुदाय के लिए लेने और रखने के लिए खुला है।
अगर आपकी भाषा अभी सूची में नहीं है, तो यह बंद दरवाज़ा नहीं है — यह एक माँग है जो किए जाने की प्रतीक्षा में है।