सभी लेख

· Casimiro Ferreira· 4 मिनट पढ़ें

phoonnx का परिचय: OpenVoiceOS का नया TTS फ्रेमवर्क

  • phoonnx
  • TTS
  • OVOS
  • ONNX
  • Phonemization

यह ब्लॉग मूल रूप से OpenVoiceOS blog पर प्रकाशित हुआ था

phoonnx अब OpenVoiceOS के लिए प्राथमिक टेक्स्ट-टू-स्पीच फ्रेमवर्क है — VITS और ONNX पर निर्मित एक संपूर्ण प्रशिक्षण और अनुमान स्टैक, जो हमारे द्वारा समर्थित प्रत्येक भाषा में सुसंगत, ऑफ़लाइन-तैयार आवाज़ों के लिए डिज़ाइन किया गया है।

इसे कार्य करते हुए सुनें: Voices Demo आपके ब्राउज़र में phoonnx आवाज़ों को लाइव चलाता है — onnxruntime-web, कोई सर्वर नहीं।


नई भाषा: बास्क का परिचय!

Making Synthetic Voices From Scratch पर हमारे पिछले कार्य और हमारे Arabic TTS Collaboration के आधार पर, हमारे भाषा समर्थन में नवीनतम जोड़ बास्क (eu-ES) के लिए आवाज़ें हैं।

इसमें पुरुष आवाज़ (Miro) और महिला आवाज़ (Dii) दोनों शामिल हैं, जो कम-संसाधन वाली उन भाषाओं का भी समर्थन करने के हमारे मिशन को आगे बढ़ाती हैं जिनमें ओपन, उच्च-गुणवत्ता वाले TTS विकल्पों का अभाव है।

पहले केवल एक रोबोटिक महिला आवाज़ उपलब्ध थी, AhoTTS प्लगइन के माध्यम से, जो ILENIA के सहयोग से बनाया गया था।

परिणाम सुनें: नई बास्क ओपन-सोर्स आवाज़ों के उदाहरण।

Miro (पुरुष आवाज़): Miro को सुनें

Dii (महिला आवाज़): Dii को सुनें


भाषाओं के पार एक सुसंगत आवाज़ पहचान

OpenVoiceOS को एक सुसंगत ब्रांड आवाज़ की आवश्यकता है: एक मानक पुरुष और महिला व्यक्तित्व जो एक समान सुनाई दे, चाहे सहायक किसी भी भाषा के लिए कॉन्फ़िगर किया गया हो। एक उपयोगकर्ता जो लिस्बन में OpenVoiceOS सेट करता है और बाद में जर्मन में स्विच करता है, उसे वही परिचित वक्ता सुनाई देना चाहिए।

TigreGotico phoonnx इंजन का निर्माण और रखरखाव करता है, ओपन प्रशिक्षण डेटासेट का योगदान देता है, और डिफ़ॉल्ट बहुभाषी OVOS आवाज़ों — Miro (पुरुष) और Dii (महिला) — को प्रशिक्षित करता है, जो इस प्रतिबद्धता को पूरा करती हैं।


फोनेमाइज़र लचीलापन

phoonnx केवल एक अनुमान उपकरण से कहीं अधिक है; यह मजबूत VITS architecture पर निर्मित एक संपूर्ण प्रशिक्षण और अनुमान फ्रेमवर्क है। यह दोहरी क्षमता हमें उच्च-गुणवत्ता वाली आवाज़ों को तेज़ी से प्रोटोटाइप करने, प्रशिक्षित करने और परिनियोजित करने की अनुमति देती है।

इस लचीलेपन की एक कुंजी विविध फोनेमाइज़र का समर्थन करने की क्षमता है। एक फोनेमाइज़र (या G2P - ग्राफीम-टू-फोनीम मॉडल) लिखित पाठ को ध्वनि इकाइयों (फोनीम) के अनुक्रम में परिवर्तित करता है जिसे TTS मॉडल बोलता है। सटीक वाणी के लिए विभिन्न भाषाओं को अलग-अलग, विशेष फोनेमाइज़र की आवश्यकता हो सकती है।

  • eSpeak संगतता: एक मुख्य विशेषता यह है कि phoonnx मॉडल लोकप्रिय Piper TTS engine के रनटाइम के साथ पूरी तरह से संगत हैं, बशर्ते उन्हें व्यापक रूप से उपलब्ध eSpeak फोनेमाइज़र का उपयोग करके प्रशिक्षित किया गया हो। यह मौजूदा OVOS पारिस्थितिकी तंत्र और Home Assistant जैसी तृतीय-पक्ष परियोजनाओं के भीतर आसान परिनियोजन सुनिश्चित करता है।
  • कस्टम फोनेमाइज़र समर्थन: यह फ्रेमवर्क eSpeak तक सीमित नहीं है। उदाहरण के लिए, Proxecto Nós द्वारा Cotovia फोनेमाइज़र का उपयोग करके विकसित उच्च-गुणवत्ता वाले गैलिशियन मॉडल पूरी तरह से संगत हैं और phoonnx पाइपलाइन के साथ उपयोग किए जा सकते हैं।

यह लचीलापन हमें अन्य ओपन-सोर्स परियोजनाओं के कार्य को एकीकृत करने और उससे लाभान्वित होने की अनुमति देता है। वास्तव में, अनुमान के लिए, phoonnx अन्य परियोजनाओं द्वारा मूल रूप से प्रशिक्षित मॉडलों का सफलतापूर्वक उपयोग कर सकता है, जिनमें Coqui, Mimic3, और Piper शामिल हैं।

आगे: ByT5-आधारित G2P मॉडल

आगे की ओर देखते हुए, हम G2P सटीकता में सुधार के लिए लगातार कार्य कर रहे हैं, विशेष रूप से कम-संसाधन वाली भाषाओं के लिए। हम वर्तमान में शक्तिशाली ByT5 आर्किटेक्चर पर आधारित अगली पीढ़ी के G2P मॉडल विकसित और परीक्षण कर रहे हैं। ये ट्रांसफ़ॉर्मर-आधारित मॉडल भाषाओं की व्यापक श्रेणी में अधिक सटीक और मजबूत फोनेमाइज़ेशन प्रदान करने का वादा करते हैं।

आप उनके विकास का अनुसरण यहाँ कर सकते हैं: G2P Models Collection

निकट भविष्य में phoonnx के लिए एक समर्पित OVOS TTS प्लगइन बनाया जाएगा और उसे OpenVoiceOS के लिए डिफ़ॉल्ट बनाया जाएगा, जो पिछले प्लगइनों की जगह लेगा: ovos-tts-plugin-piper और ovos-tts-plugin-nos

इस बीच आप मौजूदा प्लगइन ovos-tts-plugin-piper के माध्यम से नई आवाज़ों को आज़मा सकते हैं

आपको बस mycroft.conf में मॉडल urls पास करने होंगे

  "tts": {
    "module": "ovos-tts-plugin-piper",
    "ovos-tts-plugin-piper": {
      "model": "https://huggingface.co/OpenVoiceOS/phoonnx_eu-ES_miro_espeak/resolve/main/miro_eu-ES.onnx",
      "model_config": "https://huggingface.co/OpenVoiceOS/phoonnx_eu-ES_miro_espeak/resolve/main/miro_eu-ES.piper.json"
    }
  }

प्रगति रिपोर्ट: उपलब्ध भाषाएँ

OpenVoiceOS और TigreGotico टीमों के सामूहिक कार्य के परिणामस्वरूप ओपन-सोर्स TTS मॉडलों की तेज़ी से विस्तार करती लाइब्रेरी बनी है।

वर्तमान में समर्थित भाषाएँ:

  • अरबी
  • बास्क
  • डच
  • अंग्रेज़ी (US/GB)
  • फ़्रेंच
  • जर्मन
  • इतालवी
  • पुर्तगाली (ब्राज़ील/पुर्तगाल)
  • स्पेनिश

शामिल हों और मॉडल खोजें

हम समुदाय को इन नए संसाधनों का अन्वेषण और उपयोग करने के लिए आमंत्रित करते हैं।

संसाधनविवरणलिंक
Phoonnx ModelsONNX प्रारूप में नए phoonnx-प्रशिक्षित TTS मॉडल।phoonnx-tts-models
Piper/Phoonnx VoicesPiper के साथ संगत OpenVoiceOS आवाज़ों का संपूर्ण संग्रह।pipertts-voices
Open Datasetsइन आवाज़ों को प्रशिक्षित करने के लिए उपयोग किए गए डेटासेट, ओपन-डेटा अनुसंधान को आगे बढ़ाते हुए।tts-datasets


Hugging Face पर संपूर्ण मॉडल और डेटासेट सूची का अन्वेषण करें: TigreGotico · OpenVoiceOS। डेटा में योगदान करने के लिए, phoonnx पर एक issue या discussion खोलें।