सभी लेख

· Casimiro Ferreira· 2 मिनट पढ़ें

Miro & Dii TTS प्रशिक्षण डेटा: 20 लोकेल में 40 ओपन डेटासेट

  • TTS
  • Voice
  • Datasets
  • Miro & Dii
  • Multilingual
  • FOSS

हम क्या जारी कर रहे हैं

Miro और Dii को बनाने के लिए उपयोग किए गए सभी 40 सिंथेटिक प्रशिक्षण डेटासेट — वे आवाज़ पहचानें जिन्हें हमने OpenVoiceOS के साथ साझेदारी में विकसित किया है। यह संग्रह यूरोपीय पुर्तगाली, ब्राज़ीली पुर्तगाली, डच, जर्मन, फ़्रेंच, इतालवी, जापानी, स्पेनिश, रोमानियाई, पोलिश, स्वीडिश, हिंदी, डेनिश, फ़ारसी, अंग्रेज़ी, बास्क और अन्य भाषाओं में फैला हुआ है। प्रत्येक डेटासेट एक सुसंगत नामकरण परंपरा का अनुसरण करता है: tts-train-synthetic-miro_pt-PT, tts-train-synthetic-dii_pt-BR, tts-train-synthetic-miro_nl-NL, और इसी तरह प्रत्येक भाषा जोड़ी के लिए।

प्रत्येक डेटासेट पूरी तरह से सिंथेटिक है — LJSpeech लेआउट में सिंथेसाइज़्ड ऑडियो के साथ जोड़ा गया जनित पाठ, कोई स्टूडियो सत्र नहीं — और इसे एक ओपन लाइसेंस के तहत जारी किया गया है ताकि कोई भी आवाज़ को फिर से प्रशिक्षित या विस्तारित कर सके। फोनेमीकरण प्रशिक्षण समय पर phoonnx में होता है, जो हमारे 350+ भाषाओं के लिए G2P शोध पर आधारित है।

आवाज़ की पहचान भाषाओं में सुसंगत कैसे बनी रहती है

हम एक बहुभाषी समूह को प्रशिक्षित करके यह उम्मीद नहीं करते कि उच्चारण अपने आप ठीक हो जाएगा। प्रत्येक भाषा को एक एकभाषी मॉडल मिलता है — उस भाषा के मूल वक्ता की तरह ध्वनि करने के लिए प्रशिक्षित। मॉडलों के बीच साझा पहचान आवाज़ क्लोनिंग से आती है: प्रत्येक Miro और प्रत्येक Dii मॉडल को एक नई भाषा के लिए अनुकूलित किए जाने से पहले उसी स्रोत आवाज़ से क्लोन किया जाता है। ध्वनि की गुणवत्ता, चरित्र, आवाज़ की पहचानने योग्य विशेषता — यह स्थानांतरित होती है। उच्चारण नहीं, जानबूझकर।

व्यावहारिक परिणाम: एक पुर्तगाली वक्ता, एक डच वक्ता, एक जापानी वक्ता — सभी निःसंदेह एक ही व्यक्ति, प्रत्येक मूल वक्ता जैसा ध्वनि करते हुए।

प्रशिक्षण डेटा क्यों प्रकाशित करें

अपने प्रशिक्षण डेटा के बिना एक checkpoint एक ब्लैक बॉक्स है। इसे प्रकाशित करने से आवाज़ ऑडिट करने योग्य (आप ठीक-ठीक देख सकते हैं कि उसने किससे सीखा), पुनरुत्पादनीय (उसी डेटा पर phoonnx_train चलाएँ, वही परिणाम पाएँ), और विस्तार योग्य (वाक्य जोड़ें, किसी बोली के लिए फ़ाइन-ट्यून करें, उसके ऊपर एक नया वक्ता बनाएँ) बन जाती है।

यह इस सूची की कम-संसाधन वाली भाषाओं के लिए सबसे अधिक मायने रखता है। जब प्रशिक्षण डेटा खुला होता है, तो कोई भाषा बोलने वाला समुदाय अपनी स्वयं की आवाज़ को बेहतर बना सकता है — किसी विक्रेता के यह तय करने की प्रतीक्षा किए बिना कि वह व्यावसायिक रूप से दिलचस्प है।

सब कुछ कहाँ मिलेगा

सभी डेटासेट और प्रशिक्षित मॉडल HuggingFace पर TigreGotico के अंतर्गत रहते हैं, जिसमें Piper-संगत आवाज़ checkpoints भी OpenVoiceOS के अंतर्गत मिरर किए गए हैं।

इन डेटासेट का उपभोग करने वाले इन्फरेंस और प्रशिक्षण फ़्रेमवर्क के लिए, phoonnx देखें।