यह ब्लॉग मूल रूप से OpenVoiceOS blog पर प्रकाशित हुआ था
अस्तूरियन (ast) और आरागोनी (an) उत्तरी स्पेन में ऐसे समुदायों द्वारा बोली जाने वाली रोमांस भाषाएँ हैं जिन्हें व्यावसायिक आवाज़ तकनीक से लगभग कोई कवरेज नहीं मिलता। जो वक्ता आवाज़ सहायक चाहते हैं वे स्पेनिश का उपयोग करते हैं — या फिर उसके बिना ही रह जाते हैं। हमने दोनों के लिए VITS TTS मॉडल बनाए, और उन्हें HuggingFace पर ओपन वेट्स के रूप में जारी किया।
बाधा: दोनों भाषाओं के लिए Mozilla Common Voice 23.0 बहु-वक्ता और अपेक्षाकृत छोटा है। सीधे उस डेटा पर एक उच्च-गुणवत्ता वाला एकल-वक्ता TTS मॉडल प्रशिक्षित करना व्यवहार्य नहीं है। इसलिए हमने एक हाइब्रिड दृष्टिकोण अपनाया।
अंतराल: कोई G2P नहीं
एक बात जो भविष्य के मॉडल अपग्रेड से नहीं बदलेगी: न तो अस्तूरियन और न ही आरागोनी के पास एक उपयोग योग्य ओपन फ़ोनमाइज़र है। ये मॉडल सीधे ग्रैफ़ीम्स पर प्रशिक्षित किए गए हैं। एक फ़ोनमाइज़र रनटाइम पर IPA इनपुट को खोल देगा (नामों, नवशब्दों, कोड-स्विच के लिए उच्चारण को बाध्य करते हुए) और सामान्यतः संगति में सुधार करेगा। यदि आप किसी भी भाषा के लिए मौजूदा शब्दकोशों या उच्चारण डेटा के बारे में जानते हैं, या किसी पर सहयोग करना चाहते हैं, तो संपर्क करें।
हाइब्रिड पाइपलाइन
पूरी पद्धति हमारे Whitepaper on Hybrid TTS Dataset Synthesis में है। संक्षिप्त संस्करण:
-
स्रोत डेटा: Common Voice 23.0 — Asturian और Common Voice 23.0 — Aragonese। बहु-वक्ता, विविध रिकॉर्डिंग परिस्थितियाँ।
-
फ़िल्टरिंग: ऑडियो को सामान्यीकृत किया गया, मौन को काटा गया, प्रति-मिनट-शब्द के आधार पर आउटलायर हटाए गए। यह चरण महत्वपूर्ण है — जल्दबाज़ी में या अस्पष्ट वक्ताओं की ट्रांसक्रिप्ट संरेखण को कमज़ोर करती हैं।
-
ज़ीरो-शॉट रीवॉइसिंग: एक वॉइस-कन्वर्ज़न मॉडल फ़िल्टर किए गए बहु-वक्ता ऑडियो और एक छोटे डोनर वॉइस क्लिप को लेता है, और सभी उच्चारणों को डोनर आवाज़ में पुनः संश्लेषित करता है। परिणाम एक सुसंगत आवाज़ में एक सुसंगत एकल-वक्ता डेटासेट है, जिसका आकार मूल बहु-वक्ता स्रोत के अनुसार होता है।
-
phoonnx के माध्यम से VITS प्रशिक्षण: VITS तेज़ी से प्रशिक्षित होता है, अनुमान के समय बिना GPU के चलता है, और परिणामी मॉडल किसी भी phoonnx-संगत पाइपलाइन में फ़िट हो जाते हैं।
परिणाम
“L’arcu la vieya ye un fenómenu ópticu y meteorolóxicu que produz l’apaición d’un espectru de lluz continu nel cielu cuando los rayos del sol trespasen pequeñes partícules de mugor conteníes n’atmósfera terrestre. La forma ye la d’un arcu multicolor col roxo hacia la parte esterior y el viola hacia la interior. El arco iris duble, ye menos avezau a vese, y tien los colores invertíos, esto ye, el roxo hacia dientro y el viola hacia l’esterior.”
डाउनलोड करें: अस्तूरियन — dii (महिला) और अस्तूरियन — miro (पुरुष)
“L’arco de sant Chuan ye un fenomeno optico y meteorolochico que produce l’aparición d’un espectro de luz contino en o cielo cuan os rayos d’o sol trescruzan chicotas particlas d’humidat situatas por l’atmosfera terrestre. A forma suya ye a d’un arco multicolor con o royo en a parti exterior y o morau en a interior. No ye tan cutiano l’arco de sant Chuan dople, que incluye un segundo arco mas tenue con as colors chiratas, ye dicir o royo en l’interior y o morau en l’exterior.”
डाउनलोड करें: आरागोनी — dii (महिला) और आरागोनी — miro (पुरुष)
पाइपलाइन प्रमाणित होती है। उच्चारण अपूर्ण है — बिना फ़ोनमाइज़र के ग्रैफ़ीम प्रशिक्षण का अर्थ है कि मॉडल केवल वर्तनी पैटर्न से ध्वन्यात्मकता का अनुमान लगा रहा है। जो अब मौजूद है वह एक उपयोग योग्य आधार और एक दोहराने योग्य प्रक्रिया है।
मॉडल डाउनलोड करें और ऊपर सुनें। यदि आपके पास अस्तूरियन या आरागोनी उच्चारण डेटा, एक G2P शब्दकोश है, या आप एक ओपन लाइसेंस के तहत आवाज़ रिकॉर्डिंग में योगदान करना चाहते हैं, तो संपर्क करें — ये संसाधन सीधे अगले पुनरावृत्ति को बेहतर बनाते हैं।