सभी लेख

· Casimiro Ferreira· 2 मिनट पढ़ें

शून्य से सिंथेटिक आवाज़ें बनाना

  • TTS
  • Synthetic Data
  • Voice Cloning
  • OVOS

यह ब्लॉग मूल रूप से OpenVoiceOS blog में प्रकाशित हुआ था

यूरोपीय पुर्तगाली के लिए एक अच्छी ऑफ़लाइन TTS आवाज़ मौजूद नहीं थी। स्टूडियो रिकॉर्डिंग महंगी है, इसमें महीनों लगते हैं, और दुनिया की अधिकांश भाषाओं में तो ये रिकॉर्डिंग कभी हुई ही नहीं। इसलिए हमने शून्य से चार आवाज़ें बनाईं — बिना किसी रिकॉर्डिंग बूथ के, बिना किसी वॉइस एक्टर के, बिना किसी क्लाउड के।

तीन-चरणों वाली पाइपलाइन

1. सिंथेटिक स्पीच जोड़े उत्पन्न करें। हम एक मौजूदा TTS आवाज़ को दाता (donor) के रूप में उपयोग करते हैं — कोई भी स्रोत जो समझने योग्य ऑडियो उत्पन्न कर सके — और उसे एक बड़े टेक्स्ट कॉर्पस पर चलाकर हज़ारों ऑडियो/टेक्स्ट जोड़े तैयार करते हैं। दाता आवाज़ का उच्च गुणवत्ता का होना ज़रूरी नहीं है। उसे बस इतना सुसंगत होना चाहिए कि उससे सीखा जा सके।

2. वॉइस कन्वर्ज़न लागू करें। एक वॉइस-कन्वर्ज़न चरण दाता के स्वर (timbre) को एक नई पहचान में बदल देता है — अलग लिंग, आयु या चरित्र। परिणामी ऑडियो लक्षित आवाज़ जैसा सुनाई देता है, दाता जैसा नहीं। यहीं एक नया व्यक्तित्व जन्म लेता है।

3. एक कॉम्पैक्ट VITS मॉडल को प्रशिक्षित करें। परिवर्तित ऑडियो phoonnx_train के माध्यम से एक छोटे VITS-आर्किटेक्चर मॉडल के लिए प्रशिक्षण सेट बन जाता है। तैयार मॉडल को ONNX में निर्यात किया जाता है और यह पूरी तरह ऑफ़लाइन चलता है — ज़रूरत पड़ने पर Raspberry Pi पर भी।

नैतिक सुरक्षा उपाय

यदि दाता किसी वास्तविक व्यक्ति की आवाज़ है, तो हम पहले स्पष्ट अनुमति प्राप्त करते हैं। जब कोई अनुमति संभव नहीं होती, तो हम सार्वजनिक-डोमेन रिकॉर्डिंग का उपयोग करते हैं या एक पूरी तरह मौलिक आवाज़ उत्पन्न करते हैं जो किसी की पहचान की नकल नहीं करती। वॉइस-कन्वर्ज़न चरण में एक उपयोगी गोपनीयता गुण भी है: आउटपुट ध्वनिक रूप से दाता से इतना अलग होता है कि प्रतिरूपण (impersonation) का जोखिम नगण्य रहता है।

यूरोपीय पुर्तगाली पर लागू

यूरोपीय पुर्तगाली के पास कोई उच्च-गुणवत्ता वाली खुली ऑफ़लाइन आवाज़ नहीं थी। हमने ठीक इसी पाइपलाइन का उपयोग करके चार आवाज़ें तैयार कीं — जिनमें Miro और Dii पहचानें शामिल हैं जो अब pt-PT के लिए डिफ़ॉल्ट OVOS आवाज़ें हैं। ये साधारण हार्डवेयर पर आराम से चलती हैं, इन्हें इंटरनेट कनेक्शन की आवश्यकता नहीं होती, और प्रशिक्षण डेटा खुले तौर पर प्रकाशित है ताकि कोई भी उन्हें पुनरुत्पादित या विस्तारित कर सके।

सभी मॉडल और डेटासेट huggingface.co/OpenVoiceOS और huggingface.co/TigreGotico पर मौजूद हैं।