این وبلاگ در ابتدا در وبلاگ OpenVoiceOS منتشر شد
یک صدای آفلاین خوب TTS برای پرتغالی اروپایی وجود نداشت. ضبط استودیویی پرهزینه است، ماهها طول میکشد و در بیشتر زبانهای جهان این ضبطها هرگز رخ ندادهاند. پس ما چهار صدا را از صفر ساختیم — بدون اتاق ضبط، بدون بازیگر صدا، بدون ابر.
خطلولهٔ سهمرحلهای
۱. تولید جفتهای گفتار مصنوعی. ما از یک صدای موجود TTS بهعنوان اهداکننده استفاده میکنیم — هر منبعی که بتواند صدای قابلفهم تولید کند — و آن را روی یک پیکرهٔ متنی بزرگ اجرا میکنیم تا هزاران جفتِ صدا/متن تولید شود. صدای اهداکننده نیازی به کیفیت بالا ندارد. فقط باید بهقدر کافی منسجم باشد که بتوان از آن یاد گرفت.
۲. اعمال تبدیل صدا (voice conversion). یک مرحلهٔ تبدیل صدا، طنین اهداکننده را به یک هویت تازه تبدیل میکند — جنسیت، سن یا شخصیت متفاوت. صدای حاصل مانند صدای هدف به گوش میرسد، نه اهداکننده. اینجاست که یک شخصیت تازه زاده میشود.
۳. آموزش یک مدل فشردهٔ VITS. صدای تبدیلشده به مجموعهٔ آموزشی برای یک مدل کوچک با معماری VITS از طریق phoonnx_train بدل میشود. مدل نهایی به ONNX صادر میشود و بهطور کامل آفلاین اجرا میشود — در صورت نیاز حتی روی یک Raspberry Pi.
حفاظهای اخلاقی
اگر اهداکننده صدای یک فرد واقعی باشد، نخست اجازهٔ صریح میگیریم. وقتی هیچ اجازهای ممکن نباشد، از ضبطهای در مالکیت عمومی (public-domain) استفاده میکنیم یا یک صدای کاملاً اصیل تولید میکنیم که هویت هیچکس را کپی نمیکند. مرحلهٔ تبدیل صدا یک ویژگی سودمند برای حریم خصوصی نیز دارد: خروجی آنقدر از نظر آکوستیک از اهداکننده متمایز است که خطر جعل هویت ناچیز است.
بهکارگیری برای پرتغالی اروپایی
پرتغالی اروپایی هیچ صدای آفلاین بازِ باکیفیتی نداشت. ما چهار صدا تولید کردیم — از جمله هویتهای Miro و Dii که اکنون صداهای پیشفرض OVOS برای pt-PT هستند — با استفاده از دقیقاً همین خطلوله. آنها بهراحتی روی سختافزار معمولی اجرا میشوند، به هیچ اتصال اینترنتی نیاز ندارند و دادهٔ آموزشیشان بهصورت باز منتشر شده است تا هر کسی بتواند آنها را بازتولید یا گسترش دهد.
تمام مدلها و مجموعهدادهها در huggingface.co/OpenVoiceOS و huggingface.co/TigreGotico قرار دارند.