نُشرت هذه المدونة في الأصل على مدونة OpenVoiceOS
لم يكن هناك صوت TTS جيد يعمل دون اتصال بالإنترنت للبرتغالية الأوروبية. التسجيل في الاستوديو مكلف، ويستغرق شهورًا، وفي معظم لغات العالم لم تحدث التسجيلات ببساطة قط. لذلك بنينا أربعة أصوات من الصفر — دون كابينة تسجيل، ودون ممثل صوتي، ودون سحابة.
خط الأنابيب المكوّن من ثلاث خطوات
1. توليد أزواج كلام اصطناعية. نستخدم صوت TTS موجودًا كمانح — أي مصدر قادر على إنتاج صوت مفهوم — ونشغّله على مجموعة نصية كبيرة لإنتاج آلاف من أزواج الصوت/النص. لا يحتاج الصوت المانح إلى أن يكون عالي الجودة. يكفي أن يكون متماسكًا بما فيه الكفاية ليُتعلَّم منه.
2. تطبيق تحويل الصوت. خطوة تحويل الصوت تحوّل جرس المانح إلى هوية جديدة — جنس أو عمر أو شخصية مختلفة. الصوت الناتج يبدو كالصوت الهدف، لا كالمانح. هنا تُولد شخصية جديدة.
3. تدريب نموذج VITS مدمج. يصبح الصوت المحوَّل مجموعة التدريب لنموذج صغير بمعمارية VITS عبر phoonnx_train. يُصدَّر النموذج النهائي إلى ONNX ويعمل بالكامل دون اتصال بالإنترنت — على Raspberry Pi إذا لزم الأمر.
الضوابط الأخلاقية
إذا كان المانح صوتًا لشخص حقيقي، نحصل على إذن صريح أولًا. وعندما يتعذّر الحصول على أي إذن، نستخدم تسجيلات في الملك العام أو نولّد صوتًا أصليًا بالكامل لا ينسخ هوية أي أحد. كما أن خطوة تحويل الصوت تتمتع بخاصية خصوصية مفيدة: المخرَج متمايز صوتيًا عن المانح بما يكفي لجعل خطر انتحال الهوية ضئيلًا للغاية.
مطبَّق على البرتغالية الأوروبية
لم يكن للبرتغالية الأوروبية أي صوت مفتوح عالي الجودة يعمل دون اتصال بالإنترنت. أنتجنا أربعة أصوات — بما في ذلك هويتا Miro و Dii اللتان أصبحتا الآن صوتَي OVOS الافتراضيين للغة pt-PT — باستخدام خط الأنابيب هذا بالضبط. تعمل بأريحية على عتاد متواضع، ولا تتطلب اتصالًا بالإنترنت، وبيانات التدريب منشورة بشكل مفتوح بحيث يمكن لأي شخص إعادة إنتاجها أو توسيعها.
جميع النماذج ومجموعات البيانات موجودة على huggingface.co/OpenVoiceOS وhuggingface.co/TigreGotico.