كل المقالات

· Casimiro Ferreira· 2 دقيقة قراءة

بيانات تدريب TTS لصوتَي Miro و Dii: 40 مجموعة بيانات مفتوحة عبر 20 لغة

  • TTS
  • Voice
  • Datasets
  • Miro & Dii
  • Multilingual
  • FOSS

ما الذي نطلقه

جميع مجموعات بيانات التدريب الاصطناعية الأربعين المستخدمة لبناء Miro و Dii — هويتا الصوت اللتان طوّرناهما بالشراكة مع OpenVoiceOS. تغطي المجموعة البرتغالية الأوروبية والبرتغالية البرازيلية والهولندية والألمانية والفرنسية والإيطالية واليابانية والإسبانية والرومانية والبولندية والسويدية والهندية والدنماركية والفارسية والإنجليزية والباسكية والمزيد. تتبع كل مجموعة بيانات اصطلاح تسمية متسقًا: tts-train-synthetic-miro_pt-PT، tts-train-synthetic-dii_pt-BR، tts-train-synthetic-miro_nl-NL، وهكذا لكل زوج لغوي.

كل مجموعة بيانات اصطناعية بالكامل — نص مولَّد مقترن بصوت مركَّب في تخطيط LJSpeech، دون جلسات استوديو — وتُصدَر بموجب رخصة مفتوحة بحيث يمكن لأي شخص إعادة تدريب الصوت أو توسيعه. تجري عملية الفَونمة وقت التدريب في phoonnx، مستندةً إلى بحثنا في G2P لأكثر من 350 لغة.

كيف تبقى هوية الصوت متسقة عبر اللغات

نحن لا ندرّب كتلة واحدة متعددة اللغات ونأمل أن تُصلح اللكنة نفسها بنفسها. تحصل كل لغة على نموذج أحادي اللغة — مدرَّب ليبدو كمتحدث أصلي لتلك اللغة. تأتي الهوية المشتركة بين النماذج من استنساخ الصوت: يُستنسَخ كل نموذج من Miro وكل نموذج من Dii من صوت المصدر نفسه قبل تكييفه مع لغة جديدة. الجرس، والطابع، والجودة المميزة للصوت — كل ذلك ينتقل. أما اللكنة فلا تنتقل، وذلك بشكل متعمَّد.

النتيجة العملية: متحدث بالبرتغالية، ومتحدث بالهولندية، ومتحدث باليابانية — جميعهم بلا لبس الشخص نفسه، وكل منهم يبدو كمتحدث أصلي.

لماذا ننشر بيانات التدريب

نقطة تفتيش (checkpoint) بدون بيانات تدريبها هي صندوق أسود. نشرها يجعل الصوت قابلًا للتدقيق (يمكنك أن ترى بالضبط مما تعلّم)، وقابلًا لإعادة الإنتاج (شغّل phoonnx_train على البيانات نفسها لتحصل على النتيجة نفسها)، وقابلًا للتوسيع (أضِف جملًا، أو اضبطه بدقة للهجة معينة، أو ابنِ متحدثًا جديدًا فوقه).

هذا يهم أكثر ما يهم بالنسبة للغات محدودة الموارد على هذه القائمة. عندما تكون بيانات التدريب مفتوحة، يستطيع المجتمع الناطق بلغة ما تحسين صوته الخاص — دون انتظار أن يقرر بائع أن اللغة مثيرة للاهتمام تجاريًا.

أين تجد كل شيء

جميع مجموعات البيانات والنماذج المدرَّبة موجودة تحت TigreGotico على HuggingFace، مع نقاط تفتيش صوتية متوافقة مع Piper مُنسوخة أيضًا تحت OpenVoiceOS.

للاطلاع على إطار الاستدلال والتدريب الذي يستهلك مجموعات البيانات هذه، راجع phoonnx.