نُشرت هذه التدوينة في الأصل على مدونة OpenVoiceOS
أصبح phoonnx الآن إطار العمل الأساسي لتحويل النص إلى كلام في OpenVoiceOS — حزمة تدريب واستدلال كاملة مبنية على VITS و ONNX، مصممة لأصوات متسقة وجاهزة للعمل دون اتصال عبر كل لغة ندعمها.
استمع إليه أثناء العمل: يشغّل عرض الأصوات أصوات phoonnx مباشرةً في متصفحك — onnxruntime-web، دون خادم.
لغة جديدة: نقدّم لغة الباسك!
بناءً على عملنا السابق في صناعة أصوات اصطناعية من الصفر وتعاوننا في التعاون العربي لتحويل النص إلى كلام، فإن أحدث الإضافات إلى دعمنا اللغوي هي أصوات بلغة الباسك (eu-ES).
يشمل ذلك كلًا من الصوت الذكوري (Miro) والصوت الأنثوي (Dii)، ما يعزز مهمتنا في دعم حتى اللغات محدودة الموارد التي تفتقر إلى خيارات TTS مفتوحة وعالية الجودة.
في السابق، لم يكن متاحًا سوى صوت أنثوي آلي، عبر إضافة AhoTTS المصنوعة بالتعاون مع ILENIA.
استمع إلى النتائج: أمثلة على أصوات الباسك مفتوحة المصدر الجديدة.
Miro (صوت ذكوري): استمع إلى Miro
Dii (صوت أنثوي): استمع إلى Dii
هوية صوتية ثابتة عبر اللغات
يحتاج OpenVoiceOS إلى صوت علامة متسق: شخصية ذكورية وأنثوية قياسية تبدو ذاتها بغض النظر عن اللغة التي يُهيّأ بها المساعد. فالمستخدم الذي يُعدّ OpenVoiceOS في لشبونة ثم ينتقل لاحقًا إلى الألمانية ينبغي أن يسمع المتحدث المألوف ذاته.
تبني TigreGotico وتصون محرك phoonnx، وتساهم بمجموعات بيانات التدريب المفتوحة، وتدرّب أصوات OVOS متعددة اللغات الافتراضية — Miro (ذكوري) و Dii (أنثوي) — التي تفي بهذا الالتزام.
مرونة المُصوِّتات (phonemizers)
phoonnx أكثر من مجرد أداة استدلال؛ إنه إطار عمل كامل للتدريب والاستدلال مبني على بنية VITS المتينة. تتيح لنا هذه القدرة المزدوجة تصميم الأصوات عالية الجودة ونمذجتها وتدريبها ونشرها بسرعة.
من مفاتيح هذه المرونة القدرة على دعم مُصوِّتات (phonemizers) متنوعة. يحوّل المُصوِّت (أو نموذج G2P - Grapheme-to-Phoneme) النص المكتوب إلى سلسلة الوحدات الصوتية (الفونيمات) التي ينطقها نموذج TTS. قد تتطلب اللغات المختلفة مُصوِّتات مختلفة ومتخصصة للحصول على كلام دقيق.
- التوافق مع eSpeak: من الميزات الأساسية أن نماذج phoonnx متوافقة تمامًا مع بيئة تشغيل محرك Piper TTS الشهير، شريطة أن تكون قد دُرّبت باستخدام مُصوِّت eSpeak المتوفر على نطاق واسع. يضمن هذا سهولة النشر ضمن منظومة OVOS القائمة والمشاريع الخارجية مثل Home Assistant.
- دعم المُصوِّتات المخصصة: لا يقتصر الإطار على eSpeak. على سبيل المثال، فإن النماذج الغاليسية عالية الجودة التي طوّرها Proxecto Nós باستخدام مُصوِّت Cotovia متوافقة تمامًا ويمكن استخدامها مع خط أنابيب phoonnx.
تتيح لنا هذه المرونة دمج أعمال المشاريع مفتوحة المصدر الأخرى والاستفادة منها. في الواقع، وللاستدلال، يمكن لـ phoonnx أن يستخدم بنجاح نماذج دُرّبت في الأصل في مشاريع أخرى، بما في ذلك Coqui و Mimic3 و Piper.
القادم: نماذج G2P المبنية على ByT5
بالنظر إلى المستقبل، نعمل باستمرار على تحسين دقة G2P، وخصوصًا للغات محدودة الموارد. نعمل حاليًا على تطوير واختبار نماذج G2P من الجيل التالي القائمة على بنية ByT5 القوية. تَعِد هذه النماذج القائمة على المحوّلات بتقديم تصويت أكثر دقة ومتانة عبر نطاق أوسع من اللغات.
يمكنك متابعة تطويرها هنا: مجموعة نماذج G2P.
في المستقبل القريب، ستُنشأ إضافة OVOS TTS مخصصة لـ phoonnx وستُجعل الافتراضية لـ OpenVoiceOS، لتحل محل الإضافتين السابقتين: ovos-tts-plugin-piper و ovos-tts-plugin-nos.
في هذه الأثناء، يمكنك تجربة الأصوات الجديدة عبر الإضافة الحالية ovos-tts-plugin-piper
كل ما عليك فعله هو تمرير روابط النموذج ضمن mycroft.conf
"tts": {
"module": "ovos-tts-plugin-piper",
"ovos-tts-plugin-piper": {
"model": "https://huggingface.co/OpenVoiceOS/phoonnx_eu-ES_miro_espeak/resolve/main/miro_eu-ES.onnx",
"model_config": "https://huggingface.co/OpenVoiceOS/phoonnx_eu-ES_miro_espeak/resolve/main/miro_eu-ES.piper.json"
}
}
تقرير التقدّم: اللغات المتاحة
أثمر العمل الجماعي لفريقي OpenVoiceOS و TigreGotico عن مكتبة سريعة التوسّع من نماذج TTS مفتوحة المصدر.
اللغات المدعومة حاليًا:
- العربية
- الباسك
- الهولندية
- الإنجليزية (الأمريكية/البريطانية)
- الفرنسية
- الألمانية
- الإيطالية
- البرتغالية (البرازيل/البرتغال)
- الإسبانية
شارِك واعثر على النماذج
ندعو المجتمع لاستكشاف هذه الموارد الجديدة والاستفادة منها.
| المورد | الوصف | الرابط |
|---|---|---|
| نماذج Phoonnx | نماذج TTS الجديدة المدرَّبة بـ phoonnx بصيغة ONNX. | phoonnx-tts-models |
| أصوات Piper/Phoonnx | المجموعة الكاملة من أصوات OpenVoiceOS المتوافقة مع Piper. | pipertts-voices |
| مجموعات البيانات المفتوحة | مجموعات البيانات المستخدمة لتدريب هذه الأصوات، ما يعزز أبحاث البيانات المفتوحة. | tts-datasets |
استكشف الكتالوج الكامل للنماذج ومجموعات البيانات على Hugging Face: TigreGotico · OpenVoiceOS. للمساهمة بالبيانات، افتح مشكلة أو نقاشًا على phoonnx.