كل المقالات

· Casimiro Ferreira· 3 دقيقة قراءة

استنساخ الأصوات للغات المهددة بالانقراض: بناء نموذج تحويل النص إلى كلام للأسترية والأراغونية

  • TTS
  • Asturian
  • Aragonese
  • Minority Languages
  • Voice Cloning

نُشرت هذه المدونة في الأصل على مدونة OpenVoiceOS

الأسترية (ast) والأراغونية (an) لغتان رومانسيتان تتحدث بهما مجتمعات في شمال إسبانيا لا تحظى عملياً بأي تغطية من تقنيات الصوت التجارية. المتحدثون الذين يريدون مساعداً صوتياً يستخدمون الإسبانية — أو يستغنون عنه تماماً. لقد بنينا نموذجَي TTS من نوع VITS لكلتا اللغتين، ونُطلقهما بأوزان مفتوحة على HuggingFace.

القيد: إن Mozilla Common Voice 23.0 لكلتا اللغتين متعدد المتحدثين وصغير نسبياً. تدريب نموذج TTS عالي الجودة لمتحدث واحد مباشرةً على تلك البيانات ليس ممكناً عملياً. لذلك اعتمدنا نهجاً هجيناً.

الفجوة: لا يوجد G2P

أمر لن يتغير مع أي ترقية مستقبلية للنموذج: لا تملك الأسترية ولا الأراغونية مُفَنِّماً (phonemizer) مفتوحاً قابلاً للاستخدام. تُدرَّب هذه النماذج مباشرةً على الحروف (graphemes). من شأن المُفَنِّم أن يفتح الباب أمام إدخال IPA في وقت التشغيل (فرض النطق للأسماء والمصطلحات المستحدثة وحالات التبديل بين اللغات) وأن يحسّن الاتساق بوجه عام. إذا كنت تعرف معاجم أو بيانات نطق موجودة لأي من اللغتين، أو أردت التعاون في بناء واحد، فتواصل معنا.

سلسلة المعالجة الهجينة

المنهجية الكاملة موجودة في الورقة البيضاء حول التركيب الهجين لمجموعات بيانات TTS. النسخة المختصرة:

  1. بيانات المصدر: Common Voice 23.0 — الأسترية وCommon Voice 23.0 — الأراغونية. متعددة المتحدثين، بظروف تسجيل متنوعة.

  2. الترشيح: تسوية الصوت، وقص فترات الصمت، وإزالة القيم الشاذة بحسب عدد الكلمات في الدقيقة. هذه الخطوة مهمة — فالنصوص المنقولة من متحدثين متعجلين أو غير واضحين تقوّض المحاذاة.

  3. إعادة الأصوات بأسلوب zero-shot: يأخذ نموذج تحويل الصوت الصوتَ المُرشَّح متعدد المتحدثين ومقطعاً صوتياً قصيراً لصوت مانح، ويعيد تركيب جميع النطوق بصوت المانح. النتيجة مجموعة بيانات متسقة لمتحدث واحد بصوت موحّد، بحجم المصدر الأصلي متعدد المتحدثين.

  4. تدريب VITS عبر phoonnx: يتدرب VITS بسرعة، ويعمل دون GPU عند الاستدلال، وتندمج النماذج الناتجة في أي سلسلة معالجة متوافقة مع phoonnx.

النتائج

“L’arcu la vieya ye un fenómenu ópticu y meteorolóxicu que produz l’apaición d’un espectru de lluz continu nel cielu cuando los rayos del sol trespasen pequeñes partícules de mugor conteníes n’atmósfera terrestre. La forma ye la d’un arcu multicolor col roxo hacia la parte esterior y el viola hacia la interior. El arco iris duble, ye menos avezau a vese, y tien los colores invertíos, esto ye, el roxo hacia dientro y el viola hacia l’esterior.”

التنزيل: الأسترية — dii (أنثوي) والأسترية — miro (ذكوري)

“L’arco de sant Chuan ye un fenomeno optico y meteorolochico que produce l’aparición d’un espectro de luz contino en o cielo cuan os rayos d’o sol trescruzan chicotas particlas d’humidat situatas por l’atmosfera terrestre. A forma suya ye a d’un arco multicolor con o royo en a parti exterior y o morau en a interior. No ye tan cutiano l’arco de sant Chuan dople, que incluye un segundo arco mas tenue con as colors chiratas, ye dicir o royo en l’interior y o morau en l’exterior.”

التنزيل: الأراغونية — dii (أنثوي) والأراغونية — miro (ذكوري)

سلسلة المعالجة تُثبت صلاحيتها. النطق غير مثالي — فالتدريب على الحروف دون مُفَنِّم يعني أن النموذج يقارب الصوتيات من أنماط الكتابة وحدها. ما هو موجود الآن أساس قابل للاستخدام وعملية قابلة للتكرار.


نزّل النماذج واستمع إليها في الأعلى. إذا كانت لديك بيانات نطق للأسترية أو الأراغونية، أو معجم G2P، أو أردت المساهمة بتسجيلات صوتية بترخيص مفتوح، فتواصل معنا — تلك الموارد تحسّن مباشرةً التكرار التالي.

ادعم مشروع OpenVoiceOS