همهٔ مقاله‌ها

· Casimiro Ferreira· 3 دقیقه مطالعه

شبیه‌سازی صدا برای زبان‌های در معرض خطر: ساخت مدل متن‌به‌گفتار برای آستوریایی و آراگونی

  • TTS
  • Asturian
  • Aragonese
  • Minority Languages
  • Voice Cloning

این مطلب در ابتدا در وبلاگ OpenVoiceOS منتشر شده بود

آستوریایی (ast) و آراگونی (an) زبان‌های رومی‌ای هستند که در شمال اسپانیا توسط جوامعی صحبت می‌شوند که عملاً هیچ پوششی از فناوری صدای تجاری دریافت نمی‌کنند. گویشورانی که دستیار صوتی می‌خواهند از اسپانیایی استفاده می‌کنند — یا بدون آن سر می‌کنند. ما مدل‌های TTS مبتنی بر VITS برای هر دو ساختیم و آن‌ها را به‌صورت وزن‌های باز روی HuggingFace منتشر کردیم.

محدودیت: نسخهٔ Mozilla Common Voice 23.0 برای هر دو زبان چندگویشوره و نسبتاً کوچک است. آموزش یک مدل TTS تک‌گویشورهٔ باکیفیت به‌طور مستقیم روی این داده‌ها امکان‌پذیر نیست. بنابراین از یک رویکرد ترکیبی استفاده کردیم.

خلأ: نبود G2P

یک چیز که با ارتقای مدل در آینده تغییر نخواهد کرد: نه آستوریایی و نه آراگونی هیچ‌کدام فونمایزر باز قابل‌استفاده‌ای ندارند. این مدل‌ها به‌طور مستقیم روی نویسه‌ها (گرافم‌ها) آموزش دیده‌اند. یک فونمایزر می‌توانست ورودی IPA را در زمان اجرا فراهم کند (اجبار تلفظ برای نام‌ها، واژه‌های نوساخته، جابه‌جایی کد) و به‌طور کلی سازگاری را بهبود دهد. اگر از واژگان یا داده‌های تلفظ موجود برای هر یک از این زبان‌ها اطلاع دارید، یا مایل به همکاری در ساخت یکی هستید، با ما تماس بگیرید.

خط لولهٔ ترکیبی

روش‌شناسی کامل در سندِ سفید ما دربارهٔ سنتز ترکیبی مجموعه‌دادهٔ TTS آمده است. نسخهٔ کوتاه:

  1. داده‌های منبع: Common Voice 23.0 — آستوریایی و Common Voice 23.0 — آراگونی. چندگویشوره، با شرایط ضبط متنوع.

  2. فیلترسازی: صدا نرمال‌سازی شد، سکوت‌ها بریده شدند، و داده‌های پرت بر اساس تعداد کلمات در دقیقه حذف شدند. این مرحله اهمیت دارد — رونوشت‌های گویشوران شتاب‌زده یا نامفهوم، هم‌ترازسازی را تضعیف می‌کنند.

  3. بازخوانی صفر-شات: یک مدل تبدیل صدا، صدای چندگویشورهٔ فیلترشده و یک قطعهٔ کوتاه صدای اهداکننده را می‌گیرد و همهٔ گفته‌ها را با صدای اهداکننده بازسنتز می‌کند. نتیجه یک مجموعه‌دادهٔ منسجم تک‌گویشوره با صدایی یکنواخت است که ابعاد آن از منبع اصلی چندگویشوره گرفته شده است.

  4. آموزش VITS از طریق phoonnx: VITS به‌سرعت آموزش می‌بیند، در زمان استنتاج بدون GPU اجرا می‌شود، و مدل‌های حاصل در هر خط لولهٔ سازگار با phoonnx جای می‌گیرند.

نتایج

“L’arcu la vieya ye un fenómenu ópticu y meteorolóxicu que produz l’apaición d’un espectru de lluz continu nel cielu cuando los rayos del sol trespasen pequeñes partícules de mugor conteníes n’atmósfera terrestre. La forma ye la d’un arcu multicolor col roxo hacia la parte esterior y el viola hacia la interior. El arco iris duble, ye menos avezau a vese, y tien los colores invertíos, esto ye, el roxo hacia dientro y el viola hacia l’esterior.”

دانلود: آستوریایی — dii (زنانه) و آستوریایی — miro (مردانه)

“L’arco de sant Chuan ye un fenomeno optico y meteorolochico que produce l’aparición d’un espectro de luz contino en o cielo cuan os rayos d’o sol trescruzan chicotas particlas d’humidat situatas por l’atmosfera terrestre. A forma suya ye a d’un arco multicolor con o royo en a parti exterior y o morau en a interior. No ye tan cutiano l’arco de sant Chuan dople, que incluye un segundo arco mas tenue con as colors chiratas, ye dicir o royo en l’interior y o morau en l’exterior.”

دانلود: آراگونی — dii (زنانه) و آراگونی — miro (مردانه)

خط لوله اعتبار خود را نشان می‌دهد. تلفظ بی‌نقص نیست — آموزش روی نویسه‌ها بدون فونمایزر به این معناست که مدل، آوانگاری را تنها از الگوهای املایی تقریب می‌زند. آنچه اکنون وجود دارد یک خط پایهٔ قابل‌استفاده و یک فرایند تکرارپذیر است.


مدل‌ها را دانلود کنید و به نمونه‌های بالا گوش دهید. اگر داده‌های تلفظ آستوریایی یا آراگونی، یک واژگان G2P در اختیار دارید، یا مایل به مشارکت در ضبط صدا تحت یک مجوز باز هستید، با ما تماس بگیرید — این منابع مستقیماً تکرار بعدی را بهبود می‌دهند.

از پروژهٔ OpenVoiceOS حمایت کنید