همهٔ مقاله‌ها

· Casimiro Ferreira· 4 دقیقه مطالعه

دو صدا، برای هر زبان: Miro و Dii

  • phoonnx
  • TTS
  • OVOS
  • voice cloning
  • G2P
  • language inclusion

همین حالا آن‌ها را بشنوید: نمایش صداها صداهای Miro و Dii را به‌صورت زنده در مرورگر شما اجرا می‌کند — یک زبان انتخاب کنید، یک جمله تایپ کنید و گوش دهید. بدون نصب، بدون سرور.

مردم صدای یک دستیار را بیش از نامش به خاطر می‌سپارند. بنابراین پرسش محوری در همکاری ما با OpenVoiceOS پرسشی عملی است: دستیار باید در هر زبانی شبیه چه کسی باشد؟

پاسخ Miro (مرد) و Dii (زن) است — دو هویت صوتی که در همه زبان‌هایی که OpenVoiceOS پشتیبانی می‌کند، پابرجا می‌مانند. کاربری که دستیار را در لیسبون پیکربندی می‌کند و بعداً به آلمانی می‌رود، باید همان گوینده آشنا را بشنود. یک صدای برند، برای هر زبان، متعلق به جامعه.

یک هویت، زبان‌های بسیار

روش معمول برای به‌دست آوردن یک صدای چندزبانه، آموزش یک مدل واحد روی چندین زبان به‌طور همزمان است. این روش کار می‌کند، اما گرایش دارد که نتیجه را مخدوش کند: لهجه‌ها از یک زبان به زبان دیگر سرریز می‌شوند، تلفظ تقریبی می‌شود و صدا وضوح یک گوینده بومی را از دست می‌دهد.

ما راه دشوارتر را انتخاب می‌کنیم. برای هر زبان یک مدل تک‌زبانه می‌سازیم — یک مدل، یک زبان، که برای انجام خوب همان زبان آموزش دیده است. ترفندی که آن‌ها را به هم پیوند می‌دهد، شبیه‌سازی صدا است: هر مدل تک‌زبانه Miro از همان هویت مبدأ شبیه‌سازی می‌شود، و همین‌طور برای Dii. نتیجه خانواده‌ای از مدل‌های زبان‌به‌زبان است که هر یک مانند یک بومی سخن می‌گویند، اما همگی همان طنین صدا، همان شخصیت، همان Miro-بودن یا Dii-بودن را در خود دارند. شما تلفظ با کیفیت بومی و یک هویت واحدِ قابل‌تشخیص را با هم به دست می‌آورید، به‌جای اینکه یکی را فدای دیگری کنید.

این مدل‌ها با phoonnx، چارچوب TTS متن‌باز ما، آموزش داده و ارائه می‌شوند — مبتنی بر VITS، صادرشده به ONNX، تنها بر روی CPU. صداها کاملاً آفلاین اجرا می‌شوند؛ بدون ابر، بدون کلید API، بدون خروج داده از سخت‌افزار شما. درون OpenVoiceOS، افزونه ovos-tts-plugin-phoonnx واکشی و بارگذاری آن‌ها را بر عهده دارد. برای شرح کامل سخت‌افزار و معماری، TTS که روی یک سیب‌زمینی اجرا می‌شود را ببینید.

پژوهش G2P که این کار را ممکن می‌سازد

خوب صحبت کردن به یک زبان فقط درباره صدا نیست — درباره دانستن این است که نوشتار قرار است چگونه به گوش برسد. این وظیفه تبدیل نویسه به واج (G2P) است: تبدیل متن نوشته‌شده به توالی واج‌هایی که مدل واقعاً تلفظ می‌کند. هر زبان تازه‌ای که به آن می‌پردازیم، پژوهش G2P خاص خود را به همراه دارد، و بخش بزرگی از کار واقعی در همین پژوهش نهفته است.

phoonnx در اینجا عمداً انعطاف‌پذیر است. می‌تواند طیف کاملی از واج‌سازها را به کار بگیرد — eSpeak، Gruut، Epitran، ByT5 G2P مبتنی بر مدل، و ابزارهای مخصوص هر زبان در جایی که موتورهای عمومی کم می‌آورند. این موضوع مستقیماً به پشته آواشناسی گسترده‌تر ما پیوند می‌خورد: پژوهش رسم‌الخط به IPA ما و واج‌سازهای پرتغالی‌زبان که برای خانواده پرتغالی ساخته‌ایم، همه به یک هدف واحد خدمت می‌کنند — IPA دقیق برای زبان‌هایی که ارائه‌دهندگان بزرگ TTS هرگز زحمت مدل‌سازی دقیق آن‌ها را به خود نداده‌اند. وقتی زبانی واج‌ساز آماده و خوبی ندارد، همان شکاف خودِ پروژه است. ما نخست پژوهش املا به صدا را انجام می‌دهیم، و سپس صدا در پی آن می‌آید.

دو مدل برای هر زبانی که خواسته شود

پیشنهاد مشخص این است و همان قلب این همکاری است: برای هر زبانی که کسی درخواست کند، دو مدل TTS خواهیم ساخت — Miro و Dii. نه یک نقشه‌راه از شاید-روزی‌ها؛ بلکه یک تعهد پایدار. یک زبان بخواهید، و جفت جهانی به آن خواهد رسید.

و منظور ما هر زبان است، نه فقط زبان‌های راحت و از نظر تجاری بدیهی. صداهایی که در جهان کم هستند، به‌ندرت آن‌هایی هستند که صد میلیون گویشور دارند — بلکه زبان‌های در خطر انقراض و اقلیت هستند که TTS اصلی بی‌سروصدا نادیده‌شان می‌گیرد، چون بازارشان کوچک‌تر از آن است که ارزش زحمت داشته باشد. دقیقاً همین زبان‌ها هستند که می‌خواهیم به آن‌ها برسیم: جوامعی که هرگز صدای مصنوعی باکیفیتی برای خود نداشته‌اند، و هیچ دلیلی ندارند که انتظار داشته باشند یک فروشنده Silicon Valley روزی آن را فراهم کند.

این وعده‌ای برای بعداً نیست. در زمان نگارش این مطلب، مجموعه مدل‌های TTS phoonnx در Hugging Face ۱۳ زبان با دست‌کم یک صدای عرضه‌شده را فهرست می‌کند، و ۸ تا از آن‌ها — باسکی، عربی، پرتغالی اروپایی، آستوریایی، آراگونی، فریزی، اکسیتانی و اسپانیایی کلمبیایی — از پیش هم Miro و هم Dii را در دسترس دارند.

باز و خودمیزبان

صداها رایگان و متن‌باز هستند، آفلاین و خودمیزبان اجرا می‌شوند تا هیچ‌چیزی که می‌گویید از سخت‌افزار شما بیرون نرود، و کل پشته — موتور، واج‌سازها، پژوهش G2P، صداهای آموزش‌دیده — باز است تا یک جامعه بتواند آن را بردارد و نگه دارد.

اگر زبان شما هنوز در فهرست نیست، این یک درِ بسته نیست — بلکه درخواستی است که در انتظار مطرح شدن است.