همین حالا آنها را بشنوید: نمایش صداها صداهای Miro و Dii را بهصورت زنده در مرورگر شما اجرا میکند — یک زبان انتخاب کنید، یک جمله تایپ کنید و گوش دهید. بدون نصب، بدون سرور.
مردم صدای یک دستیار را بیش از نامش به خاطر میسپارند. بنابراین پرسش محوری در همکاری ما با OpenVoiceOS پرسشی عملی است: دستیار باید در هر زبانی شبیه چه کسی باشد؟
پاسخ Miro (مرد) و Dii (زن) است — دو هویت صوتی که در همه زبانهایی که OpenVoiceOS پشتیبانی میکند، پابرجا میمانند. کاربری که دستیار را در لیسبون پیکربندی میکند و بعداً به آلمانی میرود، باید همان گوینده آشنا را بشنود. یک صدای برند، برای هر زبان، متعلق به جامعه.
یک هویت، زبانهای بسیار
روش معمول برای بهدست آوردن یک صدای چندزبانه، آموزش یک مدل واحد روی چندین زبان بهطور همزمان است. این روش کار میکند، اما گرایش دارد که نتیجه را مخدوش کند: لهجهها از یک زبان به زبان دیگر سرریز میشوند، تلفظ تقریبی میشود و صدا وضوح یک گوینده بومی را از دست میدهد.
ما راه دشوارتر را انتخاب میکنیم. برای هر زبان یک مدل تکزبانه میسازیم — یک مدل، یک زبان، که برای انجام خوب همان زبان آموزش دیده است. ترفندی که آنها را به هم پیوند میدهد، شبیهسازی صدا است: هر مدل تکزبانه Miro از همان هویت مبدأ شبیهسازی میشود، و همینطور برای Dii. نتیجه خانوادهای از مدلهای زبانبهزبان است که هر یک مانند یک بومی سخن میگویند، اما همگی همان طنین صدا، همان شخصیت، همان Miro-بودن یا Dii-بودن را در خود دارند. شما تلفظ با کیفیت بومی و یک هویت واحدِ قابلتشخیص را با هم به دست میآورید، بهجای اینکه یکی را فدای دیگری کنید.
این مدلها با phoonnx، چارچوب TTS متنباز ما، آموزش داده و ارائه میشوند — مبتنی بر VITS، صادرشده به ONNX، تنها بر روی CPU. صداها کاملاً آفلاین اجرا میشوند؛ بدون ابر، بدون کلید API، بدون خروج داده از سختافزار شما. درون OpenVoiceOS، افزونه ovos-tts-plugin-phoonnx واکشی و بارگذاری آنها را بر عهده دارد. برای شرح کامل سختافزار و معماری، TTS که روی یک سیبزمینی اجرا میشود را ببینید.
پژوهش G2P که این کار را ممکن میسازد
خوب صحبت کردن به یک زبان فقط درباره صدا نیست — درباره دانستن این است که نوشتار قرار است چگونه به گوش برسد. این وظیفه تبدیل نویسه به واج (G2P) است: تبدیل متن نوشتهشده به توالی واجهایی که مدل واقعاً تلفظ میکند. هر زبان تازهای که به آن میپردازیم، پژوهش G2P خاص خود را به همراه دارد، و بخش بزرگی از کار واقعی در همین پژوهش نهفته است.
phoonnx در اینجا عمداً انعطافپذیر است. میتواند طیف کاملی از واجسازها را به کار بگیرد — eSpeak، Gruut، Epitran، ByT5 G2P مبتنی بر مدل، و ابزارهای مخصوص هر زبان در جایی که موتورهای عمومی کم میآورند. این موضوع مستقیماً به پشته آواشناسی گستردهتر ما پیوند میخورد: پژوهش رسمالخط به IPA ما و واجسازهای پرتغالیزبان که برای خانواده پرتغالی ساختهایم، همه به یک هدف واحد خدمت میکنند — IPA دقیق برای زبانهایی که ارائهدهندگان بزرگ TTS هرگز زحمت مدلسازی دقیق آنها را به خود ندادهاند. وقتی زبانی واجساز آماده و خوبی ندارد، همان شکاف خودِ پروژه است. ما نخست پژوهش املا به صدا را انجام میدهیم، و سپس صدا در پی آن میآید.
دو مدل برای هر زبانی که خواسته شود
پیشنهاد مشخص این است و همان قلب این همکاری است: برای هر زبانی که کسی درخواست کند، دو مدل TTS خواهیم ساخت — Miro و Dii. نه یک نقشهراه از شاید-روزیها؛ بلکه یک تعهد پایدار. یک زبان بخواهید، و جفت جهانی به آن خواهد رسید.
و منظور ما هر زبان است، نه فقط زبانهای راحت و از نظر تجاری بدیهی. صداهایی که در جهان کم هستند، بهندرت آنهایی هستند که صد میلیون گویشور دارند — بلکه زبانهای در خطر انقراض و اقلیت هستند که TTS اصلی بیسروصدا نادیدهشان میگیرد، چون بازارشان کوچکتر از آن است که ارزش زحمت داشته باشد. دقیقاً همین زبانها هستند که میخواهیم به آنها برسیم: جوامعی که هرگز صدای مصنوعی باکیفیتی برای خود نداشتهاند، و هیچ دلیلی ندارند که انتظار داشته باشند یک فروشنده Silicon Valley روزی آن را فراهم کند.
این وعدهای برای بعداً نیست. در زمان نگارش این مطلب، مجموعه مدلهای TTS phoonnx در Hugging Face ۱۳ زبان با دستکم یک صدای عرضهشده را فهرست میکند، و ۸ تا از آنها — باسکی، عربی، پرتغالی اروپایی، آستوریایی، آراگونی، فریزی، اکسیتانی و اسپانیایی کلمبیایی — از پیش هم Miro و هم Dii را در دسترس دارند.
باز و خودمیزبان
صداها رایگان و متنباز هستند، آفلاین و خودمیزبان اجرا میشوند تا هیچچیزی که میگویید از سختافزار شما بیرون نرود، و کل پشته — موتور، واجسازها، پژوهش G2P، صداهای آموزشدیده — باز است تا یک جامعه بتواند آن را بردارد و نگه دارد.
اگر زبان شما هنوز در فهرست نیست، این یک درِ بسته نیست — بلکه درخواستی است که در انتظار مطرح شدن است.