آنچه منتشر میکنیم
تمامی ۴۰ مجموعهدادهٔ آموزشی مصنوعی که برای ساخت Miro و Dii به کار رفت — هویتهای صوتیای که با همکاری OpenVoiceOS توسعه دادیم. این مجموعه پرتغالی اروپایی، پرتغالی برزیلی، هلندی، آلمانی، فرانسوی، ایتالیایی، ژاپنی، اسپانیایی، رومانیایی، لهستانی، سوئدی، هندی، دانمارکی، فارسی، انگلیسی، باسکی و بیشتر را در بر میگیرد. هر مجموعهداده از یک قرارداد نامگذاری یکدست پیروی میکند: tts-train-synthetic-miro_pt-PT، tts-train-synthetic-dii_pt-BR، tts-train-synthetic-miro_nl-NL و به همین ترتیب برای هر جفتزبان.
هر مجموعهداده کاملاً مصنوعی است — متنِ تولیدشده در کنار صدای سنتزشده در ساختار LJSpeech، بدون هیچ جلسهٔ استودیویی — و تحت مجوز باز منتشر شده است تا هر کسی بتواند صدا را دوباره آموزش دهد یا گسترش دهد. آواسازی (Phonemization) در زمان آموزش در phoonnx انجام میشود و بر پژوهش G2P ما برای بیش از ۳۵۰ زبان تکیه دارد.
چگونه هویت صوتی در سراسر زبانها یکدست میماند
ما یک تودهٔ چندزبانهٔ واحد را آموزش نمیدهیم و امیدوار نیستیم که لهجه خودش را درست کند. هر زبان یک مدل تکزبانه میگیرد — که آموزش دیده تا مانند یک گویشور بومی آن زبان به گوش برسد. هویت مشترک میان مدلها از شبیهسازی صدا میآید: هر مدل Miro و هر مدل Dii پیش از تطبیق با زبانی تازه، از همان صدای منبع شبیهسازی میشود. طنین، شخصیت و کیفیت شناختنی صدا — اینها منتقل میشوند. لهجه، بهعمد، منتقل نمیشود.
نتیجهٔ عملی: یک پرتغالیزبان، یک هلندیزبان، یک ژاپنیزبان — همه بهروشنی همان شخص، که هر یک بومی به گوش میرسند.
چرا دادهٔ آموزشی را منتشر کنیم
یک checkpoint بدون دادهٔ آموزشیاش یک جعبهٔ سیاه است. انتشار آن، صدا را قابلبازبینی (میتوانید دقیقاً ببینید از چه چیزی یاد گرفته)، بازتولیدپذیر (phoonnx_train را روی همان داده اجرا کنید، همان نتیجه را بگیرید) و گسترشپذیر (افزودن جمله، تنظیم دقیق برای یک گویش، ساخت یک گویندهٔ تازه بر روی آن) میکند.
این موضوع بیش از همه برای زبانهای کممنبعِ این فهرست اهمیت دارد. وقتی دادهٔ آموزشی باز باشد، جامعهای که به یک زبان صحبت میکند میتواند صدای خودش را بهبود دهد — بدون آنکه منتظر بماند تا یک فروشنده تصمیم بگیرد آن زبان از نظر تجاری جالب است.
کجا همه چیز را پیدا کنید
تمام مجموعهدادهها و مدلهای آموزشدیده زیر TigreGotico در HuggingFace قرار دارند و checkpoint های صوتی سازگار با Piper نیز زیر OpenVoiceOS بازتاب داده شدهاند.
برای چارچوب استنتاج و آموزشی که این مجموعهدادهها را مصرف میکند، به phoonnx مراجعه کنید.