همهٔ مقاله‌ها

· Casimiro Ferreira· 2 دقیقه مطالعه

دادهٔ آموزشی TTS برای Miro و Dii: ۴۰ مجموعه‌دادهٔ باز در ۲۰ گویش محلی

  • TTS
  • Voice
  • Datasets
  • Miro & Dii
  • Multilingual
  • FOSS

آنچه منتشر می‌کنیم

تمامی ۴۰ مجموعه‌دادهٔ آموزشی مصنوعی که برای ساخت Miro و Dii به کار رفت — هویت‌های صوتی‌ای که با همکاری OpenVoiceOS توسعه دادیم. این مجموعه پرتغالی اروپایی، پرتغالی برزیلی، هلندی، آلمانی، فرانسوی، ایتالیایی، ژاپنی، اسپانیایی، رومانیایی، لهستانی، سوئدی، هندی، دانمارکی، فارسی، انگلیسی، باسکی و بیشتر را در بر می‌گیرد. هر مجموعه‌داده از یک قرارداد نام‌گذاری یکدست پیروی می‌کند: tts-train-synthetic-miro_pt-PT، tts-train-synthetic-dii_pt-BR، tts-train-synthetic-miro_nl-NL و به همین ترتیب برای هر جفت‌زبان.

هر مجموعه‌داده کاملاً مصنوعی است — متنِ تولیدشده در کنار صدای سنتزشده در ساختار LJSpeech، بدون هیچ جلسهٔ استودیویی — و تحت مجوز باز منتشر شده است تا هر کسی بتواند صدا را دوباره آموزش دهد یا گسترش دهد. آواسازی (Phonemization) در زمان آموزش در phoonnx انجام می‌شود و بر پژوهش G2P ما برای بیش از ۳۵۰ زبان تکیه دارد.

چگونه هویت صوتی در سراسر زبان‌ها یکدست می‌ماند

ما یک تودهٔ چندزبانهٔ واحد را آموزش نمی‌دهیم و امیدوار نیستیم که لهجه خودش را درست کند. هر زبان یک مدل تک‌زبانه می‌گیرد — که آموزش دیده تا مانند یک گویشور بومی آن زبان به گوش برسد. هویت مشترک میان مدل‌ها از شبیه‌سازی صدا می‌آید: هر مدل Miro و هر مدل Dii پیش از تطبیق با زبانی تازه، از همان صدای منبع شبیه‌سازی می‌شود. طنین، شخصیت و کیفیت شناختنی صدا — این‌ها منتقل می‌شوند. لهجه، به‌عمد، منتقل نمی‌شود.

نتیجهٔ عملی: یک پرتغالی‌زبان، یک هلندی‌زبان، یک ژاپنی‌زبان — همه به‌روشنی همان شخص، که هر یک بومی به گوش می‌رسند.

چرا دادهٔ آموزشی را منتشر کنیم

یک checkpoint بدون دادهٔ آموزشی‌اش یک جعبهٔ سیاه است. انتشار آن، صدا را قابل‌بازبینی (می‌توانید دقیقاً ببینید از چه چیزی یاد گرفته)، بازتولیدپذیر (phoonnx_train را روی همان داده اجرا کنید، همان نتیجه را بگیرید) و گسترش‌پذیر (افزودن جمله، تنظیم دقیق برای یک گویش، ساخت یک گویندهٔ تازه بر روی آن) می‌کند.

این موضوع بیش از همه برای زبان‌های کم‌منبعِ این فهرست اهمیت دارد. وقتی دادهٔ آموزشی باز باشد، جامعه‌ای که به یک زبان صحبت می‌کند می‌تواند صدای خودش را بهبود دهد — بدون آنکه منتظر بماند تا یک فروشنده تصمیم بگیرد آن زبان از نظر تجاری جالب است.

کجا همه چیز را پیدا کنید

تمام مجموعه‌داده‌ها و مدل‌های آموزش‌دیده زیر TigreGotico در HuggingFace قرار دارند و checkpoint های صوتی سازگار با Piper نیز زیر OpenVoiceOS بازتاب داده شده‌اند.

برای چارچوب استنتاج و آموزشی که این مجموعه‌داده‌ها را مصرف می‌کند، به phoonnx مراجعه کنید.