نوشتهها
از کارگاه
یادداشتهایی درباره هوش مصنوعی صدا، توسعه OpenVoiceOS، داده مصنوعی و فناوری گفتار زبانهای اقلیت.
- 7 دقیقه مطالعه
صادرات و کوانتیزهٔ مدلهای باز گفتار تا واقعاً اجرا شوند
یک مدل گفتاریِ آموزشدیده روی یک صفحهٔ پژوهشیِ GitHub یک دستیار صوتی نیست. ما checkpoint های باز ASR و TTS را به ONNX، CoreML و GGUF تبدیل میکنیم، کوانتیزه میکنیم و خروجی را اعتبارسنجی میکنیم — سپس نتایج را زیر OpenVoiceOS منتشر میکنیم تا هر زبانی که پوشش میدهند در یک دستیار واقعی و آفلاین عرضه شود.
- ONNX
- CoreML
- GGUF
- ASR
- 18 دقیقه مطالعه
پورتکردن با ماشینها، و پرسش مجوزی که نتوانستیم پاسخ دهیم
ما چندین برنامهٔ C، ++C و Java را — جلوی G2P در espeak-ng، Cotovia، AhoTTS، HermiT — بهصورت پایتون خالص بازنویسی کردیم، با یک هوش مصنوعی که کد منبع اصلی را میخواند و انسانی که کار را هدایت میکند. هیچ انسانی از تیم ما نسخههای اصلی را نخواند. این دو پرسش جداگانه پیش میآورد: آیا اصلاً میتوان خروجی را مالک شد، و آیا آن یک اثر مشتق از ورودی است؟ ما مجوزهای بالادستی را حفظ کردیم چون این از پاسخدادن ارزانتر بود. هنوز فکر میکنیم این پرسش باز است.
- FOSS
- Licensing
- Open Source
- Python
- 9 دقیقه مطالعه
خانوادهای از کتابخانههای گفتاریِ خالصِ ONNX
TigreGótico مجموعهای از کتابخانههای گفتاری را نگهداری میکند — بسط پهنایباند، شبیهسازی صدا، جاسازیهای گوینده، VAD، تکیهٔ واژه، واجسازی، TTS، و یک کتابخانهٔ سنجه برای امتیازدهی به همهی آنها — که یک قاعدهٔ زماناجرا را مشترک دارند: تنها onnxruntime و numpy، بدون PyTorch، بدون نیاز به GPU.
- ONNX
- TTS
- voice cloning
- VAD
- 11 دقیقه مطالعه
چگونه پشتهٔ واجشناسی ما در کنار هم قرار میگیرد
گشتی معماری در پشتهٔ متن-به-تلفظِ ما: scriptconv برای نشانهگذاری، orthography2ipa بهعنوان موتور میانزبانیِ گرافم به IPA، فرانتاندهای زبانویژه ساختهشده روی آن برای پرتغالی، باسکی، میراندایی، بارانکنیو و عربی، و phonematcher برای جستوجوی مبتنی بر صدا. نشان میدهد چرا این لایهها وجود دارند، یک شبکهٔ نامزد چیست و خروجی واقعیِ گویشی چگونه است.
- G2P
- IPA
- Phonetics
- NLP
- 10 دقیقه مطالعه
انتخاب یک موتور شبیهسازی صدا
voiceclonnx ده موتور تبدیل صدا را پشت یک API اجرا میکند، از تعویض ویژگی kNN تا AR codec-LM. این راهنمایی است بر خانوادههای مدل پشت آنها، معاوضهٔ واقعیِ اندازهگیریشده میان وضوح و شباهت گوینده، و اینکه چگونه یک موتور را برای یک کار خاص انتخاب کنید.
- ONNX
- voice cloning
- voice conversion
- self-hosted
- 10 دقیقه مطالعه
تمیزکردن صدای بد: رفع نویز و بسط پهنایباند در audiosronnx
کاوشی عمیق در دو وظیفهٔ جداگانهٔ audiosronnx — حذف نویز و بازسازی فرکانسهای بالای ازدسترفته — با ثبتنام واقعیِ موتورها، اندازهها و مجوزهای مدل، فهرست مدلهای ردشده، و اینکه چگونه بررسی کنیم آیا خروجی واقعاً بهتر شده.
- ONNX
- denoising
- bandwidth extension
- speech
- 9 دقیقه مطالعه
اندازهگیری کیفیت گفتار بدون یک پانل شنیداری
یک راهنمای کاربردی برای speechonnxmetrics: اینکه MOS، پیشبینهای MOS بدونمرجع، سنجههای سیگنالِ تهاجمی و WER/CER مبتنی بر ASR واقعاً چه چیزی را اندازه میگیرند، هر یک کِی به کار میآید، امتیازهای واقعی از صدای واقعی، و اینکه چرا یک MOS پیشبینیشده شواهد است، نه حقیقت.
- speechonnxmetrics
- TTS
- ONNX
- evaluation
- 8 دقیقه مطالعه
رسمالخطها و نشانهگذاریهای آوایی: scriptconv واقعاً چه چیزی را تبدیل میکند
کاوشی عمیق در scriptconv، کتابخانهٔ بدونوابستگیای که نظامهای نوشتاری را تشخیص میدهد و میان نشانهگذاریهای آوایی تبدیل میکند. IPA، ARPABET و X-SAMPA؛ تشخیص رسمالخط بر پایهٔ ISO-15924؛ حرفنویسی Buckwalter برای عربی؛ تجزیهٔ Hangul به جامو؛ و تبدیل کانا را با نمونههای واقعی و اجراشده و محدودیتهای صادقانه پوشش میدهد.
- IPA
- Phonetics
- NLP
- Linguistics
- 11 دقیقه مطالعه
مدل تشخیص احساسات شما نمیتواند شکایت را از خداحافظی تشخیص دهد
دو پیام حمایتی که عصبانی به نظر میرسند. یکی دارد اوضاع را بدتر میکند، دیگری دارد بدون حرفی میرود. تقریباً هیچ مدل احساسی نمیتواند این دو را از هم تشخیص دهد — چون همهشان یک محور را کم دارند. معرفی emotion-algebra.
- Affective Computing
- Emotion
- Machine Learning
- LILACS
- 5 دقیقه مطالعه
چرا داده انبار میکنیم: از کاتالوگهای استخراجشده تا مدلهای گفتار و زبان هوشمندتر
دادههای تمیز، تایپشده و با منشأ روشن، ماده خام هر مدلی است که عرضه میکنیم. چگونه کاتالوگهایی که scraper های ما میسازند به واژگان biasing برای ASR، طبقهبندهای intent، پیکرههای مصنوعی NER، واژهنامههای G2P و صداهای TTS تبدیل میشوند — و به سوختی صادقانه برای LLM ها.
- Datasets
- Data Collection
- ASR
- NLP
- 7 دقیقه مطالعه
اگر همه یک اپلیکیشن عرضه میکنند، ما صدا عرضه میکنیم: تبدیل وبسایتها به اپلیکیشنهای صوتی
هر سایتی که اهمیت داشت، در قالب یک اپلیکیشن موبایل بستهبندی شد. ما حرکت معکوس را برای عصر صدا و خط فرمان پیشنهاد میکنیم: یک API تمیز بههمراه یک اسکیل صوتی برای هر سایت، تا وب با گوش و با صفحهکلید قابل مرور شود. یک سایت در هر نوبت، و در مجموع به یک مرورگر صوتی میرسیم.
- Voice
- Accessibility
- OpenVoiceOS
- Web Automation
- 2 دقیقه مطالعه
Usenet در ۲۰۲۶: پیکرهای پاک و پیش از عصر هوش مصنوعی برای آموزش و ارزیابی
Usenet یک آرشیو بکر از گفتمان انسانی پیش از عصر هوش مصنوعی است — چند دهه پست newsgroup، همه نوشتهی انسان، بدون آنکه هیچکدام دستخوش مدلهای زبانی شده باشد. همین امر آن را به دادهی آموزشی و ارزیابیِ باارزشی برای مدلهای زبانی و گفتاری تبدیل میکند. ما یک ابزار کوچک Python برای برداشت آن ساختیم.
- Usenet
- Datasets
- NLP
- 4 دقیقه مطالعه
دو صدا، برای هر زبان: Miro و Dii
TigreGótico با OpenVoiceOS همکاری میکند تا به دستیار دو هویت صوتی یکپارچه بدهد — Miro و Dii — که در هر زبانی یکسان به گوش میرسند و با فناوری شبیهسازی صدای ما و موتور phoonnx ساخته شدهاند. دو مدل TTS برای هر زبانی که کسی درخواست کند، از جمله زبانهای در خطر انقراض.
- phoonnx
- TTS
- OVOS
- voice cloning
- 5 دقیقه مطالعه
درست ادا کردن: ابهامزدایی از همنویسههای ناهمآوای پرتغالی برای TTS
بسیاری از واژههای پرتغالی اروپایی یکسان نوشته میشوند اما بسته به معنا متفاوت تلفظ میشوند — و اشتباهکردن در واکه باعث میشود صدای TTS واژهای اشتباه بگوید. ما bifonia-pt-homographs را ساختیم، یک مجموعهداده باز و برچسبخورده بر پایه معنا شامل ۵۶٬۸۹۱ جمله روی ۲۷ واژه، و یک حلکننده کوچک و بدون هیچ وابستگی که به ≈۹۴٪ میرسد، جایی که برچسبگذارهای سنگین POS در حدود ≈۷۵٪ متوقف میمانند.
- Datasets
- Portuguese
- TTS
- Grapheme-to-Phoneme
- 5 دقیقه مطالعه
مدلهای TTS که روی یک سیبزمینی اجرا میشوند
phoonnx یک چارچوب پژوهشی برای تبدیل متن به گفتار مبتنی بر VITS است که برای اجرای راحت روی سختافزارهای کمتوان ساخته شده است. بدون GPU، بدون ابر، بدون کلید API — فقط یک صدای ONNX با حدود ۱۵٫۶۵ میلیون پارامتر و یک CPU. اینجا میبینید که یک صدای خوب چقدر میتواند کوچک باشد، و ما چگونه آنها را آموزش میدهیم.
- phoonnx
- TTS
- ONNX
- VITS
- 6 دقیقه مطالعه
معرفی اسکرپرهای پایگاهداده موسیقی ما
گشتی در خانوادهای از کلاینتهای تایپشده پایتون که برای منابع موسیقی نگهداری میکنیم — Bandcamp، SoundCloud، SomaFM، TuneIn، iHeartRadio و دانشنامههای بزرگ موسیقی — همگی متادیتای رسانهای یکدست و تایپشده را پشت یک واسط تمیز واحد ارائه میدهند و بر همان لایه انتقال HTTP سازگار و کمحجم سوار هستند.
- Scrapers
- Media Metadata
- Music
- Python
- 3 دقیقه مطالعه
یک مجموعهدادهی چندزبانهی انواع جمله: پرسشها، فرمانها، گزارهها
ما sentence-types-multilingual را منتشر کردیم — نزدیک به ۷۰٬۰۰۰ جمله در هفت زبان، دستهبندیشده بر پایهی نوع دستوری (پرسش، فرمان، گزاره، تعجب). این پیکرهی آموزشیِ پشتِ کتابخانهی مسیریابیِ little_questions است.
- Datasets
- Multilingual
- NLP
- Intent
- 7 دقیقه مطالعه
نشستهای ترکیبپذیر و جایگزینِ مستقیمِ requests برای دسترسیِ تابآور به دادههای عمومی
دو زیرکلاسِ ترکیبپذیرِ requests.Session برای خواندن قابلاتکای صفحههای عمومی وب بدون مرورگر بدونسر در مسیر داغ: انتقالی سازگار با TLS، یک پروکسی FlareSolverr برای چالشهای JS، سازوکار پشتیبانِ Wayback Machine و درخواستهای متنوع از نظر IP — یعنی unblock_requests و anon_requests.
- HTTP
- Scraping
- Cloudflare
- Anti-Bot
- 4 دقیقه مطالعه
Robots.txt، نقشههای سایت و اسکرپینگ اخلاقی وب
پیش از آنکه یک اسکرپر بسازید، سایت را شناسایی کنید. sitemapper فایل robots.txt را میخواند، هر نقشهی سایت را دریافت میکند و بهصورت اختیاری گراف پیوندها را میپیماید — تا اسکرپر شما بهجای زور بازو از قرارداد خودِ سایت آغاز کند.
- Web Scraping
- Sitemaps
- Ethics
- Robots.txt
- 5 دقیقه مطالعه
NLP کلاسیک برای پرتغالی: هجابندی و گرافم به واج
نگاهی به پشتهی NLP پرتغالی ما که مبتنی بر قاعده و کاملاً آفلاین است — silabificador برای هجابندی و TugaPhone برای گرافم به واجِ آگاه به گویش — و اینکه چگونه به کار گستردهتر orthography2ipa برای گونههای لوزوفون پیوند میخورند. بدون هیچ جعبهی سیاهِ یادگیری عمیق: قطعی، سریع و سبک از نظر وابستگیها.
- NLP
- Portuguese
- Phonemization
- Grapheme-to-Phoneme
- 9 دقیقه مطالعه
گرافم به IPA برای ۸۰۷ زبان
orthography2ipa یک منبع مبتنی بر دادهی خالص و از نظر زبانشناختی مستند است که املا را به IPA نگاشت میکند و مدل میکند که چگونه واجها در قالب واجگونهها در سراسر ۸۹۶ مشخصهی زبانی، ۸۰۷ زبان و بیش از ۲۰ خانوادهی زبانی نمود پیدا میکنند. یک شبکهی نامزد، یک توکنساز maximal-munch، سنجههای فاصلهی واجشناختی و خطی، تبار گویشی و مجموعهای از مشخصههای اعتبارسنجیشده با اسکیما که به ادبیات گویششناسی استناد داده شدهاند — بدون هیچ وزن آموزشدیده، کاملاً قابل میزبانی روی زیرساخت خودتان.
- G2P
- IPA
- Phonetics
- NLP
- 2 دقیقه مطالعه
معرفی نخستین فونمایزر برای بارانکنیو
g2p_barranquenho نخستین مبدل باز نویسهبهواج برای بارانکنیو است، زبان تماسی ایبرو-رومی بارانکوس در پرتغال — قواعدی برگرفته از قرارداد املایی تازهمنتشرشدهٔ شهرداری، قابل بازبینی در برابر منابع موجود در مخزن.
- Phonemization
- Barranquenho
- Minority Languages
- NLP
- 3 دقیقه مطالعه
شبیهسازی صدا برای زبانهای در معرض خطر: ساخت مدل متنبهگفتار برای آستوریایی و آراگونی
ما در حال انتشار مدلهای آزمایشی متنبهگفتار برای آستوریایی (ast) و آراگونی (an) هستیم — دو زبان رومی اقلیت که عملاً هیچ پوشش صدای تجاریای ندارند — که با یک خط لولهٔ ترکیبی ساخته شدهاند: دادههای فیلترشدهٔ Common Voice، بازخوانی صفر-شات، و آموزش VITS از طریق phoonnx.
- TTS
- Asturian
- Aragonese
- Minority Languages
- 3 دقیقه مطالعه
OVOS و HiveMind در صنعت تولید
پروژههای اروپایی COALA و WASABI یک چارچوب کامل دستیار صوتی صنعتی را حول OVOS + HiveMind ساختهاند و آنها را با ابزارها، واسط کاربری و موتورهای گفتوگوی خود یکپارچه کردهاند.
- OVOS
- HiveMind
- Industry
- manufacturing
- 1 دقیقه مطالعه
مجموعهدادههای مصنوعی Wakeword: هفت نام دستیار، یک آشکارساز
ما هفت مجموعهدادهٔ مصنوعی wakeword برای نامهای رایج دستیارهای صوتی منتشر کردیم — hey_computer، hey_mycroft، hey_siri، alexa، home_assistant، voice_assistant، wake_up. یک آشکارساز آموزش دهید که همهجا کار کند.
- Datasets
- Wakewords
- Speech
- Synthetic
- 4 دقیقه مطالعه
معرفی phoonnx: چارچوب تازهٔ TTS برای OpenVoiceOS
phoonnx اکنون چارچوب اصلی تبدیل متن به گفتار برای OpenVoiceOS است — یک پشتهٔ کامل آموزش و استنتاج VITS/ONNX — که با صداهای تازهٔ باسکی برای Miro و Dii آغاز میشود.
- phoonnx
- TTS
- OVOS
- ONNX
- 4 دقیقه مطالعه
OpenVoiceOS و Home Assistant: تیم رؤیایی خودکارسازی صوتی
Home Assistant خودکارسازی را به عهده میگیرد؛ OVOS صدا را. سه لایهٔ یکپارچهسازی این ترکیب را کارآمد میکنند: پلهای Wyoming برای خطلولهٔ صوتی HA، ovos-persona-server بهعنوان یک عامل گفتوگویی، و HiveMind برای نمایش دستگاههای OVOS بهعنوان موجودیتهای بومی HA.
- OVOS
- Home Assistant
- Smart Home
- Voice Automation
- 2 دقیقه مطالعه
ساخت صداهای مصنوعی از صفر
ساخت یک صدا برای یک سامانهٔ تبدیل متن به گفتار معمولاً نیازمند آن است که یک فرد واقعی ساعتها صرف ضبط صدا کند. این کار پرهزینه و زمانبر است و در بسیاری از زبانها یا لهجهها، صداها اصلاً وجود ندارند
- TTS
- Synthetic Data
- Voice Cloning
- OVOS
- 2 دقیقه مطالعه
دادهٔ آموزشی TTS برای Miro و Dii: ۴۰ مجموعهدادهٔ باز در ۲۰ گویش محلی
ما ۴۰ مجموعهدادهٔ آموزشی مصنوعی برای صداهای Miro و Dii در زبانهای پرتغالی، هلندی، آلمانی، فرانسوی، ایتالیایی، ژاپنی، اسپانیایی و بیشتر منتشر کردیم. شبیهسازی صدا در مقیاس: هر زبان دو هویت یکدست میگیرد.
- TTS
- Voice
- Datasets
- Miro & Dii
- 3 دقیقه مطالعه
هیچ زبانی جا نمیماند
از میان برداشتن موانع زبانی در OpenVoiceOS از طریق تشخیص زبان، افزونههای ترجمه و قابلیتهای ترجمهٔ دوسویه.
- OVOS
- multilingual
- language-detection
- translation