كتابات
من الورشة
ملاحظات حول الذكاء الاصطناعي الصوتي، وتطوير OpenVoiceOS، والبيانات الاصطناعية، وتقنية الكلام للغات الأقليات.
- 6 دقيقة قراءة
تصدير وتكميم نماذج الكلام المفتوحة كي تعمل فعلًا
النموذج الصوتي المدرَّب على صفحة بحثية في GitHub ليس مساعدًا صوتيًا. نحوّل نقاط تفتيش ASR و TTS المفتوحة إلى ONNX و CoreML و GGUF، ونكمِّمها، ونتحقق من المخرجات — ثم ننشر النتائج تحت OpenVoiceOS كي تصل كل لغة تغطيها إلى مساعد حقيقي يعمل دون اتصال.
- ONNX
- CoreML
- GGUF
- ASR
- 15 دقيقة قراءة
نقل البرمجيات بالآلات، وسؤال الترخيص الذي لم نستطع الإجابة عنه
أعدنا كتابة عدة برامج بلغات C وC++ وJava — واجهة G2P الأمامية لـ espeak-ng، وCotovia، وAhoTTS، وHermiT — كبايثون خالص، بذكاء اصطناعي يقرأ الشيفرة المصدرية الأصلية وإنسان يُنسِّق العمل. لم يقرأ أحدٌ من فريقنا الأصول. هذا يثير سؤالين منفصلين: هل يمكن امتلاك الناتج أصلًا، وهل هو عمل مشتق من المدخل؟ أبقينا على تراخيص المصدر لأن ذلك كان أرخص من الإجابة. ما زلنا نظن أن السؤال مفتوح.
- FOSS
- Licensing
- Open Source
- Python
- 8 دقيقة قراءة
عائلة من مكتبات الكلام القائمة على ONNX الخالص
تصون TigreGótico مجموعة من مكتبات الكلام — توسيع النطاق الترددي، واستنساخ الصوت، وتضمينات المتحدث، وكشف النشاط الصوتي، ونبر الكلمات، والتصويت، و TTS، ومكتبة مقاييس لتقييمها جميعًا — تتشارك قاعدة تشغيل واحدة: فقط onnxruntime و numpy، دون PyTorch، ودون حاجة إلى وحدة معالجة رسومات.
- ONNX
- TTS
- voice cloning
- VAD
- 9 دقيقة قراءة
كيف تتّسق منظومة الصوتيات معًا
جولة معمارية في منظومتنا لتحويل النص إلى نطق: scriptconv للترميز، وorthography2ipa كمحرك تحويل حروف إلى IPA عابر للغات، وواجهات أمامية خاصة بكل لغة مبنية فوقه للبرتغالية والباسكية والميرانديزية والبرانكينهو والعربية، وphonematcher للبحث القائم على الصوت. توضح لماذا توجد الطبقات، وما هي شبكة المرشّحين، ومخرجات لهجية حقيقية.
- G2P
- IPA
- Phonetics
- NLP
- 8 دقيقة قراءة
اختيار محرك استنساخ الصوت
تُشغِّل voiceclonnx عشرة محركات لتحويل الصوت خلف واجهة برمجية واحدة، من تبديل السمات بأقرب جار إلى نموذج اللغة المُرمِّز الانحداري الذاتي. هذا دليل إلى عائلات النماذج خلفها، والمقايضة الحقيقية المقيسة بين الوضوح وتشابه المتحدث، وكيفية اختيار محرك لمهمة معيّنة.
- ONNX
- voice cloning
- voice conversion
- self-hosted
- 8 دقيقة قراءة
تنظيف الصوت الرديء: إزالة الضوضاء وتوسيع النطاق الترددي في audiosronnx
غوص عميق في مهمتَي audiosronnx المنفصلتين — إزالة الضوضاء وإعادة بناء الترددات العالية المفقودة — مع سجل المحركات الحقيقي، وأحجام النماذج ورخصها، وقائمة النماذج المرفوضة، وكيفية التحقق مما إذا كانت المخرجات قد تحسّنت فعلًا.
- ONNX
- denoising
- bandwidth extension
- speech
- 8 دقيقة قراءة
قياس جودة الكلام دون لجنة استماع
دليل عملي إلى speechonnxmetrics: ما الذي تقيسه فعلًا MOS، ومُقدِّرات MOS بلا مرجع، والمقاييس الإشارية التدخّلية، ومعدّلا خطأ الكلمات/الأحرف القائمان على ASR، ومتى ينطبق كل منها، ودرجات حقيقية من صوت حقيقي، ولماذا يكون MOS المُتنبَّأ به دليلًا لا حقيقة.
- speechonnxmetrics
- TTS
- ONNX
- evaluation
- 7 دقيقة قراءة
الكتابات والترميزات الصوتية: ما الذي يحوّله scriptconv فعلًا
غوص عميق في scriptconv، المكتبة بلا اعتماديات التي تكشف أنظمة الكتابة وتحوّل بين الترميزات الصوتية. يغطي IPA وARPABET وX-SAMPA؛ وكشف الكتابة وفق ISO-15924؛ وترجمة Buckwalter الصوتية للعربية؛ وتفكيك Hangul إلى jamo؛ وتحويل الكانا، بأمثلة حقيقية مُنفَّذة وحدود صادقة.
- IPA
- Phonetics
- NLP
- Linguistics
- 9 دقيقة قراءة
نموذج المشاعر لا يستطيع التمييز بين شكوى ووداع
رسالتا دعم غاضبتان. واحدة على وشك التصعيد، والأخرى على وشك المغادرة بلا كلمة. لا يكاد أيّ نموذج مشاعر يستطيع التفريق بينهما — لأنها جميعًا تفتقر إلى نفس المحور. نقدّم emotion-algebra.
- Affective Computing
- Emotion
- Machine Learning
- LILACS
- 4 دقيقة قراءة
لماذا نُكدّس البيانات: من الفهارس المستخرَجة إلى نماذج كلام ولغة أذكى
البيانات النظيفة، المُصنَّفة، وذات المصدر الموثّق هي المادة الخام لكل نموذج نُطلقه. كيف تتحوّل الفهارس التي تبنيها أدوات الاستخراج لدينا إلى قوائم مفردات لتوجيه التعرّف على الكلام، ومصنِّفات نوايا، ومدوّنات NER اصطناعية، ومعاجم G2P، وأصوات TTS — ووقودٍ صادق لنماذج LLM.
- Datasets
- Data Collection
- ASR
- NLP
- 5 دقيقة قراءة
إذا أطلق الجميع تطبيقًا، فسنُطلق نحن الصوت: تحويل المواقع إلى تطبيقات صوتية
كل موقع مهمّ انتهى به الأمر مُغلَّفًا في تطبيق جوّال. نقترح الحركة المعاكسة لعصر الصوت وسطر الأوامر: واجهة برمجية نظيفة مع مهارة صوتية لكل موقع، كي تصبح الويب قابلة للتصفّح بالأذن وبلوحة المفاتيح. موقعًا تلو الآخر، يتراكم ذلك ليصبح متصفّحًا صوتيًا.
- Voice
- Accessibility
- OpenVoiceOS
- Web Automation
- 2 دقيقة قراءة
Usenet في 2026: مدونة نصية نظيفة وسابقة للذكاء الاصطناعي للتدريب والتقييم
Usenet أرشيف بكر لخطاب بشري سابق للذكاء الاصطناعي — عقود من منشورات مجموعات الأخبار، كلها من كتابة البشر، ولم تمسّها نماذج اللغة. هذا يجعلها بيانات تدريب وتقييم قيّمة لنماذج اللغة والكلام. بنينا أداة بايثون صغيرة لحصادها.
- Usenet
- Datasets
- NLP
- 3 دقيقة قراءة
صوتان، كل اللغات: Miro و Dii
تتشارك TigreGótico مع OpenVoiceOS لمنح المساعد هويتين صوتيتين متسقتين — Miro و Dii — تبدوان بالطريقة نفسها في كل لغة، مبنيتين بتقنية استنساخ الصوت خاصتنا ومحرك phoonnx. نموذجا TTS لكل لغة يطلبها أحد، بما في ذلك اللغات المهددة بالانقراض.
- phoonnx
- TTS
- OVOS
- voice cloning
- 4 دقيقة قراءة
قولها بشكل صحيح: إزالة اللبس في متجانسات النطق البرتغالية لتحويل النص إلى كلام
كثير من كلمات البرتغالية الأوروبية تُكتب بالطريقة نفسها لكنها تُنطق بشكل مختلف تبعًا للمعنى — وخطأ في حرف العلة يجعل صوت TTS ينطق كلمة أخرى. لقد بنينا bifonia-pt-homographs، وهي مجموعة بيانات مفتوحة موسومة بالمعاني تضم 56,891 جملة عبر 27 كلمة، ومُحلِّلًا صغيرًا بلا اعتماديات يبلغ دقة ≈94% حيث تتوقف مُصنِّفات أقسام الكلام الثقيلة عند ≈75%.
- Datasets
- Portuguese
- TTS
- Grapheme-to-Phoneme
- 4 دقيقة قراءة
نماذج تحويل النص إلى كلام تعمل على حبة بطاطس
phoonnx هو إطار عمل بحثي لتحويل النص إلى كلام قائم على VITS، مبني ليعمل بسلاسة على العتاد منخفض الإمكانات. لا وحدة معالجة رسومات، ولا سحابة، ولا مفتاح API — مجرد صوت ONNX بنحو 15.65 مليون معامل ووحدة معالجة مركزية. إليك كم يمكن أن يكون الصوت الجيد صغيرًا، وكيف ندربه.
- phoonnx
- TTS
- ONNX
- VITS
- 5 دقيقة قراءة
نقدّم لكم أدوات استخلاص قواعد بيانات الموسيقى
جولة في عائلة عملاء بايثون المُصنَّفة (typed) التي نصونها لمصادر الموسيقى — Bandcamp و SoundCloud و SomaFM و TuneIn و iHeartRadio والموسوعات الموسيقية الكبرى — وكلّها تُصدر بيانات وصفية للوسائط متّسقة ومُصنَّفة خلف واجهة واحدة نظيفة وتعمل فوق طبقة نقل HTTP نفسها الممتثِلة ومنخفضة الحجم.
- Scrapers
- Media Metadata
- Music
- Python
- 2 دقيقة قراءة
مجموعة بيانات متعددة اللغات لأنواع الجُمَل: أسئلة، أوامر، تصريحات
نشرنا sentence-types-multilingual — ما يقارب 70,000 جملة عبر سبع لغات، مصنّفة حسب النوع النحوي (سؤال، أمر، تصريح، تعجّب). إنها مجموعة بيانات التدريب التي تقف خلف مكتبة التوجيه little_questions.
- Datasets
- Multilingual
- NLP
- Intent
- 6 دقيقة قراءة
جلسات requests قابلة للتركيب وجاهزة للاستخدام لوصول مرن إلى البيانات العامة
فئتان فرعيتان قابلتان للتركيب من requests.Session لقراءة صفحات الويب العامة بشكل موثوق دون متصفح بلا واجهة في المسار الحرج: نقل متوافق مع TLS، ووكيل FlareSolverr لتحديات JavaScript، والرجوع إلى Wayback Machine، وطلبات مُنوَّعة عبر عناوين IP — هما unblock_requests و anon_requests.
- HTTP
- Scraping
- Cloudflare
- Anti-Bot
- 3 دقيقة قراءة
ملف Robots.txt وخرائط المواقع وكشط الويب الأخلاقي
قبل أن تبني أداة كشط، استكشف الموقع. تقرأ أداة sitemapper ملف robots.txt، وتجلب كل خرائط الموقع، وتزحف اختياريًا عبر رسم الروابط البياني — بحيث تنطلق أداة الكشط لديك من عقد الموقع نفسه بدلًا من القوة الغاشمة.
- Web Scraping
- Sitemaps
- Ethics
- Robots.txt
- 5 دقيقة قراءة
معالجة اللغة الطبيعية الكلاسيكية للبرتغالية: التقطيع المقطعي وتحويل الحروف إلى فونيمات
نظرة على حزمة معالجة اللغة الطبيعية البرتغالية لدينا، القائمة على القواعد والعاملة دون اتصال بالكامل — silabificador للتقطيع المقطعي و TugaPhone لتحويل الحروف إلى فونيمات بما يراعي اللهجة — وكيف ترتبطان بعمل orthography2ipa الأوسع للتنوعات الناطقة بالبرتغالية. لا صناديق سوداء للتعلم العميق: حتمية وسريعة وقليلة الاعتماديات.
- NLP
- Portuguese
- Phonemization
- Grapheme-to-Phoneme
- 8 دقيقة قراءة
تحويل الحروف الكتابية إلى IPA لـ 820 لغة
orthography2ipa هو مورد قائم على البيانات الصرفة، ومؤسَّس لغويًا، يربط الكتابة الإملائية بأبجدية IPA ويُنمذج كيفية ظهور الفونيمات بوصفها تنويعات صوتية (allophones) عبر 909 مواصفة لغوية، و807 لغة، وأكثر من 20 عائلة لغوية. شبكة مرشّحين (lattice)، ومُقطِّع بأسلوب maximal-munch، ومقاييس للمسافة الفونولوجية ومسافة نظام الكتابة، وسلالة لهجية، ومجموعة مواصفات مُتحقَّق منها بمخطط ومُستشهَد بها إلى الأدبيات اللهجية — دون أوزان مُدرَّبة، وقابلة للاستضافة الذاتية بالكامل.
- G2P
- IPA
- Phonetics
- NLP
- 2 دقيقة قراءة
نقدّم أول محوّل صوتي للبرانكينهو
g2p_barranquenho هو أول محوّل مفتوح من الحروف إلى الفونيمات للبرانكينهو، لغة الاتصال الإيبيرية الرومانسية في بارانكوس، البرتغال — قواعد مشتقة من الاتفاقية الإملائية التي نشرتها البلدية حديثًا، قابلة للمراجعة مقابل المصادر المُضمَّنة في المستودع.
- Phonemization
- Barranquenho
- Minority Languages
- NLP
- 3 دقيقة قراءة
استنساخ الأصوات للغات المهددة بالانقراض: بناء نموذج تحويل النص إلى كلام للأسترية والأراغونية
نُطلق نماذج تجريبية لتحويل النص إلى كلام للغة الأسترية (ast) واللغة الأراغونية (an) — وهما لغتان رومانسيتان من لغات الأقليات لا تحظيان عملياً بأي تغطية صوتية تجارية — مبنية بواسطة سلسلة معالجة هجينة: بيانات Common Voice المُرشَّحة، وإعادة الأصوات بأسلوب zero-shot، وتدريب VITS عبر phoonnx.
- TTS
- Asturian
- Aragonese
- Minority Languages
- 3 دقيقة قراءة
OVOS و HiveMind في الصناعة التحويلية
بنى المشروعان الأوروبيان COALA و WASABI إطار عمل كاملًا لمساعد صوتي صناعي حول OVOS + HiveMind، مُدمِجَين إياهما مع أدواتهما وواجهتهما ومحركات المحادثة الخاصة بهما.
- OVOS
- HiveMind
- Industry
- manufacturing
- 1 دقيقة قراءة
مجموعات بيانات كلمات الإيقاظ الاصطناعية: سبعة أسماء لمساعدين، كاشف واحد
نشرنا سبع مجموعات بيانات اصطناعية لكلمات الإيقاظ لأسماء شائعة للمساعدين الصوتيين — hey_computer و hey_mycroft و hey_siri و alexa و home_assistant و voice_assistant و wake_up. درِّب كاشفًا يعمل في كل مكان.
- Datasets
- Wakewords
- Speech
- Synthetic
- 3 دقيقة قراءة
نقدّم phoonnx: إطار عمل TTS الجديد لـ OpenVoiceOS
أصبح phoonnx الآن إطار العمل الأساسي لتحويل النص إلى كلام في OpenVoiceOS — حزمة تدريب واستدلال كاملة قائمة على VITS/ONNX — بدءًا بأصوات جديدة بلغة الباسك للصوتين Miro و Dii.
- phoonnx
- TTS
- OVOS
- ONNX
- 4 دقيقة قراءة
OpenVoiceOS و Home Assistant: فريق الأحلام لأتمتة الصوت
يتولى Home Assistant الأتمتة، ويتولى OVOS الصوت. ثلاث طبقات للتكامل تجعل هذا الاقتران ناجحًا: جسور Wyoming لخط أنابيب الصوت في HA، و ovos-persona-server كوكيل محادثة، و HiveMind لإظهار أجهزة OVOS ككيانات أصلية في HA.
- OVOS
- Home Assistant
- Smart Home
- Voice Automation
- 1 دقيقة قراءة
صناعة أصوات اصطناعية من الصفر
إنشاء صوت لنظام تحويل النص إلى كلام يتطلب عادةً أن يقضي شخص حقيقي ساعات في تسجيل الصوت. وهذا مكلف ويستغرق وقتًا طويلًا، وفي كثير من اللغات أو اللهجات لا وجود لهذه الأصوات على الإطلاق
- TTS
- Synthetic Data
- Voice Cloning
- OVOS
- 2 دقيقة قراءة
بيانات تدريب TTS لصوتَي Miro و Dii: 40 مجموعة بيانات مفتوحة عبر 20 لغة
نشرنا 40 مجموعة بيانات تدريب اصطناعية لصوتَي Miro و Dii عبر البرتغالية والهولندية والألمانية والفرنسية والإيطالية واليابانية والإسبانية والمزيد. استنساخ الصوت على نطاق واسع: كل لغة تحصل على هويتين متسقتين.
- TTS
- Voice
- Datasets
- Miro & Dii
- 2 دقيقة قراءة
لا لغة تُترك خلف الركب
إزالة الحواجز اللغوية في OpenVoiceOS من خلال كشف اللغة وإضافات الترجمة وقدرات الترجمة ثنائية الاتجاه.
- OVOS
- multilingual
- language-detection
- translation