نحن متخصصون في الصوت والذكاء الاصطناعي والبيانات مفتوحة المصدر. بصفتنا مبتكري منظومة HiveMind ومساهمين أساسيين في OpenVoiceOS، نبني تقنية صوتية تُعطي الأولوية للخصوصية ومتوافقة مع اللائحة العامة لحماية البيانات (GDPR)، تُبقي بياناتك على أجهزتك الخاصة — ونحن بنفس البراعة نحوّل البيانات العامة صعبة المنال إلى واجهات برمجية نظيفة ومجموعات بيانات منسّقة.
كيف نعمل
الارتباط المعتاد هو أتعاب شهرية مقابل الوصول والدعم المستمرين، مع تسليمات محددة — مجموعات بيانات، ونماذج مُدرّبة، وإضافات مخصصة، وتكاملات — يُحدَّد نطاقها وتُحتسب تكلفتها بشكل منفصل حال تعريفها. وهذا يُبقي العلاقة قابلة للتنبؤ من الطرفين: لديك وصول مباشر إلى الفريق، ولكل مُخرَج ملموس نطاقه وسعره الخاصان.
كما نتولّى أعمال مشاريع مستقلة يكون نطاقها محدداً جيداً منذ البداية.
نُمكّن أي شيء صوتياً
نُنشئ واجهات صوتية لأي شيء. أياً كان ما تريد التحدث إليه — جهاز، أو تطبيق، أو خدمة، أو خط منتجات بأكمله — نبني له الطبقة الصوتية، مُعيدين استخدام الخبرة والمنظومة المُجرَّبة التي بنيناها حول Open Voice Operating System و**HiveMind**. كلمات إيقاظ مخصصة، وربط تحويل النص إلى كلام (TTS) وتحويل الكلام إلى نص (ASR)، ومعالجة النوايا، ومكوّنات مصمّمة خصيصاً — مُجمَّعة من أساس مفتوح المصدر مُثبَت بدلاً من البناء من الصفر، وتعمل على أجهزتك الخاصة.
تدريب أصوات TTS مخصصة تعمل دون اتصال
هل تريد صوتاً فريداً لمشروعك؟ نُدرّب أصوات تحويل نص إلى كلام مخصصة، عالية الجودة، تعمل دون اتصال بالكامل. أحضر مجموعة بيانات للغة معينة، أو استنسِخ صوتاً مرجعياً — والنتيجة نموذج TTS سريع وخاص يعمل محلياً على جهازك ويندمج مباشرة في OpenVoiceOS أو Home Assistant. وتحتفظ بالسيطرة الكاملة على بياناتك.
هل تتساءل كيف تبدو أصواتنا؟ جرّب عرض الأصوات — يجري تركيب صوتَي Miro وDii حياً في متصفحك، بأكثر من 20 لغة.
تعرّف على الكلام مضبوط للغتك ومجالك
نضبط أحدث نماذج تحويل الكلام إلى نص — Zipformer وParakeet وWhisper وغيرها — للغتك ولهجتك ومفردات مجالك المحددة، كي يصمد التعرّف على الكلمات والظروف التي تهمّك فعلاً. وحين لا تكون بيانات التدريب موجودة بعد، نجدها — ونصنّعها حيث يكون ذلك ملائماً — باستخدام سلسلة أدواتنا لبناء مجموعات البيانات. يستند هذا العمل إلى شراكتنا مع Alpha Cephei، التي تجلب عقوداً من خبرة التعرّف الآلي على الكلام إلى مشروعك.
تقنية صوت للغات الأقليات واللغات اللوزوفونية
نبني تقنية صوت للغات التي تتجاهلها الأدوات السائدة — بما في ذلك اللهجات البرتغالية وغيرها من اللغات اللوزوفونية ولغات الأقليات. من التحويل إلى فونيمات وصولاً إلى ASR وTTS، نساعد مجتمعات اللغات المهملة على الحصول على دعم صوتي حديث يحترم الخصوصية.
استخراج البيانات، وواجهات برمجية نظيفة، ومجموعات بيانات
يعيش قدر كبير من البيانات القيّمة على الويب العام لكنه غير قابل للوصول عملياً — محبوس في صفحات غير منظّمة، أو خلف دفاعات مضادة للروبوتات، أو مكشوف فقط عبر نقاط نهاية غير موثّقة، أو في صيغ لا تفهرسها محركات البحث. نحن نستخرجه ونجعله قابلاً للاستخدام:
- أدوات استخلاص وتحليل مرنة للمصادر التي تقاوم الأتمتة، مُهندَسة لتستمر في العمل مع تغيّر الصفحات والدفاعات.
- الهندسة العكسية للواجهات البرمجية — نرسم خرائط نقاط النهاية غير الموثّقة أو الخاصة ونعيد كشفها كمكتبات عملاء نظيفة ومُنمَّطة وموثّقة.
- واجهة برمجية نظيفة واحدة فوق مصادر فوضوية — واجهة واحدة متسقة بدلاً من استخلاص مصمّم خصيصاً لكل مستهلك.
- بناء مجموعات البيانات — ننسّق البيانات المستخرجة في مجموعات بيانات منظّمة، ومُصدَّرة بإصدارات، وجاهزة للتعلّم الآلي مع مصدر واضح، ويمكننا نشر مجموعات بيانات مفتوحة حين يكون ذلك منطقياً.
إنها نفس سلسلة الأدوات التي تقوم عليها مكتبات عملائنا ومجموعات البيانات التي نُصدرها — وهي تغذّي كل شيء من إثراء البيانات الوصفية للوسائط إلى نصوص تدريب نماذج الكلام واللغة.
مواقع إلكترونية مُمكّنة صوتياً وسهلة الوصول
نفس المنظومة الصوتية التي نشحنها على الأجهزة تعمل أيضاً في المتصفح. مع phoonnx.js، تُركَّب أصوات TTS لدينا من جانب العميل — دون واجهة سحابية، ودون تكلفة لكل طلب، ودون مغادرة أي شيء جهاز الزائر. إن عرض الأصوات على هذا الموقع نفسه هو الدليل: صفحة ثابتة تتكلّم.
نبني مواقع وتطبيقات ويب حول تلك القدرة — مواقع تستطيع قراءة نفسها بصوت عالٍ، وواجهات صوتية أولاً، وصفحات سهلة الوصول بالتصميم للمستخدمين الذين يتصفّحون بالسمع. الأداء وسهولة الوصول والخصوصية هي الإعدادات الافتراضية، لا إضافات. كما نطوّر ونصون الموقع الرسمي لـ OpenVoiceOS.