ما متخصصان صوت، هوش مصنوعی و داده متنباز (FOSS) هستیم. ما به عنوان سازندگان استک HiveMind و مشارکتکنندگان اصلی OpenVoiceOS، فناوری صوتی با اولویت حریم خصوصی و سازگار با GDPR میسازیم که دادههای شما را روی سختافزار خودتان نگه میدارد — و به همان اندازه در تبدیل دادههای عمومی دشوار به APIهای تمیز و مجموعهدادههای گزیده مهارت داریم.
نحوه کار ما
قرارداد استاندارد یک حقالزحمه ماهانه برای دسترسی و پشتیبانی مستمر است، همراه با تحویلشدنیهای مجزا — مجموعهدادهها، مدلهای آموزشدیده، افزونههای سفارشی، یکپارچهسازیها — که با تعریف شدن، جداگانه دامنهبندی و صورتحساب میشوند. این کار رابطه را برای هر دو طرف قابل پیشبینی نگه میدارد: شما دسترسی مستقیم به تیم دارید و هر خروجی مشخص دامنه و قیمت خودش را دارد.
ما همچنین کارهای پروژهای مستقل را که دامنهشان از ابتدا بهخوبی تعریف شده است، میپذیریم.
ما به هر چیزی صدا میدهیم
ما برای هر چیزی رابط صوتی میسازیم. هر چه بخواهید با آن صحبت کنید — یک دستگاه، یک اپلیکیشن، یک سرویس یا یک خط تولید کامل — ما لایه صوتی آن را میسازیم و از تخصص و استک آزمودهای که پیرامون سیستمعامل صوتی باز (Open Voice Operating System) و HiveMind ساختهایم بهره میبریم. کلمات بیدارباش سفارشی، اتصال تبدیل متن به گفتار (TTS) و گفتار به متن (ASR)، مدیریت نیت (intent) و مؤلفههای سفارشی — که به جای ساخت از صفر، از یک پایه متنباز اثباتشده سرهم میشوند و روی سختافزار خودتان اجرا میگردند.
آموزش سفارشی صدای TTS آفلاین
صدایی منحصربهفرد برای پروژه خود میخواهید؟ ما صداهای تبدیل متن به گفتار سفارشی، باکیفیت و کاملاً آفلاین آموزش میدهیم. یک مجموعهداده برای زبانی خاص بیاورید، یا یک صدای مرجع را شبیهسازی کنید — نتیجه یک مدل TTS سریع و خصوصی است که بهصورت محلی روی دستگاه شما اجرا میشود و مستقیماً در OpenVoiceOS یا Home Assistant جای میگیرد. شما کنترل کامل دادههایتان را حفظ میکنید.
کنجکاوید صداهای ما چگونه به گوش میرسند؟ دموی صداها را امتحان کنید — صداهای Miro و Dii ما بهصورت زنده در مرورگرتان، به بیش از ۲۰ زبان، سنتز میشوند.
تشخیص گفتار تنظیمشده برای زبان و حوزه شما
ما مدلهای پیشرفته گفتار به متن — Zipformer، Parakeet، Whisper و دیگران — را برای زبان، لهجه و واژگان تخصصی حوزه شما تنظیم دقیق میکنیم، تا تشخیص روی کلمات و شرایطی که واقعاً برای شما مهم هستند پابرجا بماند. وقتی داده آموزشی هنوز وجود ندارد، ما آن را مییابیم — و در جای مناسب آن را سنتز میکنیم — با استفاده از زنجیره ابزار ساخت مجموعهداده خودمان. این کار با مشارکت ما با Alpha Cephei پشتیبانی میشود که دههها تخصص تشخیص خودکار گفتار را به پروژه شما میآورد.
فناوری گفتار برای زبانهای اقلیت و پرتغالیزبان
ما فناوری گفتار برای زبانهایی میسازیم که ابزارهای متعارف نادیدهشان میگیرند — از جمله گونههای پرتغالی و دیگر زبانهای پرتغالیزبان و اقلیت. از واجنگاری (phonemization) تا ASR و TTS، ما به جامعههای زبانی کمبهره کمک میکنیم پشتیبانی صوتی مدرن و محترم به حریم خصوصی به دست آورند.
استخراج داده، APIهای تمیز و مجموعهدادهها
حجم عظیمی از دادههای ارزشمند روی وب عمومی قرار دارد اما عملاً دستنیافتنی است — محبوس در صفحات بدون ساختار، پشت دفاعهای ضدربات، افشاشده تنها از طریق نقاط پایانی مستندنشده، یا در قالبهایی که هیچ موتور جستجویی آنها را نمایه نمیکند. ما آن را بیرون میکشیم و قابل استفاده میسازیم:
- اسکرپرها و پارسرهای مقاوم برای منابعی که در برابر خودکارسازی مقاومت میکنند، مهندسیشده تا با تغییر صفحات و دفاعها همچنان کار کنند.
- مهندسی معکوس API — ما نقاط پایانی مستندنشده یا خصوصی را نگاشت میکنیم و آنها را بهصورت کتابخانههای کلاینت تمیز، نوعدار و مستند بازعرضه میکنیم.
- یک API تمیز روی منابع درهم — یک رابط یکپارچه و سازگار به جای اسکرپینگ اختصاصی برای هر مصرفکننده.
- ساخت مجموعهداده — ما داده استخراجشده را به مجموعهدادههای ساختاریافته، نسخهبندیشده و آماده یادگیری ماشین با منشأ روشن گزیده میکنیم، و در جایی که منطقی باشد میتوانیم مجموعهدادههای باز منتشر کنیم.
این همان زنجیره ابزاری است که پشت کتابخانههای کلاینت خودمان و مجموعهدادههایی که منتشر میکنیم قرار دارد — و همه چیز را از غنیسازی فراداده رسانه تا پیکرههای آموزشی برای مدلهای گفتار و زبان تغذیه میکند.
وبسایتهای صوتی و دسترسپذیر
همان استک صوتی که روی دستگاهها ارائه میدهیم، در مرورگر نیز اجرا میشود. با phoonnx.js، صداهای TTS ما در سمت کلاینت سنتز میشوند — بدون API ابری، بدون هزینه بهازای هر درخواست، بدون خروج هیچ چیز از دستگاه بازدیدکننده. دموی صداها در همین سایت گواه آن است: یک صفحه ایستا که صحبت میکند.
ما وبسایتها و برنامههای وب را حول این قابلیت میسازیم — سایتهایی که میتوانند خودشان را با صدای بلند بخوانند، رابطهای صوتمحور و صفحاتی که بهصورت پیشفرض دسترسپذیر طراحی شدهاند برای کاربرانی که با گوش وبگردی میکنند. کارایی، دسترسپذیری و حریم خصوصی پیشفرضاند، نه افزودنی. ما همچنین وبسایت رسمی OpenVoiceOS را توسعه میدهیم و نگهداری میکنیم.