Мы специалисты по FOSS-решениям в области голоса, ИИ и данных. Как создатели стека HiveMind и ключевые участники OpenVoiceOS, мы создаём приватные и соответствующие GDPR голосовые технологии, которые держат ваши данные на вашем собственном оборудовании — и с той же лёгкостью превращаем труднодоступные публичные данные в чистые API и тщательно подготовленные наборы данных.
Как мы работаем
Стандартный формат сотрудничества — ежемесячный абонемент для постоянного доступа и поддержки, с отдельными результатами — наборами данных, обученными моделями, собственными плагинами, интеграциями — которые оцениваются и оплачиваются отдельно по мере их определения. Это делает отношения предсказуемыми для обеих сторон: у вас есть прямой доступ к команде, а каждый конкретный результат имеет свой объём и цену.
Мы также берёмся за отдельные проектные работы, когда объём чётко определён с самого начала.
Мы озвучиваем что угодно
Мы создаём голосовые интерфейсы для чего угодно. С чем бы вы ни хотели разговаривать — устройство, приложение, сервис или целая продуктовая линейка — мы строим для этого голосовой слой, переиспользуя экспертизу и проверенный в боях стек, который мы создали вокруг Open Voice Operating System и HiveMind. Собственные слова активации, связка Text-to-Speech (TTS) и Speech-to-Text (ASR), обработка интентов и заказные компоненты — собранные из проверенной основы с открытым исходным кодом, а не с нуля, и работающие на вашем собственном оборудовании.
Обучение собственных офлайн-голосов TTS
Хотите уникальный голос для своего проекта? Мы обучаем собственные, высококачественные, полностью офлайновые голоса Text-to-Speech. Предоставьте набор данных для конкретного языка или клонируйте эталонный голос — результатом станет быстрая, приватная модель TTS, работающая локально на вашем устройстве и напрямую встраивающаяся в OpenVoiceOS или Home Assistant. Вы сохраняете полный контроль над своими данными.
Интересно, как звучат наши голоса? Попробуйте демо голосов — наши голоса Miro и Dii синтезируются вживую прямо в вашем браузере, более чем на 20 языках.
Дообученное распознавание речи для вашего языка и предметной области
Мы дообучаем передовые модели преобразования речи в текст — Zipformer, Parakeet, Whisper и другие — под ваш конкретный язык, акцент и предметную лексику, чтобы распознавание оставалось надёжным на словах и в условиях, которые действительно важны для вас. Когда обучающих данных ещё не существует, мы находим их — и синтезируем там, где это уместно — с помощью нашего инструментария построения наборов данных. Эта работа опирается на наше партнёрство с Alpha Cephei, привносящее десятилетия экспертизы в автоматическом распознавании речи в ваш проект.
Речевые технологии для малых и лузофонных языков
Мы создаём речевые технологии для языков, которые игнорируют массовые инструменты — включая варианты португальского и другие лузофонные и малые языки. От фонемизации до ASR и TTS мы помогаем недостаточно обслуживаемым языковым сообществам получить современную голосовую поддержку с уважением к приватности.
Извлечение данных, чистые API и наборы данных
Огромное количество ценных данных находится в открытой сети, но фактически недоступно — заперто в неструктурированных страницах, за антибот-защитой, доступно только через недокументированные конечные точки или в форматах, которые не индексирует ни одна поисковая система. Мы извлекаем их и делаем пригодными к использованию:
- Устойчивые скраперы и парсеры для источников, сопротивляющихся автоматизации, спроектированные так, чтобы продолжать работать по мере изменения страниц и защит.
- Обратная разработка API — мы картируем недокументированные или закрытые конечные точки и заново открываем их в виде чистых, типизированных, документированных клиентских библиотек.
- Один чистый API поверх хаотичных источников — единый согласованный интерфейс вместо индивидуального скрапинга под каждого потребителя.
- Построение наборов данных — мы превращаем извлечённые данные в структурированные, версионированные, готовые к ML наборы с понятным происхождением, а где это оправдано — можем публиковать открытые наборы данных.
Это тот же инструментарий, что стоит за нашими собственными клиентскими библиотеками и выпускаемыми нами наборами данных — и он питает всё, от обогащения медиа-метаданных до обучающих корпусов для моделей речи и языка.
Голосовые и доступные веб-сайты
Тот же голосовой стек, который мы поставляем на устройства, работает и в браузере. С phoonnx.js наши голоса TTS синтезируются на стороне клиента — без облачного API, без платы за каждый запрос, без того, чтобы что-либо покидало машину посетителя. Демо голосов на этом самом сайте — тому доказательство: статическая страница, которая говорит.
Мы создаём веб-сайты и веб-приложения вокруг этой возможности — сайты, способные читать себя вслух, голос-ориентированные интерфейсы и доступные по своей конструкции страницы для пользователей, которые просматривают сеть на слух. Производительность, доступность и приватность — это настройки по умолчанию, а не дополнения. Мы также разрабатываем и сопровождаем официальный сайт OpenVoiceOS.