Проекты ЕС COALA и WASABI построили целый промышленный фреймворк голосового ассистента поверх OpenVoiceOS (некоммерческой голосовой платформы с открытым исходным кодом) и HiveMind, интегрировав их со своим собственным Android-интерфейсом, NLP-движком и стеком Docker.
Я не участвовал в этих внедрениях. В этом-то и суть: стек внедряется благодаря собственным достоинствам, командами с реальными промышленными требованиями.
Открытый конкурс WASABI
Недавно завершился 2-й открытый конкурс WASABI по предоставлению финансовой поддержки как минимум 10 экспериментам под руководством МСП. Этот открытый конкурс призван поддержать эксперименты по цифровой помощи на базе ИИ с участием МСП из обрабатывающей промышленности.
Все эксперименты открытого конкурса WASABI обязаны:
- запускать стек Docker WASABI/COALA OVOS
- подключаться через HiveMind
- разработать пользовательский навык OVOS, содержащий их промышленную логику
Использование OVOS/HiveMind объясняется в этих двух документах проекта WASABI:

Примеры промышленных применений
1. Руководство работником и поддержка сборки
Эксперименты, такие как TICONAI и SKITE, используют навыки OVOS, чтобы направлять работников во время сложных задач, таких как сборка компонентов, валидация процедур или предоставление пошаговых инструкций без помощи рук.
2. Контроль качества и снижение ошибок
Проекты, такие как WALLABI и HUMANENERDIA, ориентированы на предоставление работникам инструкций и чек-листов в реальном времени для предотвращения ошибок. Голосовые ассистенты помогают операторам проверять настройки, помнить о проверках безопасности или перепроверять параметры.
3. Помощь в предиктивном обслуживании
Эксперименты, такие как GENIUS-PM, используют ассистента, чтобы дать техникам по обслуживанию быстрый доступ к данным о состоянии оборудования, объяснениям неисправностей и шагам ремонта — особенно когда их руки заняты.
4. Логистика, обработка материалов и складская поддержка
VELO и AIVEA используют голос, чтобы помочь работникам находить предметы, подтверждать запасы или проверять задачи доставки, перемещаясь по цеху.
5. Адаптация и обучение
ONBOARD и AI-MODE проверяют, как новых сотрудников можно направлять по задачам с помощью голосового руководства, снижая нагрузку на руководителей.
6. Устойчивое развитие, учёт отходов и ресурсоэффективность
VAFER интегрирует голосовые интерфейсы с системами, которые отслеживают переработку, повторное использование материалов и потоки ресурсов, — отчётность без помощи рук в заводских условиях.
Всё это опирается на OVOS и на HiveMind для маршрутизации связи между устройствами, Android-интерфейсом и бэкенд-системами.
Что COALA/WASABI построили поверх OVOS
Хотя проекты не выпустили промышленных навыков с открытым исходным кодом, они создали несколько компонентов вокруг OVOS + HiveMind:
1. Доменный ассистент (DA) на базе RASA
Более ранние исследования COALA разработали NLP-конвейер RASA, обученный на производственных диалогах (о проверках качества, устранении неполадок, эксплуатации оборудования). В WASABI этот движок RASA подключён к OVOS как навык, обрабатывающий специфичный для домена диалог.
2. Android-приложение COALA
Android-фронтенд для работников, подключающийся к OVOS через HiveMind.
Ранняя версия выпущена здесь: https://github.com/BIBA-GmbH/Mycroft-Android
Возможности включают:
- вход через Keycloak
- текстовый или голосовой чат
- интерфейс для инструкций, предупреждений и заметок
- обмен сообщениями на базе HiveMind
3. Полный промышленный стек на базе Docker
Оба проекта поставляют предварительно настроенное окружение Docker, объединяющее:
- OVOS
- HiveMind
- Keycloak (управление пользователями)
- NLP-движок RASA
- сервисы-коннекторы COALA
Это формирует стандартный промышленный стек голосового ассистента, который должны развернуть все эксперименты WASABI.
4. Промышленный речевой датасет
COALA опубликовала многоязычный речевой датасет, записанный на заводах и в мастерских: https://zenodo.org/record/8268928
Почему это работает для промышленности
Цели проектирования, которые важны на заводском цеху, — полная прозрачность для регулируемых секторов, локальное/периферийное развёртывание без зависимости от облака, модульные навыки для проприетарной логики и способность HiveMind распределять голосовые узлы по всему объекту — были заложены с самого начала, а не добавлены задним числом.
Исходный код OVOS и HiveMind: github.com/OpenVoiceOS · github.com/JarbasHiveMind