Семь имён ассистентов. Семь датасетов. Всё аудио полностью сгенерировано фреймворком TTS phoonnx с использованием голосов Miro и Dii — без человеческих записей, без форм согласия, без раскрытия конфиденциальных данных.
Каждый датасет — это плоский набор из примерно тысячи положительных клипов: слово активации, произнесённое с разными дикторами, темпами и просодией. Сложные негативные примеры и фоновый шум поставляются как отдельные сопутствующие датасеты, которые вы подмешиваете во время обучения: not-wake-words-speech-en, not-wake-words-speech-pt и ambient_noises.
Почему синтетика
Реальные записи требуют месяцев сбора, форм согласия для каждого диктора и всё равно оставляют пробелы по акцентам, которых вы не ожидали. Синтетическая генерация переворачивает это:
- Воспроизводимость: те же настройки генерации, те же голоса → то же аудио. Полный аудиторский след, без археологии форм согласия.
- Проверяемость: конвейер генерации и есть документация.
- Масштабируемость: варьирование темпа речи и характеристик диктора — это изменение параметра, а не студийная сессия.
Для детекции слова активации важное свойство — акустическая различимость, а не естественность. Синтетические данные хорошо соответствуют этому требованию.
Используйте их
Обучите собственный детектор слова активации для OpenVoiceOS, Mycroft или любой открытой голосовой системы. Для аугментации негативными примерами также есть датасеты бытовых и общедоступных фоновых клипов: building_106_kitchen_3secs, public_domain_sounds_3secs и FMA_3secs.