Все статьи

· Casimiro Ferreira· 1 мин чтения

Синтетические датасеты слов активации: семь имён ассистентов, один детектор

  • Datasets
  • Wakewords
  • Speech
  • Synthetic
  • Voice
  • FOSS

Семь имён ассистентов. Семь датасетов. Всё аудио полностью сгенерировано фреймворком TTS phoonnx с использованием голосов Miro и Dii — без человеческих записей, без форм согласия, без раскрытия конфиденциальных данных.

Каждый датасет — это плоский набор из примерно тысячи положительных клипов: слово активации, произнесённое с разными дикторами, темпами и просодией. Сложные негативные примеры и фоновый шум поставляются как отдельные сопутствующие датасеты, которые вы подмешиваете во время обучения: not-wake-words-speech-en, not-wake-words-speech-pt и ambient_noises.

Почему синтетика

Реальные записи требуют месяцев сбора, форм согласия для каждого диктора и всё равно оставляют пробелы по акцентам, которых вы не ожидали. Синтетическая генерация переворачивает это:

  • Воспроизводимость: те же настройки генерации, те же голоса → то же аудио. Полный аудиторский след, без археологии форм согласия.
  • Проверяемость: конвейер генерации и есть документация.
  • Масштабируемость: варьирование темпа речи и характеристик диктора — это изменение параметра, а не студийная сессия.

Для детекции слова активации важное свойство — акустическая различимость, а не естественность. Синтетические данные хорошо соответствуют этому требованию.

Используйте их

Обучите собственный детектор слова активации для OpenVoiceOS, Mycroft или любой открытой голосовой системы. Для аугментации негативными примерами также есть датасеты бытовых и общедоступных фоновых клипов: building_106_kitchen_3secs, public_domain_sounds_3secs и FMA_3secs.

Все датасеты слов активации на HuggingFace → TigreGotico