Alle artikelen

· Casimiro Ferreira· 1 min leestijd

Synthetische Wakeword-datasets: Zeven Assistentnamen, Eén Detector

  • Datasets
  • Wakewords
  • Speech
  • Synthetic
  • Voice
  • FOSS

Zeven assistentnamen. Zeven datasets. Alle audio is volledig gegenereerd met het TTS-framework phoonnx met behulp van de stemmen Miro en Dii — geen menselijke opnames, geen toestemmingsformulieren, geen blootstelling van privacy.

Elke dataset is een platte verzameling van ongeveer duizend positieve clips — het wakeword uitgesproken met gevarieerde sprekers, snelheden en prosodie. Harde negatieven en achtergrondruis worden geleverd als aparte begeleidende datasets die u tijdens het trainen bijmengt: not-wake-words-speech-en, not-wake-words-speech-pt, en ambient_noises.

Waarom synthetisch

Echte opnames vereisen maanden van verzameling, toestemmingsformulieren voor elke spreker, en laten toch accentlacunes achter die u niet had voorzien. Synthetische generatie keert dat om:

  • Reproduceerbaar: dezelfde generatie-instellingen, dezelfde stemmen → dezelfde audio. Volledig auditspoor, geen archeologie van toestemmingsformulieren.
  • Controleerbaar: de generatiepipeline is de documentatie.
  • Schaalbaar: het variëren van de spreeksnelheid en de kenmerken van de spreker is een parameterwijziging, geen studiosessie.

Voor wakeword-detectie is de relevante eigenschap akoestische onderscheidbaarheid, niet natuurlijkheid. Synthetische data past goed bij die eis.

Gebruik deze

Train uw eigen wakeword-detector voor OpenVoiceOS, Mycroft of elk open spraaksysteem. Voor het aanvullen van negatieve voorbeelden zijn er ook datasets met huishoudelijke en publiek domein achtergrondclips: building_106_kitchen_3secs, public_domain_sounds_3secs, en FMA_3secs.

Alle wakeword-datasets op HuggingFace → TigreGotico