Zeven assistentnamen. Zeven datasets. Alle audio is volledig gegenereerd met het TTS-framework phoonnx met behulp van de stemmen Miro en Dii — geen menselijke opnames, geen toestemmingsformulieren, geen blootstelling van privacy.
Elke dataset is een platte verzameling van ongeveer duizend positieve clips — het wakeword uitgesproken met gevarieerde sprekers, snelheden en prosodie. Harde negatieven en achtergrondruis worden geleverd als aparte begeleidende datasets die u tijdens het trainen bijmengt: not-wake-words-speech-en, not-wake-words-speech-pt, en ambient_noises.
Waarom synthetisch
Echte opnames vereisen maanden van verzameling, toestemmingsformulieren voor elke spreker, en laten toch accentlacunes achter die u niet had voorzien. Synthetische generatie keert dat om:
- Reproduceerbaar: dezelfde generatie-instellingen, dezelfde stemmen → dezelfde audio. Volledig auditspoor, geen archeologie van toestemmingsformulieren.
- Controleerbaar: de generatiepipeline is de documentatie.
- Schaalbaar: het variëren van de spreeksnelheid en de kenmerken van de spreker is een parameterwijziging, geen studiosessie.
Voor wakeword-detectie is de relevante eigenschap akoestische onderscheidbaarheid, niet natuurlijkheid. Synthetische data past goed bij die eis.
Gebruik deze
Train uw eigen wakeword-detector voor OpenVoiceOS, Mycroft of elk open spraaksysteem. Voor het aanvullen van negatieve voorbeelden zijn er ook datasets met huishoudelijke en publiek domein achtergrondclips: building_106_kitchen_3secs, public_domain_sounds_3secs, en FMA_3secs.