Sept noms d’assistant. Sept jeux de données. Tout l’audio est généré entièrement à partir de la framework TTS phoonnx en utilisant les voix Miro et Dii — sans enregistrements humains, sans formulaires de consentement, sans exposition de la vie privée.
Chaque jeu de données est un ensemble plat d’environ un millier de clips positifs — le wakeword prononcé avec des locuteurs, des débits et une prosodie variés. Les négatifs difficiles et le bruit de fond sont fournis dans des jeux de données compagnons séparés que vous mélangez au moment de l’entraînement : not-wake-words-speech-en, not-wake-words-speech-pt, et ambient_noises.
Pourquoi le synthétique
Les enregistrements réels exigent des mois de collecte, des formulaires de consentement pour chaque locuteur, et laissent malgré tout des lacunes d’accent que vous n’aviez pas anticipées. La génération synthétique inverse cela :
- Reproductible : les mêmes paramètres de génération, les mêmes voix → le même audio. Piste d’audit complète, sans archéologie de formulaires de consentement.
- Auditable : le pipeline de génération est la documentation.
- Extensible : faire varier le débit de parole et les caractéristiques du locuteur est un changement de paramètre, non une session de studio.
Pour la détection de wakeword, la propriété pertinente est la distinctivité acoustique, non le naturel. Les données synthétiques sont bien adaptées à cette exigence.
Utilisez-les
Entraînez votre propre détecteur de wakeword pour OpenVoiceOS, Mycroft, ou tout système de voix ouvert. Pour l’augmentation d’échantillons négatifs, il existe aussi des jeux de données de clips de fond domestiques et du domaine public : building_106_kitchen_3secs, public_domain_sounds_3secs, et FMA_3secs.
Tous les jeux de données de wakeword sur HuggingFace → TigreGotico