Sete nomes de assistente. Sete datasets. Todo o áudio é gerado inteiramente pela framework TTS phoonnx usando as vozes Miro e Dii. Sem gravações humanas. Sem formulários de consentimento. Sem exposição de privacidade.
Cada dataset é um conjunto plano de cerca de mil clips positivos: a wakeword dita com locutores, ritmos e prosódia variados. Os negativos difíceis e o ruído de fundo vêm como datasets companheiros separados que misturas no momento do treino: not-wake-words-speech-en, not-wake-words-speech-pt, e ambient_noises.
Porquê sintético
As gravações reais levam meses a recolher. Cada locutor precisa de um formulário de consentimento, e o resultado continua a deixar lacunas de sotaque que não antecipaste. A geração sintética evita tudo isso.
- Reproduzível: as mesmas definições de geração e as mesmas vozes produzem o mesmo áudio, com rasto de auditoria completo e sem arqueologia de formulários de consentimento.
- Auditável: a pipeline de geração é a documentação.
- Escalável: variar o ritmo de fala e as características do locutor é uma mudança de parâmetro, não uma sessão de estúdio.
Para a deteção de wakeword, o que importa é a distintividade acústica, não a naturalidade. Os dados sintéticos encaixam nesse requisito.
Usa estes
Treina o teu próprio detetor de wakeword para OpenVoiceOS, Mycroft, ou qualquer sistema de voz aberto. Para aumento de amostras negativas há também datasets de clips de fundo domésticos e de domínio público: building_106_kitchen_3secs, public_domain_sounds_3secs, e FMA_3secs.