Todos os artigos

· Casimiro Ferreira· 1 min de leitura

Datasets Sintéticos de Wakeword: Sete Nomes de Assistente, Um Detetor

  • Datasets
  • Wakewords
  • Speech
  • Synthetic
  • Voice
  • FOSS

Sete nomes de assistente. Sete datasets. Todo o áudio é gerado inteiramente pela framework TTS phoonnx usando as vozes Miro e Dii. Sem gravações humanas. Sem formulários de consentimento. Sem exposição de privacidade.

Cada dataset é um conjunto plano de cerca de mil clips positivos: a wakeword dita com locutores, ritmos e prosódia variados. Os negativos difíceis e o ruído de fundo vêm como datasets companheiros separados que misturas no momento do treino: not-wake-words-speech-en, not-wake-words-speech-pt, e ambient_noises.

Porquê sintético

As gravações reais levam meses a recolher. Cada locutor precisa de um formulário de consentimento, e o resultado continua a deixar lacunas de sotaque que não antecipaste. A geração sintética evita tudo isso.

  • Reproduzível: as mesmas definições de geração e as mesmas vozes produzem o mesmo áudio, com rasto de auditoria completo e sem arqueologia de formulários de consentimento.
  • Auditável: a pipeline de geração é a documentação.
  • Escalável: variar o ritmo de fala e as características do locutor é uma mudança de parâmetro, não uma sessão de estúdio.

Para a deteção de wakeword, o que importa é a distintividade acústica, não a naturalidade. Os dados sintéticos encaixam nesse requisito.

Usa estes

Treina o teu próprio detetor de wakeword para OpenVoiceOS, Mycroft, ou qualquer sistema de voz aberto. Para aumento de amostras negativas há também datasets de clips de fundo domésticos e de domínio público: building_106_kitchen_3secs, public_domain_sounds_3secs, e FMA_3secs.

Todos os datasets de wakeword no HuggingFace → TigreGotico