سبعة أسماء لمساعدين. سبع مجموعات بيانات. كل الصوت مُولَّد بالكامل من إطار عمل التحويل من النص إلى الكلام phoonnx باستخدام صوتَي Miro و Dii — دون تسجيلات بشرية، ودون استمارات موافقة، ودون تعريض للخصوصية.
كل مجموعة بيانات هي مجموعة مسطحة من نحو ألف مقطع إيجابي — كلمة الإيقاظ منطوقة بمتحدثين ومعدلات ونبرات متنوعة. تُشحن العينات السلبية الصعبة وضوضاء الخلفية كمجموعات بيانات مرافقة منفصلة تمزجها أثناء التدريب: not-wake-words-speech-en وnot-wake-words-speech-pt وambient_noises.
لماذا الاصطناعي
تتطلب التسجيلات الحقيقية أشهرًا من الجمع، واستمارات موافقة لكل متحدث، ومع ذلك تترك فجوات في اللهجات لم تتوقعها. أما التوليد الاصطناعي فيعكس ذلك:
- قابل للاستنساخ: نفس إعدادات التوليد، ونفس الأصوات ← نفس الصوت. مسار تدقيق كامل، دون بحث أثري عن استمارات الموافقة.
- قابل للتدقيق: خط أنابيب التوليد هو التوثيق نفسه.
- قابل للتوسع: تنويع معدل الكلام وخصائص المتحدث هو تغيير في المعاملات، وليس جلسة استوديو.
بالنسبة لكشف كلمات الإيقاظ، فإن الخاصية المهمة هي التميّز الصوتي، لا الطبيعية. والبيانات الاصطناعية مناسبة تمامًا لهذا المتطلب.
استخدم هذه
درِّب كاشف كلمات الإيقاظ الخاص بك لـ OpenVoiceOS أو Mycroft أو أي نظام صوتي مفتوح. لتعزيز العينات السلبية تتوفر أيضًا مجموعات بيانات لمقاطع خلفية منزلية ومن الملكية العامة: building_106_kitchen_3secs وpublic_domain_sounds_3secs وFMA_3secs.
كل مجموعات بيانات كلمات الإيقاظ على HuggingFace ← TigreGotico