전체 글

· Casimiro Ferreira· 1 분 읽기

Miro & Dii TTS 학습 데이터: 20개 로케일에 걸친 40개 오픈 데이터셋

  • TTS
  • Voice
  • Datasets
  • Miro & Dii
  • Multilingual
  • FOSS

무엇을 공개하는가

OpenVoiceOS와 협력하여 개발한 음성 정체성인 Miro와 Dii를 구축하는 데 사용된 40개의 합성 학습 데이터셋 전체입니다. 이 컬렉션은 유럽 포르투갈어, 브라질 포르투갈어, 네덜란드어, 독일어, 프랑스어, 이탈리아어, 일본어, 스페인어, 루마니아어, 폴란드어, 스웨덴어, 힌디어, 덴마크어, 페르시아어, 영어, 바스크어 등을 아우릅니다. 각 데이터셋은 일관된 명명 규칙을 따릅니다: tts-train-synthetic-miro_pt-PT, tts-train-synthetic-dii_pt-BR, tts-train-synthetic-miro_nl-NL 등 각 언어 쌍마다 이런 식입니다.

모든 데이터셋은 완전히 합성된 것으로 — 생성된 텍스트와 LJSpeech 레이아웃으로 합성된 오디오를 짝지은 것이며, 스튜디오 세션은 없습니다 — 누구나 음성을 재학습하거나 확장할 수 있도록 오픈 라이선스로 공개됩니다. 음소화는 phoonnx에서 학습 시점에 이루어지며, 저희의 350개 이상 언어를 위한 G2P 연구를 활용합니다.

음성 정체성이 언어 전반에 걸쳐 일관되게 유지되는 방법

저희는 하나의 다국어 덩어리를 학습시키고 억양이 알아서 정리되기를 바라지 않습니다. 모든 언어는 단일 언어 모델을 갖습니다 — 그 언어의 원어민처럼 들리도록 학습됩니다. 모델 전반에 걸친 공유된 정체성은 음성 복제에서 나옵니다: 각 Miro와 각 Dii 모델은 새로운 언어에 맞게 조정되기 전에 동일한 소스 음성으로부터 복제됩니다. 음색, 특성, 음성의 인식 가능한 품질 — 이것들은 전이됩니다. 억양은 의도적으로 전이되지 않습니다.

실질적인 결과: 포르투갈어 화자, 네덜란드어 화자, 일본어 화자 — 모두 틀림없이 같은 사람이면서, 각자 원어민처럼 들립니다.

학습 데이터를 공개하는 이유

학습 데이터가 없는 체크포인트는 블랙박스입니다. 이를 공개하면 음성이 감사 가능(무엇으로부터 학습했는지 정확히 볼 수 있음)하고, 재현 가능(동일한 데이터로 phoonnx_train을 실행하면 동일한 결과를 얻음)하며, 확장 가능(문장을 추가하고, 방언에 맞게 파인튜닝하고, 그 위에 새로운 화자를 구축)해집니다.

이는 이 목록에 있는 저자원 언어에 가장 중요합니다. 학습 데이터가 공개되면, 그 언어를 사용하는 커뮤니티가 벤더가 상업적으로 흥미롭다고 판단하기를 기다리지 않고도 자신들의 음성을 개선할 수 있습니다.

모든 것을 찾을 수 있는 곳

모든 데이터셋과 학습된 모델은 HuggingFace의 TigreGotico에 있으며, Piper 호환 음성 체크포인트도 OpenVoiceOS에 미러링되어 있습니다.

이러한 데이터셋을 사용하는 추론 및 학습 프레임워크는 phoonnx를 참조하세요.