이 글은 원래 OpenVoiceOS 블로그에 게시되었습니다
유럽 포르투갈어를 위한 좋은 오프라인 TTS 음성은 존재하지 않았습니다. 스튜디오 녹음은 비용이 많이 들고 몇 달이 걸리며, 세계 대부분의 언어에서는 그런 녹음이 애초에 이루어진 적이 없습니다. 그래서 저희는 네 개를 처음부터 만들었습니다 — 녹음 부스도, 성우도, 클라우드도 없이.
3단계 파이프라인
1. 합성 음성 쌍 생성. 저희는 기존 TTS 음성을 도너(donor)로 사용하며 — 이해 가능한 오디오를 생성할 수 있는 어떤 소스든 — 대규모 텍스트 코퍼스에 대해 실행하여 수천 개의 오디오/텍스트 쌍을 생성합니다. 도너 음성은 고품질일 필요가 없습니다. 학습할 만큼 일관성이 있기만 하면 됩니다.
2. 음성 변환 적용. 음성 변환 단계는 도너의 음색을 새로운 정체성 — 다른 성별, 나이, 또는 특성 — 으로 변형합니다. 결과 오디오는 도너가 아니라 대상 음성처럼 들립니다. 여기서 새로운 개성이 탄생합니다.
3. 컴팩트한 VITS 모델 학습. 변환된 오디오는 phoonnx_train을 통해 작은 VITS 아키텍처 모델의 학습 세트가 됩니다. 완성된 모델은 ONNX로 내보내지며 완전히 오프라인으로 실행됩니다 — 필요하다면 Raspberry Pi에서도.
윤리적 가드레일
도너가 실제 사람의 음성인 경우, 먼저 명시적인 허가를 받습니다. 허가가 불가능한 경우에는 퍼블릭 도메인 녹음을 사용하거나 누구의 정체성도 복사하지 않는 완전히 독창적인 음성을 생성합니다. 음성 변환 단계에는 유용한 개인정보 보호 속성도 있습니다: 출력물은 도너와 음향적으로 충분히 구별되어 사칭 위험이 무시할 만한 수준입니다.
유럽 포르투갈어에 적용
유럽 포르투갈어에는 고품질 오픈 오프라인 음성이 없었습니다. 저희는 정확히 이 파이프라인을 사용하여 네 개의 음성을 — 현재 pt-PT의 기본 OVOS 음성인 Miro와 Dii 정체성을 포함하여 — 만들었습니다. 이들은 보통 수준의 하드웨어에서 무리 없이 실행되고, 인터넷 연결이 필요 없으며, 학습 데이터는 공개적으로 게시되어 누구나 재현하거나 확장할 수 있습니다.
모든 모델과 데이터셋은 huggingface.co/OpenVoiceOS와 huggingface.co/TigreGotico에 있습니다.