전체 글

· Casimiro Ferreira· 3 분 읽기

두 개의 목소리, 모든 언어: Miro & Dii

  • phoonnx
  • TTS
  • OVOS
  • voice cloning
  • G2P
  • language inclusion

지금 들어보세요: 음성 데모는 브라우저에서 Miro와 Dii를 실시간으로 실행합니다 — 언어를 고르고, 문장을 입력하고, 들어보세요. 설치도, 서버도 필요 없습니다.

사람들은 비서의 이름보다 그 목소리를 더 오래 기억합니다. 그래서 OpenVoiceOS와의 파트너십에서 핵심 질문은 실용적인 것입니다: 모든 언어에서, 비서는 누구처럼 들려야 하는가?

그 답은 Miro(남성)와 Dii(여성)입니다 — OpenVoiceOS가 지원하는 모든 언어를 관통하는 두 개의 음성 정체성입니다. 리스본에서 비서를 설정한 사용자가 나중에 독일어로 전환하더라도 동일하게 친숙한 화자를 들어야 합니다. 하나의 브랜드 목소리, 모든 언어, 커뮤니티의 소유물입니다.

하나의 정체성, 여러 언어

다국어 음성을 얻는 일반적인 방법은 하나의 모델을 여러 언어로 한꺼번에 학습시키는 것입니다. 작동은 하지만, 결과를 뭉개는 경향이 있습니다: 억양이 언어들 사이로 번지고, 발음이 대략적으로 되며, 목소리는 원어민의 또렷함을 잃습니다.

우리는 더 어려운 길을 택합니다. 모든 언어에 대해 단일 언어 모델을 구축합니다 — 하나의 모델, 하나의 언어, 그 언어를 잘 하도록 학습됩니다. 이들을 하나로 묶는 비결은 음성 복제입니다: 각 단일 언어 Miro 모델은 동일한 원본 정체성에서 복제되며, Dii도 마찬가지입니다. 그 결과는 각각 원어민처럼 말하면서도 모두 같은 음색, 같은 성격, 같은 Miro다움 혹은 Dii다움을 공유하는 언어별 모델 가족입니다. 하나를 다른 하나와 맞바꾸는 대신, 원어민 수준의 발음 그리고 하나의 알아볼 수 있는 정체성을 함께 얻습니다.

이 모델들은 우리의 오픈 TTS 프레임워크인 phoonnx로 학습되고 서비스됩니다 — VITS 기반, ONNX 익스포트, CPU 전용입니다. 목소리는 완전히 오프라인으로 실행됩니다; 클라우드도, API 키도, 하드웨어를 벗어나는 데이터도 없습니다. OpenVoiceOS 안에서는 ovos-tts-plugin-phoonnx 플러그인이 이들을 가져오고 로드하는 일을 처리합니다. 하드웨어와 아키텍처에 관한 전체 이야기는 감자에서도 돌아가는 TTS를 참조하세요.

이를 가능하게 하는 G2P 연구

언어를 잘 말하는 것은 목소리에만 관한 것이 아닙니다 — 글이 어떻게 소리 나야 하는지를 아는 것에 관한 것입니다. 그것이 자소-음소 변환(G2P) 의 역할입니다: 쓰인 텍스트를 모델이 실제로 발음하는 음소 열로 바꾸는 것입니다. 우리가 다루는 모든 새로운 언어에는 그 자체의 G2P 연구가 따라오며, 진짜 작업의 상당 부분은 바로 그 연구에 있습니다.

phoonnx는 여기서 의도적으로 유연합니다. 다양한 음소화기(phonemizer) — eSpeak, Gruut, Epitran, 모델 기반 ByT5 G2P, 그리고 일반 엔진이 부족한 곳에서는 언어별 도구 — 를 구동할 수 있습니다. 이는 우리의 더 넓은 음성학 스택과 직접 연결됩니다: 우리의 정서법-IPA 연구 와 포르투갈어 계열을 위해 구축한 루소폰 음소화기 는 같은 목표를 지향합니다 — 대형 TTS 제공업체가 결코 신경 써서 모델링하지 않은 언어들을 위한 정확한 IPA입니다. 어떤 언어에 기성품으로 좋은 음소화기가 없을 때, 그 공백이 바로 프로젝트입니다. 우리는 철자-소리 연구를 먼저 하고, 그다음 목소리가 뒤따릅니다.

요청되는 모든 언어를 위한 두 개의 모델

여기 구체적인 제안이 있으며, 이것이 파트너십의 핵심입니다: 누군가 요청하는 모든 언어에 대해, 우리는 두 개의 TTS 모델 — Miro와 Dii — 를 구축할 것입니다. 언젠가 될지도 모른다는 로드맵이 아니라, 상시적인 약속입니다. 언어를 요청하면, 그 보편적인 쌍이 그 언어로 찾아옵니다.

그리고 우리는 편안하고 상업적으로 명백한 언어들뿐만 아니라 모든 언어를 의미합니다. 세상에 없는 목소리들은 좀처럼 억 단위의 화자를 가진 언어들이 아닙니다 — 시장이 너무 작아 신경 쓸 가치가 없다는 이유로 주류 TTS가 조용히 무시하는 소멸 위기 언어와 소수 언어들입니다. 그 언어들이야말로 우리가 도달하고자 하는 언어들입니다: 자신들의 것이라 부를 고품질 합성 음성을 한 번도 가져본 적 없고, 실리콘밸리 벤더가 그것을 제공해 줄 것이라 기대할 이유도 없는 커뮤니티들입니다.

이는 나중을 위한 약속이 아닙니다. 이 글을 쓰는 시점에, Hugging Face의 phoonnx TTS 모델 컬렉션에는 적어도 하나의 음성이 출시된 13개 언어가 올라와 있으며, 그중 8개 — 바스크어, 아랍어, 유럽 포르투갈어, 아스투리아스어, 아라곤어, 프리지아어, 옥시타니아어, 콜롬비아 스페인어 — 는 이미 Miro와 Dii 둘 다 사용할 수 있습니다.

열려 있고 자체 호스팅되는

목소리는 무료이며 오픈 소스이고, 오프라인으로, 자체 호스팅되어 실행되므로 당신이 하는 어떤 말도 하드웨어를 벗어나지 않으며, 전체 스택 — 엔진, 음소화기, G2P 연구, 학습된 목소리 — 이 열려 있어 커뮤니티가 가져가 계속 유지할 수 있습니다.

당신의 언어가 아직 목록에 없다면, 그것은 닫힌 문이 아닙니다 — 아직 이루어지지 않은, 기다리고 있는 요청입니다.