글쓰기
작업실에서
음성 AI, OpenVoiceOS 개발, 합성 데이터, 그리고 소수 언어 음성 기술에 관한 노트.
- 5 분 소요
오픈 음성 모델을 실제로 돌아가게 만들기: 내보내기와 양자화
연구용 GitHub 페이지에 올라온 학습된 음성 모델은 그 자체로 음성 비서가 아닙니다. 우리는 오픈 ASR과 TTS 체크포인트를 ONNX, CoreML, GGUF로 변환하고, 양자화하고, 출력을 검증한 다음 — OpenVoiceOS 아래에 그 결과를 공개하여, 그것이 다루는 모든 언어가 실제 오프라인 비서로 출시되도록 합니다.
- ONNX
- CoreML
- GGUF
- ASR
- 14 분 소요
기계와 함께 이식하기, 그리고 우리가 답할 수 없었던 라이선스 문제
우리는 espeak-ng의 G2P, Cotovia, AhoTTS, HermiT을 포함한 여러 C, C++, Java 프로그램을 순수 Python으로 다시 작성했습니다. AI가 원본 소스를 읽고 사람이 작업을 지휘했습니다. 우리 쪽 사람은 아무도 원본을 읽지 않았습니다. 이는 두 개의 별개 질문을 제기합니다: 그 결과물이 애초에 소유될 수 있는가, 그리고 그것이 입력의 파생물인가? 우리는 답하는 것보다 저렴했기 때문에 upstream 라이선스를 유지했습니다. 우리는 여전히 이 질문이 열려 있다고 생각합니다.
- FOSS
- Licensing
- Open Source
- Python
- 7 분 소요
순수 ONNX 음성 라이브러리 제품군
TigreGótico는 대역폭 확장, 음성 복제, 화자 임베딩, VAD, 단어 강세, 음소화, TTS, 그리고 이들 모두를 채점하는 지표 라이브러리로 이루어진 음성 라이브러리 세트를 유지 관리합니다 — 이들은 하나의 런타임 규칙을 공유합니다: onnxruntime과 numpy만 사용하며, PyTorch도 GPU도 필요 없습니다.
- ONNX
- TTS
- voice cloning
- VAD
- 9 분 소요
음운론 스택이 어떻게 맞물리는가
우리의 텍스트-발음 스택 아키텍처 안내: 표기법을 위한 scriptconv, 언어 간 자소-IPA 엔진인 orthography2ipa, 포르투갈어·바스크어·미란다어·바랑케뉴어·아랍어를 위해 그 위에 구축된 언어별 프론트엔드, 그리고 소리 기반 검색을 위한 phonematcher. 각 계층이 왜 존재하는지, 후보 격자란 무엇인지, 그리고 실제 방언 출력을 보여줍니다.
- G2P
- IPA
- Phonetics
- NLP
- 7 분 소요
음성 복제 엔진 고르기
voiceclonnx는 kNN 특징 교체부터 AR 코덱-LM까지, 10개의 음성 변환 엔진을 하나의 API 뒤에서 실행합니다. 이는 그 뒤에 있는 모델 계열들, 명료도와 화자 유사도 사이의 실제로 측정된 트레이드오프, 그리고 특정 작업을 위한 엔진 선택 방법에 대한 안내서입니다.
- ONNX
- voice cloning
- voice conversion
- self-hosted
- 7 분 소요
나쁜 오디오 정리하기: audiosronnx의 잡음 제거와 대역폭 확장
audiosronnx의 두 가지 별개 작업 — 잡음 제거와 없어진 고주파 재구성 — 에 대한 심층 분석. 실제 엔진 레지스트리, 모델 크기와 라이선스, 반려된 모델 목록, 그리고 출력이 실제로 개선되었는지 확인하는 방법을 다룹니다.
- ONNX
- denoising
- bandwidth extension
- speech
- 7 분 소요
청취 패널 없이 음성 품질 측정하기
speechonnxmetrics 실무 안내서: MOS, 참조 없는 MOS 예측기, 침습적 신호 지표, ASR 기반 WER/CER이 실제로 무엇을 측정하는지, 각각을 언제 적용하는지, 실제 오디오의 실제 점수, 그리고 예측된 MOS가 진실이 아니라 증거인 이유.
- speechonnxmetrics
- TTS
- ONNX
- evaluation
- 6 분 소요
문자 체계와 음성 표기법: scriptconv가 실제로 변환하는 것
문자 체계를 감지하고 음성 표기법 사이를 변환하는 의존성 없는 라이브러리 scriptconv에 대한 심층 분석. IPA, ARPABET, X-SAMPA; ISO-15924 문자 체계 감지; 아랍어를 위한 Buckwalter 음역; 자모로의 한글 분해; 가나 변환을 실제로 실행된 예제와 정직한 한계와 함께 다룹니다.
- IPA
- Phonetics
- NLP
- Linguistics
- 9 분 소요
감성 분석 모델로는 항의와 작별 인사를 구별할 수 없다
화나 보이는 지원 메시지 두 개. 하나는 고객이 에스컬레이션 하려는 것이고, 다른 하나는 아무 말 없이 떠나려는 것이다. 거의 모든 감정 모델이 이 둘을 구별하지 못한다 — 같은 축이 빠져 있기 때문이다. emotion-algebra를 소개한다.
- Affective Computing
- Emotion
- Machine Learning
- LILACS
- 4 분 소요
우리가 데이터를 축적하는 이유: 스크래핑한 카탈로그에서 더 똑똑한 음성·언어 모델까지
깨끗하고, 타입이 정의되어 있으며, 출처가 명확한 데이터는 우리가 출시하는 모든 모델의 원재료입니다. 우리의 스크래퍼가 구축한 카탈로그가 어떻게 ASR 바이어싱 어휘, 의도 분류기, 합성 NER 코퍼스, G2P 사전, TTS 음성 — 그리고 LLM을 위한 정직한 연료가 되는지 살펴봅니다.
- Datasets
- Data Collection
- ASR
- NLP
- 5 분 소요
모두가 앱을 출시한다면, 우리는 음성을 출시하겠다: 웹사이트를 음성 앱으로 바꾸기
중요한 모든 사이트는 모바일 앱으로 감싸졌습니다. 우리는 음성과 CLI 시대를 위한 반대 방향의 움직임을 제안합니다: 사이트마다 깨끗한 API 하나와 음성 스킬 하나를 두어, 웹이 귀와 키보드로 탐색될 수 있게 하는 것입니다. 한 번에 한 사이트씩, 모두 더하면 음성 브라우저가 됩니다.
- Voice
- Accessibility
- OpenVoiceOS
- Web Automation
- 2 분 소요
2026년의 Usenet: 학습과 평가를 위한 깨끗한 AI 이전 텍스트 코퍼스
Usenet은 AI 이전 인간 담론의 손상되지 않은 아카이브입니다 — 수십 년에 걸친 뉴스그룹 게시물로, 모두 인간이 작성했으며 어떤 언어 모델의 손도 타지 않았습니다. 그래서 언어 및 음성 모델의 학습과 평가에 가치 있는 데이터가 됩니다. 우리는 이를 수집하는 작은 Python 도구를 만들었습니다.
- Usenet
- Datasets
- NLP
- 3 분 소요
두 개의 목소리, 모든 언어: Miro & Dii
TigreGótico는 OpenVoiceOS와 협력하여 비서에게 두 개의 일관된 음성 정체성 — Miro와 Dii — 을 부여합니다. 우리의 음성 복제 기술과 phoonnx 엔진으로 구축되어 모든 언어에서 동일하게 들립니다. 누군가 요청하는 모든 언어를 위한 두 개의 TTS 모델, 소멸 위기 언어까지 포함합니다.
- phoonnx
- TTS
- OVOS
- voice cloning
- 4 분 소요
제대로 말하기: TTS를 위한 포르투갈어 이음동철어 중의성 해소
많은 유럽 포르투갈어 단어는 철자가 같지만 의미에 따라 다르게 발음됩니다 — 그리고 모음을 틀리면 TTS 음성이 다른 단어를 말하게 됩니다. 우리는 27개 단어에 걸친 56,891개 문장의, 의미가 라벨링된 개방형 데이터셋 bifonia-pt-homographs를, 그리고 무거운 POS 태거가 약 75%에서 정체되는 곳에서 약 94%에 도달하는 작고 의존성 없는 해석기를 만들었습니다.
- Datasets
- Portuguese
- TTS
- Grapheme-to-Phoneme
- 4 분 소요
감자에서도 돌아가는 TTS 모델
phoonnx는 저사양 하드웨어에서 편안하게 실행되도록 만들어진, VITS 기반 텍스트 음성 변환을 위한 연구 프레임워크입니다. GPU도, 클라우드도, API 키도 없습니다 — 약 1,565만 개의 파라미터를 가진 ONNX 음성과 CPU 하나면 됩니다. 좋은 음성이 얼마나 작을 수 있는지, 그리고 우리가 그것을 어떻게 훈련하는지 소개합니다.
- phoonnx
- TTS
- ONNX
- VITS
- 5 분 소요
우리의 음악 데이터베이스 스크래퍼를 소개합니다
우리가 유지 관리하는, 음악 소스를 위한 타입 지정 Python 클라이언트 제품군을 둘러봅니다 — Bandcamp, SoundCloud, SomaFM, TuneIn, iHeartRadio, 그리고 위대한 음악 백과사전들 — 모두가 하나의 깔끔한 인터페이스 뒤에서 일관되고 타입이 지정된 미디어 메타데이터를 내보내며, 동일한 준법적이고 저용량인 HTTP 전송 위에서 동작합니다.
- Scrapers
- Media Metadata
- Music
- Python
- 2 분 소요
다국어 문장 유형 데이터셋: 질문, 명령, 진술
sentence-types-multilingual을 공개했습니다 — 일곱 개 언어에 걸친 약 70,000개의 문장을 문법적 유형(질문, 명령, 진술, 감탄)에 따라 분류한 데이터셋입니다. little_questions 라우팅 라이브러리를 뒷받침하는 학습 코퍼스입니다.
- Datasets
- Multilingual
- NLP
- Intent
- 5 분 소요
회복력 있는 공개 데이터 접근을 위한 조합 가능하고 즉시 교체 가능한 requests 세션
핫 패스에서 헤드리스 브라우저 없이 공개 웹 페이지를 안정적으로 읽기 위한 조합 가능한 두 개의 requests.Session 서브클래스: TLS 호환 전송, JS 챌린지를 위한 FlareSolverr 프록시, Wayback Machine 대체 수단, 그리고 IP를 분산하는 요청 — unblock_requests와 anon_requests.
- HTTP
- Scraping
- Cloudflare
- Anti-Bot
- 3 분 소요
Robots.txt, Sitemap, 그리고 윤리적 웹 스크래핑
스크래퍼를 만들기 전에 사이트를 정찰하세요. sitemapper는 robots.txt를 읽고, 모든 sitemap을 가져오며, 선택적으로 링크 그래프를 크롤링합니다. 따라서 여러분의 스크래퍼는 무차별 대입 대신 사이트 자체의 계약에서 출발합니다.
- Web Scraping
- Sitemaps
- Ethics
- Robots.txt
- 4 분 소요
포르투갈어를 위한 고전 NLP: 음절 분석과 자소-음소 변환
규칙 기반이며 완전히 오프라인으로 동작하는 우리의 포르투갈어 NLP 스택을 살펴봅니다. 음절 분석을 위한 silabificador와 방언을 인식하는 자소-음소 변환을 위한 TugaPhone, 그리고 이들이 루소폰 변이형을 위한 더 넓은 orthography2ipa 작업과 어떻게 연결되는지를 다룹니다. 딥러닝 블랙박스 없이 결정론적이고 빠르며 의존성이 가볍습니다.
- NLP
- Portuguese
- Phonemization
- Grapheme-to-Phoneme
- 7 분 소요
820개 언어를 위한 자소-IPA 변환
orthography2ipa는 철자를 IPA에 매핑하고, 909개의 언어 사양, 820개 언어, 20개 이상의 어족에 걸쳐 음소가 이음(allophone)으로 실현되는 방식을 모델링하는 순수 데이터 기반의 언어학적 근거를 갖춘 리소스입니다. 후보 격자(lattice), 최대 일치(maximal-munch) 토크나이저, 음운론적·문자적 거리 지표, 방언 계보, 그리고 방언학 문헌에 인용된 스키마 검증 사양 집합을 제공하며, 학습된 가중치 없이 완전히 자체 호스팅이 가능합니다.
- G2P
- IPA
- Phonetics
- NLP
- 2 분 소요
바랑케뉴어를 위한 최초의 음소화기 소개
g2p_barranquenho는 포르투갈 바랑코스의 이베로-로망스 접촉 언어인 바랑케뉴어를 위한 최초의 오픈 자소-음소 변환기입니다. 규칙은 해당 지자체가 새로 발표한 정서법 규약에서 도출되었으며, 함께 커밋된 원본 자료로 감사할 수 있습니다.
- Phonemization
- Barranquenho
- Minority Languages
- NLP
- 3 분 소요
멸종 위기 언어를 위한 음성 복제: 아스투리아스어와 아라곤어를 위한 텍스트-음성 변환 모델 구축
상업적 음성 지원이 사실상 전무한 두 소수 로망스어인 아스투리아스어(ast)와 아라곤어(an)를 위한 실험적 텍스트-음성 변환 모델을 공개합니다. 필터링된 Common Voice 데이터, 제로샷 재발화, phoonnx를 통한 VITS 학습으로 구성된 하이브리드 파이프라인으로 구축했습니다.
- TTS
- Asturian
- Aragonese
- Minority Languages
- 3 분 소요
제조 산업에서의 OVOS와 HiveMind
EU 프로젝트 COALA와 WASABI는 OVOS + HiveMind를 중심으로 산업용 음성 비서 프레임워크 전체를 구축하고, 이를 자체 도구, UI, 대화 엔진과 통합했습니다.
- OVOS
- HiveMind
- Industry
- manufacturing
- 1 분 소요
합성 웨이크워드 데이터셋: 일곱 개의 비서 이름, 하나의 감지기
일반적인 음성 비서 이름을 위한 일곱 개의 합성 웨이크워드 데이터셋을 공개했습니다 — hey_computer, hey_mycroft, hey_siri, alexa, home_assistant, voice_assistant, wake_up. 어디서나 작동하는 감지기를 학습시키세요.
- Datasets
- Wakewords
- Speech
- Synthetic
- 3 분 소요
phoonnx 소개: OpenVoiceOS의 새로운 TTS 프레임워크
phoonnx는 이제 OpenVoiceOS의 기본 음성 합성 프레임워크입니다 — 완전한 VITS/ONNX 학습 및 추론 스택으로, Miro와 Dii를 위한 새로운 바스크어 음성으로 시작합니다.
- phoonnx
- TTS
- OVOS
- ONNX
- 3 분 소요
OpenVoiceOS와 Home Assistant: 음성 자동화 드림팀
Home Assistant는 자동화를 담당하고, OVOS는 음성을 담당합니다. 세 가지 통합 계층이 이 조합을 작동하게 합니다: HA의 음성 파이프라인을 위한 Wyoming 브리지, 대화형 에이전트로서의 ovos-persona-server, 그리고 OVOS 기기를 네이티브 HA 엔티티로 노출하는 HiveMind.
- OVOS
- Home Assistant
- Smart Home
- Voice Automation
- 1 분 소요
처음부터 합성 음성 만들기
음성 합성 시스템을 위한 음성을 만들려면 보통 실제 사람이 몇 시간 동안 오디오를 녹음해야 합니다. 이는 비용이 많이 들고 시간이 오래 걸리며, 많은 언어나 억양에서는 음성 자체가 아예 존재하지 않습니다
- TTS
- Synthetic Data
- Voice Cloning
- OVOS
- 1 분 소요
Miro & Dii TTS 학습 데이터: 20개 로케일에 걸친 40개 오픈 데이터셋
포르투갈어, 네덜란드어, 독일어, 프랑스어, 이탈리아어, 일본어, 스페인어 등에 걸쳐 Miro와 Dii 음성을 위한 40개의 합성 학습 데이터셋을 공개했습니다. 대규모 음성 복제: 모든 언어가 일관된 두 개의 정체성을 갖습니다.
- TTS
- Voice
- Datasets
- Miro & Dii
- 2 분 소요
소외되는 언어 없이
언어 감지, 번역 플러그인, 양방향 번역 기능을 통해 OpenVoiceOS의 언어 장벽을 없앱니다.
- OVOS
- multilingual
- language-detection
- translation