Alpha Cephei
수십 년간의 자동 음성 인식(ASR) 전문성을 우리의 음성 모델 파인튜닝 및 데이터셋 작업에 제공하는 음성 인식 파트너십 — Vosk 및 Kaldi 기반 모델을 만든 팀입니다.
포트폴리오
우리의 오픈 소스 작업 — 음성 AI, 데이터 추출, 데이터셋, NLP, 게임을 아우르는 FOSS 및 자체 호스팅 가능한 라이브러리와 도구, 그리고 우리가 함께 구축하는 OpenVoiceOS와 HiveMind 생태계. 종속성 고착 없이, 필수 클라우드 없이.
코드를 넘어, 우리의 오픈 데이터셋과 모델은 다음에 공개되어 있습니다:Hugging Face,그리고 우리의 학습 노트북은 다음 저장소에 있습니다:ml-notebooks.
커뮤니티
우리는 독립 파트너에게 기여하고, 공적 자금으로 수행한 작업을 OpenVoiceOS 재단에 기부합니다.
수십 년간의 자동 음성 인식(ASR) 전문성을 우리의 음성 모델 파인튜닝 및 데이터셋 작업에 제공하는 음성 인식 파트너십 — Vosk 및 Kaldi 기반 모델을 만든 팀입니다.
스페인의 공용어(스페인어, 카탈루냐어, 바스크어, 갈리시아어) 전반의 언어 기술을 발전시키는 스페인 프로그램. Raspberry Pi와 개인용 컴퓨터에서 실행되는 다운로드 가능하고 프라이버시를 존중하는 음성 비서를 만들기 위해 OVOS 개발에 자금을 지원합니다. 스페인 디지털 전환부와 EU 회복 계획의 지원을 받습니다.
OpenVoiceOS를 빅테크 음성 비서에 대한 안정적이고 프라이버시 우선의 대안으로 지원하는 유럽 위원회의 차세대 인터넷(Next Generation Internet) 프로그램(스위스 SERI 공동 지원 포함). 초점: 다국어 지원, 사용자 온보딩, 플랫폼 안정화, 문서화.
커뮤니티 주도의 프라이버시를 존중하는 오픈소스 음성 AI 플랫폼을 구축하는 독립 비영리 재단. TigreGótico는 OpenVoiceOS의 핵심 기여자이며, 그 설립자는 재단 이사회에서 활동하고 있습니다.
둘러보기
분야별로 필터링하여 더 살펴보세요 — 모든 것이 오픈 소스입니다.
코딩 에이전트 CLI(Claude Code, Gemini, opencode, Antigravity)를 하나의 Provider API 뒤에 두는 비동기 Python 래퍼 — 원샷, 멀티턴 세션, 타입이 지정된 스트리밍 이벤트, 팬아웃/위임/재시도 파이프라인 패턴 제공.
Aho-Corasick 알고리즘을 사용한 개체명 인식.
바스크어와 스페인어를 위한 순수 Python, 무의존성, 버전 인식 자소-음소 변환 — AhoTTS 프런트엔드를 충실히 재현하며 StyleTTS2/VITS 음성 학습에 사용되는 단일 문자 IPA 문자열을 출력합니다.
오디오를 텍스트 전사 및 IPA와 단어, 자소, 문장 단위로 정렬하는 브라우저 기반 도구. 전적으로 클라이언트 측에서 실행되며 서버, 의존성, 빌드 단계가 없습니다.
IP 순환을 지원하는 익명 HTTP; unblock_requests와 결합하여 순환과 봇 차단 우회를 동시에 제공.
orthography2ipa 기반의 tashkeel 발음 부호를 포함한 규칙 기반 아랍어(MSA) 텍스트-IPA 변환 — 문맥 민감 토큰 트리가 태양 문자 동화, hamzat al-waṣl, tanwīn, tāʾ marbūṭa를 처리하며, 번들된 ONNX 모델로 무부호 텍스트를 먼저 발음 부호화합니다.
LibriVox 및 유사 출처에서 퍼블릭 도메인 오디오북을 검색하고 스트리밍합니다.
순수 ONNX로 구현한 음성 복원·잡음 제거·대역폭 확장 — 런타임에 torch 없이 협대역 음성을 48 kHz로 업스케일합니다.
Python을 위한 최소한의 HTTP 클라이언트 라이브러리 — requests의 경량 대안.
TTS를 위한 유럽 포르투갈어 이음 동철이의어 중의성 해소 — 철자는 같지만 의미에 따라 다르게 읽히는 단어의 올바른 발음을 선택합니다(sede = 갈증 vs 본부, forma = 틀 vs 형태). 순수 Python 규칙과 학습 모델, 오픈 데이터셋 포함.
11개 언어를 위한 사전 학습된 Brill 품사 태거로, NLTK 위에서 바로 사용할 수 있는 피클 모델로 제공됩니다 — 학습 없이 텍스트를 태깅합니다.
대화형 AI를 위한 ONNX 기반 추론 엔진.
Classical Archives에서 클래식 작곡가 정보를 가져오는 Python 패키지.
다국어 CRF 키워드/검색어 추출기 — POS와 철자 특징에 대한 CRF를 사용해 자연어 질문에서 쿼리를 뽑아내며, 언어별 사전 학습 모델을 제공합니다.
ONNX로 구현한 DeepMoji 감정/이모지 예측.
일곱 가지 포르투갈어 정서법 규범 간의 감지 및 변환 — 1911년 이전 어원적 표기, 1911/1943/1945/1971/1973년 개혁, 그리고 유럽 및 브라질 하위 변형을 포함한 1990년 Acordo Ortográfico.
대화를 목표를 향해 유도하는 도구.
인간의 감정을 다루기 위한 구조화된 데이터와 연산.
espeak-ng의 자소-음소 프런트엔드를 순수 Python으로 의존성 없이 재구현 — C 확장 없이 텍스트를 음소로만 변환합니다. 86개 언어 표제어 스윕과 31개 언어 문장 코퍼스에서 espeak-ng 바이너리를 바이트 단위로 재현하며 117개 언어를 번들합니다.
공유 orthography2ipa 발음 격자 위에 구축된 방언 인식 바스크어 텍스트-IPA 음소 변환기 — 개방적이고 검증 가능하며 출처를 명시합니다.
바랑케뉴어를 위한 자소-음소 변환.
계층적 에이전트 네트워크를 구축하기 위한 프로토콜 — 경량 위성 기기가 암호화 메시를 통해 OpenVoiceOS부터 LLM 페르소나, 임의의 A2A 에이전트까지 어떤 대화형 에이전트에도 연결됩니다. 생태계는 전송 프로토콜, 음성 위성, 채팅 브리지, 암호화, 무설정 디스커버리를 아우릅니다.
hivemind-core용 A2A 에이전트 프로토콜 플러그인 — JSON-RPC 2.0으로 하이브를 외부 Agent-to-Agent(A2A) 서버에 연결하고 응답을 위성으로 스트리밍합니다.
Python을 위한 간단한 JSON 파일 데이터베이스.
인텐트 인식을 위한 키워드 템플릿 매칭 엔진.
단어 목록 기반의 극히 단순한 순수 Python 언어 감지기.
Linux/SBC의 전력 및 시스템 텔레메트리를 MQTT로 Home Assistant에 게시합니다 — CPU/GPU/RAM/디스크, 온도, 스로틀링, 오디오 + MPRIS, WiFi/Bluetooth를 모두 자동 검색. powerguess 기반.
질문을 파싱하고 분류합니다.
JSON 데이터로부터의 마르코프 체인 텍스트 생성.
ONNX로 내보낸 마르코프 체인 모델.
YouTube 및 기타 출처의 미디어 카탈로그를 인덱싱, 정규화, 중복 제거하고 제공합니다.
제목, 아티스트, 식별자가 미디어 클라이언트와 Music Assistant 통합 간에 매핑되는 방식을 통일하는 공유 미디어 메타데이터 어휘 및 정규화 계층.
Pydantic 기반 미디어 메타데이터 클라이언트와 키가 필요 없는 교차 출처 개체 리졸버.
미란다어를 위한 규칙 기반 음소화기.
numpy와 scipy만을 의존성으로 갖는 scikit-learn 스타일의 머신러닝·신경망 라이브러리 — 읽히기 위해 쓰였습니다.
타입이 지정된 미디어 메타데이터 릴리스를 생성하는 SoundCloud 클라이언트.
커뮤니티 주도, 프라이버시 우선의 오픈소스 음성 비서 플랫폼입니다. TigreGótico는 전체 생태계의 핵심 기여자로서 수십 개 저장소에 걸쳐 음성 플러그인, STT/TTS 서비스, 개발자 도구, 공식 명세 작업을 유지 관리합니다.
순수 Python 데이터 오버 사운드 툴킷 — 공유 WAV/사인/Goertzel 프리미티브를 사용해 오디오 채널로 텍스트와 데이터를 전송합니다(DTMF 등). 핵심 스킴은 의존성이 없습니다.
20개 이상 어족에 걸친 350개 이상 언어의 자소-IPA 및 이음 매핑 — 최대 일치 IPA 토크나이저, 음운 및 문자 거리 지표, 방언 변환, 플러그형 G2P 백엔드 제공.
OpenVoiceOS를 위한 에이전트 통합 프레임워크 — 음성 주도 에이전트 워크플로를 지원합니다.
OpenVoiceOS용 메시지버스 모니터 — 버스 트래픽을 실시간으로 관찰하며 스킬, 인텐트, 서비스를 디버깅합니다.
OpenVoiceOS를 위한 ChromaDB 벡터 임베딩 플러그인.
TTS 합성 전에 대화 텍스트를 정규화하는 OVOS 플러그인(숫자 확장, 약어 처리).
OpenVoiceOS에서 검색/RAG를 위한 문서 청킹.
OVOS 쿼리 결과를 위한 빠른 시맨틱 재순위 플러그인.
OpenVoiceOS를 위한 로컬 GGUF 임베딩 플러그인.
OpenVoiceOS를 위한 로컬 LLM(GGUF) 플러그인.
OpenVoiceOS에서 GGUF 모델을 사용하는 로컬 LLM 솔버.
OpenVoiceOS 스킬과 플러그인을 위한 GitHub 네이티브 지역화 플랫폼 — 외부 서비스를 운영할 필요 없이 Git만으로 번역을 관리합니다.
OpenVoiceOS 인텐트 처리를 위한 Model2Vec 인텐트 파이프라인.
대화 턴을 OVOS 메시지버스로 프록시하는 OVOS ChatEngine 플러그인 — 채팅 인터페이스를 실행 중인 어시스턴트에 바로 연결합니다.
OpenVoiceOS용 오픈 데이터 지표 서버 — 익명 사용 지표를 수집해 오픈 데이터셋으로 공개합니다. ILENIA 프로젝트로 개발되었습니다.
OVOS 플러그인 벤치마킹 아레나 — 실제 워크로드에서 STT, TTS 등 플러그인 구현을 ELO 랭킹 기반 맞대결로 비교합니다.
OpenVoiceOS를 위한 Qdrant 벡터 데이터베이스 임베딩 플러그인.
ILENIA 음성 데이터로 학습된 Citrinet 음향 모델을 사용하는 OVOS ASR 플러그인.
바스크어를 위한 Zuazo 파인튜닝 Faster-Whisper 모델을 사용하는 OVOS ASR 플러그인.
HiTZ 바스크어 음성 인식을 위한 OVOS ASR 플러그인.
Meta MMS 대규모 다국어 음성 인식을 사용하는 OVOS ASR 플러그인.
NVIDIA NeMo ASR 모델을 사용하는 OVOS ASR 플러그인.
NOS 갈리시아어 음성 인식을 위한 OVOS ASR 플러그인.
onnx-asr을 감싼 OVOS 음성 인식 플러그인 — torch 없이 ONNX 모델로 가벼운 ASR을 제공합니다.
스페인어 및 공동 공용어를 위한 wav2vec 2.0 모델을 사용하는 OVOS ASR 플러그인.
정확도 향상을 위해 Whisper와 언어 모델을 결합한 OVOS ASR 플러그인.
어떤 OpenVoiceOS STT 플러그인이든 네트워크 서비스로 호스팅 — 위성과 서드파티 클라이언트를 위해 HTTP로 음성 인식을 제공하는 작은 서버입니다.
ILENIA 하에 개발된 바스크어 음성 합성 시스템 AhoTTS를 위한 OVOS TTS 플러그인.
스페인어 음성을 위해 Coqui TTS를 래핑한 OVOS TTS 플러그인.
갈리시아어 음성 합성 엔진 Cotovia를 위한 OVOS TTS 플러그인.
Matxa 멀티스피커 카탈루냐어 합성을 위한 OVOS TTS 플러그인.
NOS 갈리시아어 음성 합성을 위한 OVOS TTS 플러그인.
어떤 OpenVoiceOS TTS 플러그인이든 서비스로 호스팅 — 간단한 flask 서버로 TTS 플러그인을 셀프호스팅 음성 합성 API로 만듭니다.
OVOS TTS용 오디오 초해상도 — FlashSR이 재생 전에 ONNX로 합성 음성을 16 kHz에서 48 kHz로 업샘플링하여 재학습 없이 기존 목소리를 더 선명하게 만듭니다.
OVOS TTS용 오디오 초해상도 — NovaSR이 빠른 FastSR 업샘플러로 합성 음성을 16 kHz에서 48 kHz로 올리며, 이미 48 kHz인 오디오는 건너뜁니다.
Wyoming 서비스를 포함한 OpenVoiceOS용 Docker 구성.
경량 인프로세스 런타임을 갖춘 OVOS 스킬용 종단 간 테스트 프레임워크.
아주 단순한 키워드 기반 인텐트 파서 — 필수/선택 키워드 슬롯으로 발화를 매칭하는 Adapt 대체재입니다. TigreGótico에서 태어나 OpenVoiceOS에 기증되었습니다.
음성학적 퍼지 검색 및 세그먼트 간 거리 계산.
ONNX 모델을 사용한 다국어 음소화 및 음성 합성(TTS)을 위한 Python 라이브러리.
phoonnx 신경망 ONNX 음성으로 발화하는 Windows NVDA 스크린리더 애드온으로, 접근성 TTS 백엔드로서의 phoonnx를 시연합니다.
onnxruntime-web를 이용한 브라우저 내 VITS TTS 추론. Unicode 및 espeak-ng 경로 지원. 서버 없음, API 없음.
Selenium과 Selenium Wire 기반의 자동화 브라우저 컨트롤러 — 전체 브라우저가 불가피한 스크래핑 및 테스트를 위한 세션, 이벤트 처리, 요소 상호작용, 확장 프로그램 관리.
Linux 장치의 전력 소비를 추정하거나 측정합니다 — 모든 측정값에 출처를 남기는 의존성이 적은 Python 라이브러리(INA219, RAPL, Raspberry Pi PMIC, 배터리 또는 보정된 범위 추정).
precise-onnx 웨이크워드 감지의 브라우저/Node.js 포팅. MFCC 특징 추출과 ONNX 기반 감지로 Precise .onnx 모델과 호환.
타입이 지정된 미디어 메타데이터 릴리스를 생성하는 Bandcamp 스크레이퍼.
Music Assistant 서버를 위한 Python HTTP 클라이언트 및 mediavocab 브리지 — OVOS Music Assistant 통합을 뒷받침하는 공유 전송 및 변환 계층.
북부(대륙) 바스크어를 위한 음성 합성 엔진 AhoTTS Iparrahotsa의 Python 포팅 — hts_engine과 AhoCoder 보코더를 갖춘 Iparralde 방언용 pyAhoTTS 대응물. Aholab(UPV/EHU)와 함께 개발되었습니다.
Classical Archives를 위한 타입이 지정된 Python 클라이언트.
갈리시아어와 스페인어를 위한 Cotovia G2P 프런트엔드의 순수 Python 포팅. 컴파일된 C 바이너리의 음절 분리, 강세, 전사 파이프라인을 서브프로세스 없이 재현합니다.
Discogs 월간 데이터 덤프를 위한 스트리밍 Python 클라이언트.
Erowid(erowid.org)를 위한 타입이 지정된 Python 클라이언트 + 마크다운 데이터셋 덤퍼.
EYE N3 추론 엔진의 순수 Python 포팅 — Notation3 사실과 규칙을 입력하면 순방향/역방향 연쇄, RDFS 및 OWL 2 RL 함의, 증명 트리, 280개 이상의 내장 함수를 통해 새로운 사실을 도출합니다. 의존성은 하나(rdflib).
Project Gutenberg를 위한 Python 클라이언트 — 오픈 카탈로그를 통한 도서 메타데이터.
iHeartRadio API 클라이언트.
옥스퍼드의 OWL 2 DL 추론기 HermiT의 순수 Python 포팅 — JVM 없이 런타임 의존성이 전혀 없는 하이퍼레졸루션 태블로를 통한 일관성, 분류, 인스턴스 검색.
IMDb를 위한 Python 메타데이터 클라이언트. 자유 텍스트 쿼리를 표준 IMDb 제목으로 해결합니다.
Porto Editora의 유럽 포르투갈어 사전 Infopédia를 위한 타입이 지정된 Python 클라이언트 — 각 항목을 IPA 발음, 음절 분리, 어원, 의미로 파싱하며, G2P 및 중의성 해소 작업을 위해 이음 동철이의어를 올바르게 분리합니다.
InspiroBot(inspirobot.me)과 상호작용하기 위한 Python 패키지.
Jazz Music Archives를 위한 타입이 지정된 Python 클라이언트.
LiveATC.net을 위한 Python 클라이언트 — 실시간 및 과거의 항공 교통 관제 오디오 피드를 검색, 스트리밍, 아카이브하며 ASR 학습용 데이터셋 내보내기를 지원합니다.
Encyclopaedia Metallum(Metal Archives) API 클라이언트.
MusicBrainz를 위한 Python 메타데이터 클라이언트 — 오픈 음악 백과사전.
Portal da Lingua Portuguesa를 위한 타입이 지정된 Python 클라이언트.
Prog Archives를 위한 타입이 지정된 Python 클라이언트.
PsychonautWiki(psychonautwiki.org)를 위한 타입이 지정된 Python 클라이언트 + 마크다운 데이터셋 덤퍼.
rateyourmusic.com을 위한 Python HTML 스크레이퍼.
romhacking.net(RHDN)을 위한 Python 스크레이퍼 — ROM 해크, 팬 번역, 패치 유틸리티, 문서의 커뮤니티 데이터베이스.
견고한 오디오 지문 인식을 위해 shazamio_core 위에 구축된 모듈식 비동기 Python Shazam API 클라이언트.
smwcentral.net 공개 JSON API를 위한 Python 클라이언트 — Super Mario World / SM64 / Yoshi's Island ROM 해킹 카탈로그에 페이지 단위로 접근합니다.
TripSit 약물 정보 시트 + 상호작용 매트릭스 클라이언트(피해 감소).
tvtropes.org PmWiki를 위한 Python HTML 스크레이퍼.
VNDB(Visual Novel Database) kana 공개 JSON API를 위한 Python 클라이언트.
영어 Wiktionary MediaWiki API를 위한 타입이 지정된 Python 클라이언트.
다국어 오늘의 단어(Word-of-the-Day) 집계 클라이언트.
Rapid Automatic Keyword Extraction 구현.
raspOVOS용 오디오 자동 구성 라이브러리 — Raspberry Pi의 사운드 카드, HAT, USB 장치를 감지해 음성 비서용으로 설정합니다. ILENIA 프로젝트로 개발되었습니다.
Cypherpunk 및 Mixmaster 프로토콜을 지원하는 익명 이메일 리메일러 클라이언트.
의존성 없는 문자·음소 표기 핵심 라이브러리 — ISO-15924 감지, IPA ↔ ARPABET/X-SAMPA/Kirshenbaum/Cotovía, 버크월터 ↔ 아랍 문자, 한글 → 자모, 가나 지원.
Shazam으로 실내 오디오를 지문 인식하고 트랙 메타데이터(제목, 아티스트, 아트워크, 가사, Apple Music / Spotify / Deezer 링크)를 Home Assistant 자동 검색과 함께 MQTT로 게시하는 Docker화된 브리지.
포르투갈어 텍스트 음절 분리 도구.
간단한 규칙 기반 개체명 인식.
스크레이퍼를 구축하기 전에 사이트 구조를 파악하기 위한 사이트 정찰 유틸리티. unblock_requests 전송 계층을 사용해 robots.txt, 사이트맵, 링크 그래프를 매핑하여 보호되거나 복잡한 사이트를 견고하게 탐색합니다.
유럽 포르투갈어 지역 억양을 위한 음소화기.
순수 onnxruntime 화자 임베딩 라이브러리 — 런타임에 PyTorch 없이 ONNX 모델에서 화자 임베딩을 추출하고 코사인 유사도를 계산하며 화자 신원을 검증합니다.
통합 음성 평가 지표 — 신경망 MOS(UTMOS, NISQA, SIGMOS, DNSMOS), 침습형(STOI, SI-SDR, MCD), ASR(WER/CER) — numpy와 onnxruntime만으로 동작합니다.
SSHFS/rclone 마운트를 모니터링하고 끊어질 때 자동으로 재마운트하는 데몬 — 실시간 웹 대시보드, REST API, Prometheus 지표, 웹훅, 예약된 rsync/rclone 동기화 작업 제공.
TTS 프런트엔드를 위한 다국어 단어 강세 배치, onnxruntime과 numpy만으로 동작합니다.
Python을 위한 통합 다중 제공자 날씨 추상화 라이브러리. OpenWeatherMap, Open-Meteo, MetNo, IPMA, NWS 등을 하나의 일관된 API로 조회합니다.
경량 아랍어 발음 부호화(tashkeel) — 누락된 모음 부호를 복원하는 교체 가능한 ONNX 모델 위의 단일 소형 API로, PyTorch가 없으며 기본적으로 오프라인입니다. arbtok의 발음 부호화 단계를 구동합니다.
경량 포르투갈어 품사(POS) 태거.
Cloudflare를 우회하는 requests.Session 서브클래스(curl_cffi 위장, FlareSolverr, Wayback 폴백) — 스크레이퍼를 뒷받침하는 안티봇 전송 계층.
대체 프로토콜 연구 및 아카이빙을 위한 실시간 USENET 리더 및 기사 스크레이퍼.
ovos-plugin-manager를 사용하는 실시간 음성 활동 감지 브리지. 발화 확률(0–100 %), 소음 수준(dB), 디바운스된 발화 감지 이진 센서를 Home Assistant 자동 검색과 함께 MQTT로 게시합니다.
ONNX 방식의 음성 활동 감지 — 작은 런타임(numpy + onnxruntime)으로 어떤 VAD 모델이든 하나의 스트리밍 API 뒤에서 로드합니다. phoonnx의 VAD 대응물이며 대부분의 백엔드는 코드가 아닌 데이터입니다.
순수 ONNX 기반 다중 엔진 음성 변환 — 추론 시 PyTorch 없이 어떤 음성이든 참조 화자의 목소리로 재구성합니다. 하나의 VoiceCloner API 뒤에 14개 엔진(kNN-VC, FreeVC, OpenVoice, RVC, CosyVoice…)과 CLI, INT8 빌드 제공.
OpenVoiceOS를 위해 NLnet 보조금으로 개발된 웨이크워드 모델 트레이너 — 자신의 샘플로 맞춤형 온디바이스 웨이크워드를 구축합니다.
웨이크워드 오디오를 수작업으로 라벨링하는 Flask 웹 앱 — 각 클립을 재생하며 단어, 화자 성별, 소음 유형을 태깅하여 학습이나 평가에 바로 쓸 수 있는 코퍼스를 저장합니다.
Wyoming 프로토콜을 위한 OpenVoiceOS ASR 서비스 — 경량 음성 인식.
Wyoming 프로토콜을 위한 OpenVoiceOS TTS 서비스 — 경량 음성 합성.
Wyoming 프로토콜을 위한 OpenVoiceOS 웨이크워드 감지 서비스.