저희는 FOSS 음성, AI, 데이터 전문가입니다. HiveMind 스택의 창시자이자 OpenVoiceOS의 핵심 기여자로서, 저희는 여러분의 데이터를 여러분 자신의 하드웨어에 보관하는 프라이버시 우선, GDPR 준수 음성 기술을 구축합니다 — 그리고 접근하기 어려운 공개 데이터를 깔끔한 API와 정제된 데이터셋으로 전환하는 일에도 똑같이 능숙합니다.
저희의 작업 방식
표준 업무 형태는 지속적인 접근과 지원을 위한 월간 리테이너이며, 개별 산출물 — 데이터셋, 학습된 모델, 맞춤형 플러그인, 통합 — 은 정의될 때 별도로 범위가 정해지고 청구됩니다. 이는 양측 모두에게 관계를 예측 가능하게 유지합니다: 여러분은 팀에 직접 접근할 수 있고, 각 구체적인 산출물은 자체 범위와 가격을 가집니다.
저희는 처음부터 범위가 명확하게 정의된 독립적인 프로젝트 작업도 수행합니다.
무엇이든 음성으로 지원합니다
저희는 무엇에든 음성 인터페이스를 만듭니다. 여러분이 대화하고 싶은 것이 무엇이든 — 기기, 앱, 서비스, 또는 전체 제품 라인 — 저희는 **Open Voice Operating System**과 HiveMind 을 중심으로 구축한 전문성과 실전에서 검증된 스택을 재사용하여 그것을 위한 음성 계층을 구축합니다. 맞춤형 웨이크 워드, 텍스트 음성 변환(TTS)과 음성 텍스트 변환(ASR) 연결, 인텐트 처리, 그리고 맞춤형 구성 요소를 — 처음부터가 아니라 검증된 오픈 소스 기반에서 조립하며, 여러분 자신의 하드웨어에서 실행됩니다.
맞춤형 오프라인 TTS 음성 학습
여러분의 프로젝트를 위한 고유한 음성을 원하십니까? 저희는 맞춤형의 고품질, 완전 오프라인 텍스트 음성 변환 음성을 학습시킵니다. 특정 언어를 위한 데이터셋을 가져오시거나, 참조 음성을 복제하십시오 — 그 결과물은 여러분의 기기에서 로컬로 실행되고 OpenVoiceOS나 Home Assistant에 곧바로 통합되는 빠르고 사적인 TTS 모델입니다. 여러분은 데이터에 대한 완전한 통제권을 유지합니다.
저희 음성이 어떤 소리인지 궁금하십니까? 음성 데모 체험하기 — 저희 Miro와 Dii 음성이 20개 이상의 언어로 여러분의 브라우저에서 실시간으로 합성됩니다.
여러분의 언어와 도메인을 위한 미세 조정된 음성 인식
저희는 최첨단 음성 텍스트 변환 모델 — Zipformer, Parakeet, Whisper 등 — 을 여러분의 특정 언어, 억양, 도메인 어휘에 맞춰 미세 조정하여, 실제로 여러분에게 중요한 단어와 조건에서 인식 성능이 유지되도록 합니다. 학습 데이터가 아직 존재하지 않을 때, 저희는 그것을 찾아내고 — 적절한 경우 합성하여 — 저희의 데이터셋 구축 도구 체인을 사용합니다. 이 작업은 Alpha Cephei 와의 파트너십으로 뒷받침되며, 수십 년에 걸친 자동 음성 인식 전문성을 여러분의 프로젝트에 제공합니다.
소수 언어 및 루소폰 언어 음성 기술
저희는 주류 도구가 무시하는 언어 — 포르투갈어 변종과 기타 루소폰 및 소수 언어를 포함하여 — 를 위한 음성 기술을 구축합니다. 음소화부터 ASR과 TTS까지, 저희는 소외된 언어 커뮤니티가 현대적이고 프라이버시를 존중하는 음성 지원을 받도록 돕습니다.
데이터 추출, 깔끔한 API 및 데이터셋
방대한 양의 가치 있는 데이터가 공개 웹에 존재하지만 사실상 접근이 불가능합니다 — 비정형 페이지에 갇혀 있거나, 봇 방지 방어 뒤에 있거나, 문서화되지 않은 엔드포인트를 통해서만 노출되거나, 어떤 검색 엔진도 색인하지 않는 형식으로 되어 있습니다. 저희는 그것을 꺼내어 사용 가능하게 만듭니다:
- 탄력적인 스크레이퍼 및 파서 — 자동화에 저항하는 소스를 위해, 페이지와 방어 체계가 변해도 계속 작동하도록 설계되었습니다.
- API 리버스 엔지니어링 — 저희는 문서화되지 않았거나 비공개인 엔드포인트를 매핑하여 깔끔하고, 타입이 지정되고, 문서화된 클라이언트 라이브러리로 다시 노출합니다.
- 지저분한 소스 위의 하나의 깔끔한 API — 모든 소비자를 위한 개별 스크래핑 대신 하나의 일관된 인터페이스입니다.
- 데이터셋 구축 — 저희는 추출한 데이터를 명확한 출처를 갖춘 구조화되고, 버전이 관리되고, ML에 바로 사용할 수 있는 데이터셋으로 정제하며, 합리적인 경우 오픈 데이터셋을 공개할 수 있습니다.
이는 저희 자체 클라이언트 라이브러리와 저희가 공개하는 데이터셋을 뒷받침하는 것과 동일한 도구 체인이며 — 미디어 메타데이터 강화부터 음성 및 언어 모델을 위한 학습 말뭉치까지 모든 것을 지원합니다.
음성 지원 접근성 웹사이트
저희가 기기에 제공하는 것과 동일한 음성 스택이 브라우저에서도 실행됩니다. phoonnx.js를 사용하면, 저희 TTS 음성이 클라이언트 측에서 합성됩니다 — 클라우드 API도, 요청당 비용도, 방문자의 기기를 벗어나는 그 어떤 것도 없습니다. 바로 이 사이트의 음성 데모가 그 증거입니다: 말을 하는 정적 페이지입니다.
저희는 그 기능을 중심으로 웹사이트와 웹 애플리케이션을 구축합니다 — 스스로 소리 내어 읽을 수 있는 사이트, 음성 우선 인터페이스, 그리고 귀로 브라우징하는 사용자를 위한 설계부터 접근성을 갖춘 페이지입니다. 성능, 접근성, 프라이버시는 부가 기능이 아니라 기본값입니다. 저희는 또한 공식 OpenVoiceOS 웹사이트를 개발하고 유지 관리합니다.