我们是 FOSS 语音、AI 与数据专家。作为 HiveMind 技术栈的创造者以及 OpenVoiceOS 的核心贡献者,我们构建隐私优先、符合 GDPR 的语音技术,让您的数据留在您自己的硬件上——同时,我们同样擅长把难以获取的公开数据转化为干净的 API 和精心整理的数据集。
我们的合作方式
标准的合作形式是按月聘用,以获得持续的服务与支持;而各项具体交付物——数据集、训练好的模型、定制插件、集成——则在其定义清楚后单独确定范围并计费。这让双方的合作关系保持可预期:您能直接接触到团队,而每一项具体产出都有自己的范围和价格。
对于从一开始就界定清楚范围的独立项目工作,我们也乐于承接。
我们能为任何东西赋予语音
我们为任何事物打造语音界面。无论您想与什么对话——一台设备、一个应用、一项服务,还是一整条产品线——我们都能为它构建语音层,复用我们围绕 开放语音操作系统(Open Voice Operating System) 和 HiveMind 所积累的专业能力和经受住实战考验的技术栈。定制唤醒词、文本转语音(TTS)与语音转文本(ASR)的接线、意图处理,以及量身定制的组件——都基于经过验证的开源基础组装而成,而非从零开始,并运行在您自己的硬件上。
定制离线 TTS 语音训练
想为您的项目打造一个独一无二的声音吗?我们训练定制的、高质量、完全离线的文本转语音(TTS)语音。您可以为某种特定语言提供数据集,或者克隆一个参考声音——最终得到的是一个快速、私密、在您设备上本地运行、并能直接嵌入 OpenVoiceOS 或 Home Assistant 的 TTS 模型。您对自己的数据保有完全的掌控权。
想听听我们的语音是什么效果?试试语音演示——我们的 Miro 和 Dii 语音会在您的浏览器中实时合成,支持 20 多种语言。
面向您的语言与领域的微调语音识别
我们针对您特定的语言、口音和领域词汇,微调最先进的语音转文本模型——Zipformer、Parakeet、Whisper 以及其他模型——让识别在真正对您重要的词汇和条件下依然可靠。当训练数据尚不存在时,我们会去找到它——并在适当时用我们的数据集构建工具链合成它。这项工作有我们与 Alpha Cephei 的合作作为支撑,为您的项目带来数十年的自动语音识别专业经验。
少数语言与葡语系语言的语音技术
我们为主流工具忽视的语言构建语音技术——包括葡萄牙语的各种变体,以及其他葡语系和少数语言。从音素化到 ASR 和 TTS,我们帮助那些服务不足的语言社区获得现代、尊重隐私的语音支持。
数据提取、干净的 API 与数据集
大量有价值的数据存在于公共网络上,却实际上难以触及——被锁在非结构化的页面里、藏在反爬虫防护之后、只通过未记录的接口暴露,或以任何搜索引擎都无法索引的格式存在。我们把它们取出来并加以利用:
- 有韧性的爬虫与解析器,针对抗拒自动化的数据源,经过精心设计以便在页面和防护措施变化时仍能持续工作。
- API 逆向工程——我们梳理未记录或私有的接口,并将它们重新封装为干净、带类型、有文档的客户端库。
- 在杂乱数据源之上构建一个干净的 API——用单一一致的接口取代为每个使用方分别做定制爬取。
- 数据集构建——我们将提取的数据整理成结构化、带版本、可直接用于机器学习、来源清晰的数据集,并在合适的场景下发布开放数据集。
这与支撑我们自家客户端库和已发布数据集的是同一套工具链——它为从媒体元数据丰富化到语音和语言模型训练语料的一切提供支撑。
支持语音、无障碍的网站
我们在设备上交付的同一套语音技术栈,也能在浏览器中运行。借助 phoonnx.js,我们的 TTS 语音在客户端合成——没有云 API、没有按请求计费的成本,没有任何东西离开访问者的设备。本站上的 语音演示就是明证:一个会说话的静态页面。
我们围绕这一能力构建网站和 Web 应用——能够朗读自身内容的站点、语音优先的界面,以及为凭听觉浏览的用户设计的天生无障碍页面。性能、无障碍性和隐私是默认配置,而非附加项。我们也开发并维护 OpenVoiceOS 的官方网站。