Alpha Cephei
一项语音识别合作,带来数十年的自动语音识别(ASR)专长——即 Vosk 和基于 Kaldi 的模型背后的团队——助力我们的语音模型微调与数据集工作。
作品集
我们的开源工作——自由开源、可自托管的库与工具,涵盖语音 AI、数据提取、数据集、NLP 和游戏,以及我们参与构建的 OpenVoiceOS 与 HiveMind 生态系统。不锁定、不强制上云。
代码之外,我们的开放数据集和模型发布在Hugging Face,我们的训练笔记本则存放于ml-notebooks代码库中。
社区
我们为独立合作伙伴贡献力量,并将由公共资金资助的工作捐赠给 OpenVoiceOS 基金会。
一项语音识别合作,带来数十年的自动语音识别(ASR)专长——即 Vosk 和基于 Kaldi 的模型背后的团队——助力我们的语音模型微调与数据集工作。
一项西班牙国家计划,推进覆盖该国官方语言(西班牙语、加泰罗尼亚语、巴斯克语、加利西亚语)的语言技术。资助 OVOS 开发,以打造可下载、尊重隐私、能在 Raspberry Pi 和个人电脑上运行的语音助手。由西班牙数字化转型部和欧盟复苏计划资助。
欧盟委员会的下一代互联网(Next Generation Internet)计划(并由瑞士 SERI 共同资助),支持 OpenVoiceOS 成为大型科技公司语音助手之外稳定、隐私优先的替代方案。重点:多语言支持、用户引导、平台稳定化和文档。
一个独立的非营利基金会,致力于构建由社区驱动、尊重隐私的开源语音 AI 平台。TigreGótico 是 OpenVoiceOS 的核心贡献者,其创始人也任职于该基金会董事会。
探索
按领域筛选以探索更多——一切皆为开源。
面向编码智能体 CLI(Claude Code、Gemini、opencode、Antigravity)的异步 Python 封装,统一于一个 Provider API 之后——支持单次、多轮会话、带类型的流式事件,以及扇出/委派/重试流水线模式。
使用 Aho-Corasick 算法的命名实体识别。
纯 Python、零依赖、版本感知的巴斯克语和西班牙语字素到音素转换——忠实复现 AhoTTS 前端,并输出用于训练 StyleTTS2/VITS 语音的单字符 IPA 字符串。
一款基于浏览器的工具,可在词、字素和句子级别将音频与文本转写及 IPA 对齐。完全在客户端运行,无需服务器、无依赖、无构建步骤。
带 IP 轮换的匿名 HTTP;与 unblock_requests 组合,实现轮换加反爬墙绕过。
基于 orthography2ipa、带 tashkeel 加符的规则式阿拉伯语(MSA)文本转 IPA——上下文敏感的标记树处理太阳字母同化、hamzat al-waṣl、tanwīn 和 tāʾ marbūṭa,并先通过内置 ONNX 模型对无标记文本加符。
从 LibriVox 及类似来源搜索并流式播放公有领域有声书。
纯 ONNX 实现的语音修复、降噪与带宽扩展——运行时无需 torch,将窄带语音提升至 48 kHz。
面向 TTS 的欧洲葡萄牙语异读同形词消歧——为拼写相同但因词义不同而读法不同的词选择正确发音(sede = 口渴 vs 总部,forma = 模具 vs 形状)。纯 Python 规则加学习模型,并附开放数据集。
面向 11 种语言的预训练 Brill 词性标注器,以基于 NLTK 的开箱即用 pickle 模型形式提供——无需训练即可标注文本。
面向对话式 AI 的基于 ONNX 的推理引擎。
从 Classical Archives 获取古典音乐作曲家信息的 Python 包。
多语言 CRF 关键词/搜索词抽取器——使用基于词性和正字法特征的 CRF 从自然语言问句中提取查询,并附带各语言的预训练模型。
以 ONNX 实现的 DeepMoji 情绪/表情符号预测。
检测并在七种葡萄牙语正字法规范之间转换——1911 年以前的词源写法,1911/1943/1945/1971/1973 年的改革,以及 1990 年正字法协定及其欧洲和巴西子变体。
引导对话朝既定目标推进的工具。
用于处理人类情绪的结构化数据与运算。
espeak-ng 字素到音素前端的纯 Python、无依赖重实现——仅将文本转为音素,无 C 扩展。在 86 种语言的词头扫描和 31 种语言的句子语料上逐字节复现 espeak-ng 二进制的输出;内置 117 种语言。
基于共享 orthography2ipa 发音网格构建的方言感知巴斯克语文本转 IPA 音素器——开放、可审查、注明来源。
面向 Barranquenho 的字素到音素转换。
一套用于构建分层代理网络的协议——轻量卫星设备通过加密网状网络连接到任意对话代理:从 OpenVoiceOS 到 LLM 人格再到任意 A2A 代理。生态涵盖传输协议、语音卫星、聊天桥接、加密与零配置发现。
hivemind-core 的 A2A 代理协议插件——通过 JSON-RPC 2.0 将 hive 桥接到外部 Agent-to-Agent(A2A)服务器,并将响应流式返回给卫星节点。
一个简单的 Python JSON 文件数据库。
面向意图识别的关键词模板匹配引擎。
极简的基于词表的纯 Python 语种检测器。
通过 MQTT 将 Linux/SBC 的功耗与系统遥测数据发布到 Home Assistant——CPU/GPU/RAM/磁盘、温度、限频、音频 + MPRIS、WiFi/蓝牙——全部自动发现。基于 powerguess 构建。
解析并分类问题。
从 JSON 数据生成马尔可夫链文本。
导出为 ONNX 的马尔可夫链模型。
对来自 YouTube 及其他来源的媒体目录进行索引、规范化、去重并提供服务。
一个共享的媒体元数据词汇表与规范化层,统一了标题、艺术家和标识符在各媒体客户端及 Music Assistant 集成之间的映射方式。
基于 Pydantic 的媒体元数据客户端,以及一个无需密钥的跨来源实体解析器。
面向米兰德斯语的基于规则的音素化器。
类 scikit-learn 的机器学习与神经网络库,仅依赖 numpy 和 scipy——为可读性而写。
SoundCloud 客户端,产出带类型的媒体元数据发布项。
社区驱动、隐私优先的开源语音助手平台。TigreGótico 是整个生态的核心贡献者——在数十个仓库中维护语音插件、STT/TTS 服务、开发者工具与正式规范工作。
纯 Python 的声波数据传输工具包——使用共享的 WAV/正弦波/Goertzel 原语通过音频通道传递文本和数据(DTMF 及更多)。核心方案无依赖。
涵盖 20 多个语系、350 多种语言的字素到 IPA 及音位变体映射——一个最大匹配 IPA 分词器、音系与文字距离度量、方言变换,以及可插拔的 G2P 后端。
面向 OpenVoiceOS 的智能体集成框架——实现语音驱动的智能体工作流。
OpenVoiceOS 的消息总线监视器——实时查看总线流量,调试技能、意图与服务。
面向 OpenVoiceOS 的 ChromaDB 向量嵌入插件。
在 TTS 合成前对对话文本进行规范化的 OVOS 插件(数字展开、缩写处理)。
面向 OpenVoiceOS 检索/RAG 的文档分块。
面向 OVOS 查询结果的快速语义重排序插件。
面向 OpenVoiceOS 的本地 GGUF 嵌入插件。
面向 OpenVoiceOS 的本地 LLM(GGUF)插件。
在 OpenVoiceOS 中使用 GGUF 模型的本地 LLM 求解器。
面向 OpenVoiceOS 技能与插件的 GitHub 原生本地化平台——完全通过 Git 管理翻译,无需运行任何外部服务。
面向 OpenVoiceOS 意图处理的 Model2Vec 意图流水线。
通过 OVOS 消息总线转发对话回合的 OVOS ChatEngine 插件——将聊天界面直接接入正在运行的助手。
OpenVoiceOS 的开放数据指标服务器——收集匿名使用指标并作为开放数据集发布;在 ILENIA 项目下开发。
OVOS 插件的基准竞技场——通过一对一对决与 ELO 排名,在真实负载上比较 STT、TTS 及其他插件实现。
面向 OpenVoiceOS 的 Qdrant 向量数据库嵌入插件。
使用 Citrinet 声学模型的 OVOS ASR 插件,模型基于 ILENIA 语音数据训练。
使用 Zuazo 微调的 Faster-Whisper 巴斯克语模型的 OVOS ASR 插件。
面向 HiTZ 巴斯克语语音识别的 OVOS ASR 插件。
使用 Meta MMS 大规模多语言语音识别的 OVOS ASR 插件。
使用 NVIDIA NeMo ASR 模型的 OVOS ASR 插件。
面向 NOS 加利西亚语语音识别的 OVOS ASR 插件。
基于 onnx-asr 的 OVOS 语音转文本插件——用 ONNX 模型实现轻量 ASR,无需 torch。
使用 wav2vec 2.0 模型的 OVOS ASR 插件,支持西班牙语及共官方语言。
将 Whisper 与语言模型相结合以提升准确率的 OVOS ASR 插件。
将任意 OpenVoiceOS STT 插件托管为网络服务——一个小型服务器,通过 HTTP 向卫星端和第三方客户端提供语音转文本。
面向 AhoTTS 的 OVOS TTS 插件,AhoTTS 是在 ILENIA 下开发的巴斯克语语音合成系统。
封装 Coqui TTS 的 OVOS TTS 插件,用于西班牙语语音。
面向 Cotovia 的 OVOS TTS 插件,Cotovia 是一款加利西亚语文本转语音引擎。
面向 Matxa 多说话人加泰罗尼亚语合成的 OVOS TTS 插件。
面向 NOS 加利西亚语语音合成的 OVOS TTS 插件。
将任意 OpenVoiceOS TTS 插件托管为服务——一个简单的 flask 服务器,把任何 TTS 插件变成自托管语音合成 API。
OVOS TTS 的音频超分辨率——FlashSR 在播放前通过 ONNX 将合成语音从 16 kHz 提升到 48 kHz,无需重训即可让现有语音更明亮。
OVOS TTS 的音频超分辨率——NovaSR 用快速 FastSR 上采样器将合成语音从 16 kHz 提升到 48 kHz,已是 48 kHz 的音频则跳过。
面向搭配 Wyoming 服务的 OpenVoiceOS 的 Docker 配置。
极简的关键词意图解析器——Adapt 的直接替代品,将语句与必需/可选关键词槽位匹配;诞生于 TigreGótico,捐赠给 OpenVoiceOS。
语音模糊搜索与音段间距离计算。
使用 ONNX 模型进行多语言音素化和文本转语音(TTS)的 Python 库。
Windows NVDA 屏幕阅读器插件,通过 phoonnx 神经 ONNX 语音朗读,展示 phoonnx 作为无障碍 TTS 后端的应用。
使用 onnxruntime-web 在浏览器中进行 VITS TTS 推理。支持 Unicode 和 espeak-ng 路径。无需服务器,无需 API。
基于 Selenium 和 Selenium Wire 构建的自动化浏览器控制器——涵盖会话、事件处理、元素交互和扩展管理,适用于必须使用完整浏览器的抓取和测试场景。
估算或测量 Linux 设备的功耗——一个依赖极少的 Python 库,每次读数都带来源溯源(INA219、RAPL、Raspberry Pi PMIC、电池,或经校准的有界估算)。
precise-onnx 唤醒词检测的 Browser/Node.js 移植版。MFCC 特征提取 + 基于 ONNX 的检测,兼容 Precise .onnx 模型。
Bandcamp 抓取器,产出带类型的媒体元数据发布项。
面向 Music Assistant 服务器的 Python HTTP 客户端与 mediavocab 桥接层——是 OVOS Music Assistant 集成背后共享的传输与转换层。
AhoTTS Iparrahotsa 的 Python 移植版,一款面向北部(大陆)巴斯克语的文本转语音引擎——是 pyAhoTTS 的 Iparralde 方言对应版本,配备 hts_engine 和 AhoCoder 声码器。与 Aholab(UPV/EHU)共同开发。
面向 Classical Archives 的带类型 Python 客户端。
Cotovia G2P 前端面向加利西亚语和西班牙语的纯 Python 移植版。无需子进程即可复现编译版 C 二进制的音节切分、重音和转写流水线。
面向 Discogs 月度数据转储的流式 Python 客户端。
面向 Erowid(erowid.org)的带类型 Python 客户端 + markdown 数据集导出器。
EYE N3 推理引擎的纯 Python 移植版——输入 Notation3 事实和规则,它通过前向/后向链推、RDFS 和 OWL 2 RL 蕴涵、证明树以及 280 多个内置函数推导新事实。仅一个依赖(rdflib)。
面向 Project Gutenberg 的 Python 客户端——通过开放目录获取图书元数据。
iHeartRadio API 客户端。
牛津 OWL 2 DL 推理机 HermiT 的纯 Python 移植版——通过超归结表演算实现一致性检验、分类和实例检索,无需 JVM,运行时零依赖。
面向 IMDb 的 Python 元数据客户端。将自由文本查询解析为规范的 IMDb 条目。
面向 Infopédia(Porto Editora 的欧洲葡萄牙语词典)的带类型 Python 客户端——将每个词条解析为 IPA 发音、音节切分、词源和义项,并正确区分异读同形词,服务于 G2P 和消歧工作。
一个用于与 InspiroBot(inspirobot.me)交互的 Python 包。
面向 Jazz Music Archives 的带类型 Python 客户端。
面向 LiveATC.net 的 Python 客户端——发现、流式播放并归档实时及历史空中交通管制音频源,并支持导出用于 ASR 训练的数据集。
Encyclopaedia Metallum(Metal Archives)API 客户端。
面向 MusicBrainz 的 Python 元数据客户端——开放的音乐百科全书。
面向 Portal da Lingua Portuguesa 的带类型 Python 客户端。
面向 Prog Archives 的带类型 Python 客户端。
面向 PsychonautWiki(psychonautwiki.org)的带类型 Python 客户端 + markdown 数据集导出器。
面向 rateyourmusic.com 的 Python HTML 抓取器。
面向 romhacking.net(RHDN)的 Python 抓取器——一个汇集 ROM 魔改、粉丝翻译、打补丁工具和文档的社区数据库。
一个模块化的异步 Python Shazam API 客户端,基于 shazamio_core 构建,实现稳健的音频指纹识别。
面向 smwcentral.net 公共 JSON API 的 Python 客户端——分页访问 Super Mario World / SM64 / Yoshi's Island 的 ROM 魔改目录。
TripSit 药物资料表 + 相互作用矩阵客户端(减害用途)。
面向 tvtropes.org PmWiki 的 Python HTML 抓取器。
面向 VNDB(Visual Novel Database)kana 公共 JSON API 的 Python 客户端。
面向英文 Wiktionary MediaWiki API 的带类型 Python 客户端。
快速自动关键词抽取(RAKE)的实现。
raspOVOS 的音频自动配置库——检测 Raspberry Pi 上的声卡、HAT 与 USB 设备并为语音助手自动接好;在 ILENIA 项目下开发。
匿名电子邮件转发客户端,支持 Cypherpunk 和 Mixmaster 协议。
零依赖的文字与音素记号核心库——ISO-15924 检测、IPA ↔ ARPABET/X-SAMPA/Kirshenbaum/Cotovía、Buckwalter ↔ 阿拉伯文、谚文 → 字母、假名。
容器化桥接程序,用 Shazam 对房间音频进行指纹识别,并将曲目元数据(标题、艺术家、封面、歌词、Apple Music / Spotify / Deezer 链接)发布到 MQTT,支持 Home Assistant 自动发现。
葡萄牙语文本音节切分工具。
简单的基于规则的命名实体识别。
站点侦察工具,用于在构建抓取器前了解站点结构。使用 unblock_requests 传输层映射 robots.txt、站点地图和链接图,实现对受保护或复杂站点的稳健探索。
面向欧洲葡萄牙语区域口音的音素化器。
纯 onnxruntime 的说话人嵌入库——从 ONNX 模型中提取说话人嵌入、计算余弦相似度并验证说话人身份,运行时无 PyTorch。
统一的语音评测指标——神经 MOS(UTMOS、NISQA、SIGMOS、DNSMOS)、侵入式指标(STOI、SI-SDR、MCD)与 ASR(WER/CER)——仅依赖 numpy 和 onnxruntime。
一个守护进程,监控 SSHFS/rclone 挂载并在其掉线时自动重新挂载——配备实时 Web 仪表盘、REST API、Prometheus 指标、webhook 以及定时 rsync/rclone 同步任务。
面向 TTS 前端的多语言词重音标注,仅依赖 onnxruntime 和 numpy 运行。
统一的多提供方天气抽象 Python 库。通过一致的单一 API 查询 OpenWeatherMap、Open-Meteo、MetNo、IPMA、NWS 等。
轻量级阿拉伯语加符(tashkeel)——在可互换 ONNX 模型之上的单一小巧 API,用于恢复缺失的元音标记,无 PyTorch 且默认离线。为 arbtok 的加符步骤提供支持。
轻量级葡萄牙语词性(POS)标注器。
一个 requests.Session 子类,可绕过 Cloudflare(curl_cffi 伪装、FlareSolverr、Wayback 回退)——是我们抓取器背后的反爬传输层。
使用 ovos-plugin-manager 的实时语音活动检测桥接程序。将语音概率(0–100%)、噪声电平(dB)以及经过去抖的语音检测二值传感器发布到 MQTT——支持 Home Assistant 自动发现。
以 ONNX 方式实现的语音活动检测——在单一流式 API 之后加载任意 VAD 模型,运行时极小(numpy + onnxruntime)。它是 phoonnx 的 VAD 对应版本;多数后端是数据而非代码。
纯 ONNX、多引擎的语音转换——将任意语音重塑为参考说话人的音色,推理时零 PyTorch。14 种引擎(kNN-VC、FreeVC、OpenVoice、RVC、CosyVoice……)统一于一个 VoiceCloner API 之后,并附 CLI 与 INT8 构建。
在 NLnet 资助下为 OpenVoiceOS 开发的唤醒词模型训练器——用你自己的样本构建自定义的设备端唤醒词。
用于手工标注唤醒词音频的 Flask Web 应用——播放每段音频并标注词语、说话人性别和噪声类型,持久化保存可用于训练或评估的语料库。
面向 Wyoming 协议的 OpenVoiceOS ASR 服务——轻量级语音识别。
面向 Wyoming 协议的 OpenVoiceOS TTS 服务——轻量级文本转语音。
面向 Wyoming 协议的 OpenVoiceOS 唤醒词检测服务。