文章
来自工作坊
关于语音 AI、OpenVoiceOS 开发、合成数据以及少数语言语音技术的笔记。
- 1 分钟阅读
导出并量化开放语音模型,让它们真正能运行起来
一个躺在研究项目 GitHub 页面上的训练好的语音模型,还不是一个语音助手。我们把开放的 ASR 和 TTS 检查点转换为 ONNX、CoreML 和 GGUF,量化它们,并验证输出结果——然后在 OpenVoiceOS 名下发布结果,让它们覆盖的每一种语言都能在一个真实的、离线的助手中使用。
- ONNX
- CoreML
- GGUF
- ASR
- 3 分钟阅读
用机器移植代码,以及我们无法回答的许可证问题
我们把几个 C、C++ 和 Java 程序——espeak-ng 的 G2P、Cotovia、AhoTTS、HermiT——重写成了纯 Python,由 AI 阅读原始源码,由人类主导整个过程。我们这边没有人读过原始代码。这引出了两个独立的问题:产出物究竟能不能被拥有,以及它是不是输入内容的衍生作品。我们保留了上游的许可证,因为这比回答这个问题更划算。我们仍然认为这个问题是开放的。
- FOSS
- Licensing
- Open Source
- Python
- 2 分钟阅读
一族纯 ONNX 语音库
TigreGótico 维护着一组语音库——带宽扩展、声音克隆、说话人嵌入、VAD、词重音、音素化、TTS,以及一个为它们全部打分的指标库——它们共用同一条运行时规则:只依赖 onnxruntime 和 numpy,不需要 PyTorch,也不需要 GPU。
- ONNX
- TTS
- voice cloning
- VAD
- 2 分钟阅读
音系技术栈是如何拼接在一起的
一次架构导览,带你了解我们的文本转发音技术栈:负责记音的 scriptconv,作为跨语言字素转 IPA 引擎的 orthography2ipa,构建在其上、面向葡萄牙语、巴斯克语、米兰达语、巴兰克诺语和阿拉伯语的语言专属前端,以及用于按发音检索的 phonematcher。展示这些层级为何存在、什么是候选词格,以及真实的方言输出。
- G2P
- IPA
- Phonetics
- NLP
- 2 分钟阅读
如何选择一个声音克隆引擎
voiceclonnx 在同一套 API 背后运行着 10 个语音转换引擎,从 kNN 特征替换到自回归编解码语言模型。这是一份指南,介绍它们背后的模型家族、可懂度与说话人相似度之间真实测得的权衡,以及如何为特定任务挑选一个引擎。
- ONNX
- voice cloning
- voice conversion
- self-hosted
- 2 分钟阅读
清理糟糕的音频:audiosronnx 中的降噪与带宽扩展
深入剖析 audiosronnx 的两项独立任务——去除噪声与重建缺失的高频——涵盖真实的引擎注册表、模型大小与许可证、被拒收模型清单,以及如何检验输出是否真的变好了。
- ONNX
- denoising
- bandwidth extension
- speech
- 2 分钟阅读
不靠听审团衡量语音质量
一份 speechonnxmetrics 实战指南:MOS、无参考 MOS 预测器、侵入式信号指标,以及基于 ASR 的 WER/CER 究竟衡量什么,各自适用于何时,来自真实音频的真实分数,以及为什么一个预测出来的 MOS 是证据,而非真相。
- speechonnxmetrics
- TTS
- ONNX
- evaluation
- 2 分钟阅读
文字与音标记法:scriptconv 到底在转换什么
深入剖析 scriptconv——这个零依赖库,负责检测文字系统并在各种音标记法之间转换。涵盖 IPA、ARPABET 和 X-SAMPA;ISO-15924 文字检测;阿拉伯语的 Buckwalter 转写;谚文分解为字母(jamo);以及假名转换,配有真实、实际执行过的示例和坦诚的局限说明。
- IPA
- Phonetics
- NLP
- Linguistics
- 1 分钟阅读
你的情绪模型分不清投诉和告别
两条看起来都很愤怒的客服消息。一个客户准备升级投诉,另一个准备一声不吭地离开。几乎没有情绪模型能区分它们——因为它们都缺少同一个维度。emotion-algebra 问世了。
- Affective Computing
- Emotion
- Machine Learning
- LILACS
- 1 分钟阅读
我们为何囤积数据:从抓取的目录到更聪明的语音与语言模型
干净、带类型、来源清晰的数据,是我们交付的每一个模型的原材料。看我们的抓取器构建的目录,如何变成 ASR 偏置词表、意图分类器、合成 NER 语料、G2P 词典、TTS 语音——以及为 LLM 提供的诚实燃料。
- Datasets
- Data Collection
- ASR
- NLP
- 1 分钟阅读
如果人人都发布 App,那我们就发布语音:把网站变成语音应用
每一个重要的网站都被包进了移动 App。我们为语音与命令行时代提出相反的做法:一套干净的 API 加上每个网站一个语音 skill,让网络能够用耳朵、用键盘来浏览。一个网站接一个网站地做,累积起来就是一个语音浏览器。
- Voice
- Accessibility
- OpenVoiceOS
- Web Automation
- 1 分钟阅读
2026 年的 Usenet:一份用于训练与评估的干净、前 AI 文本语料
Usenet 是前 AI 时代人类话语的一份原始档案——数十年的新闻组帖子,全部由人类撰写,无一被语言模型触碰过。这让它成为语言与语音模型训练和评估中很有价值的数据。我们构建了一个小巧的 Python 工具来采集它。
- Usenet
- Datasets
- NLP
- 1 分钟阅读
两个声音,所有语言:Miro 与 Dii
TigreGótico 正与 OpenVoiceOS 合作,为助手赋予两个一致的声音身份——Miro 和 Dii——它们在每一种语言中都听起来一样,由我们的声音克隆技术和 phoonnx 引擎构建。为每一种有人请求的语言提供两个 TTS 模型,濒危语言也不例外。
- phoonnx
- TTS
- OVOS
- voice cloning
- 1 分钟阅读
说对读音:为 TTS 消歧葡萄牙语异音同形词
许多欧洲葡萄牙语单词拼写相同,但发音随含义而异——把元音读错,TTS 声音就会说出另一个词。我们构建了 bifonia-pt-homographs,一个开放的、按含义标注的数据集,涵盖 27 个单词共 56,891 个句子,还构建了一个微小、零依赖的消解器,准确率达约 94%,而重量级的 POS 标注器在约 75% 处便停滞不前。
- Datasets
- Portuguese
- TTS
- Grapheme-to-Phoneme
- 1 分钟阅读
能在土豆上运行的 TTS 模型
phoonnx 是一个基于 VITS 的文本转语音研究框架,专为在低端硬件上舒适运行而打造。不需要 GPU,不需要云,不需要 API 密钥——只需一个约 1565 万参数的 ONNX 声音和一颗 CPU。这里将展示一个优秀的声音可以有多小,以及我们如何训练它们。
- phoonnx
- TTS
- ONNX
- VITS
- 1 分钟阅读
隆重推出我们的音乐数据库抓取器
带你了解我们维护的一系列类型化 Python 客户端,覆盖各类音乐来源——Bandcamp、SoundCloud、SomaFM、TuneIn、iHeartRadio,以及各大音乐百科全书——它们全部通过一个简洁的接口输出一致的、类型化的媒体元数据,并共用同一套合规、低请求量的 HTTP 传输层。
- Scrapers
- Media Metadata
- Music
- Python
- 1 分钟阅读
多语言句型数据集:疑问句、命令句、陈述句
我们发布了 sentence-types-multilingual —— 涵盖七种语言、近 70,000 个句子,按语法类型(疑问句、命令句、陈述句、感叹句)分类。它是 little_questions 路由库背后的训练语料库。
- Datasets
- Multilingual
- NLP
- Intent
- 2 分钟阅读
面向稳健公开数据访问的可组合、即插即用 requests 会话
两个可组合的 requests.Session 子类,用于在不于关键路径上启动无头浏览器的前提下可靠地读取公开网页:兼容 TLS 的传输、用于 JS 挑战的 FlareSolverr 代理、Wayback Machine 回退,以及分散化的请求——unblock_requests 与 anon_requests。
- HTTP
- Scraping
- Cloudflare
- Anti-Bot
- 1 分钟阅读
Robots.txt、Sitemap 与合乎道德的网页抓取
在构建抓取器之前,先侦察目标站点。sitemapper 会读取 robots.txt、获取每一个 sitemap,并可选地遍历链接图谱——让你的抓取器从站点自身的契约出发,而非蛮力硬闯。
- Web Scraping
- Sitemaps
- Ethics
- Robots.txt
- 1 分钟阅读
面向葡萄牙语的经典 NLP:音节切分与字素到音素转换
介绍我们基于规则、完全离线的葡萄牙语 NLP 技术栈 —— 用于音节切分的 silabificador 和支持方言的字素到音素转换工具 TugaPhone —— 以及它们如何与面向葡语各变体的更广泛的 orthography2ipa 工作相衔接。没有深度学习黑箱:确定性、快速、依赖极少。
- NLP
- Portuguese
- Phonemization
- Grapheme-to-Phoneme
- 2 分钟阅读
面向 820 种语言的字素到 IPA 转换
orthography2ipa 是一个纯数据、以语言学为根基的资源,它将拼写映射到 IPA,并在 909 个语言规范、820 种语言和 20+ 个语系上建模音素如何以音位变体的形式在语境中显现。它包含一个候选词格(lattice)、一个最大匹配(maximal-munch)分词器、音系与文字距离度量、方言谱系,以及一套经模式校验、引用至方言学文献的规范集——没有训练权重,完全可自托管。
- G2P
- IPA
- Phonetics
- NLP
- 1 分钟阅读
推出首个巴兰克诺语音素转换器
g2p_barranquenho 是首个面向巴兰克诺语的开放字素转音素转换器。巴兰克诺语是葡萄牙巴兰科斯的伊比利亚-罗曼语接触语言——其规则源自该市新近发布的正字法约定,可对照仓库中所收录的源文件进行审核。
- Phonemization
- Barranquenho
- Minority Languages
- NLP
- 1 分钟阅读
为濒危语言克隆语音:为阿斯图里亚斯语和阿拉贡语构建文本转语音模型
我们发布了阿斯图里亚斯语(ast)和阿拉贡语(an)的实验性文本转语音模型——这两种少数罗曼语几乎没有任何商业语音支持——采用混合流程构建:经过筛选的 Common Voice 数据、零样本重配音,以及通过 phoonnx 进行的 VITS 训练。
- TTS
- Asturian
- Aragonese
- Minority Languages
- 1 分钟阅读
制造业中的 OVOS 与 HiveMind
COALA 和 WASABI 两个欧盟项目围绕 OVOS + HiveMind 构建了一整套工业语音助手框架,将它们与自有的工具、UI 和对话引擎相集成。
- OVOS
- HiveMind
- Industry
- manufacturing
- 1 分钟阅读
合成唤醒词数据集:七个助手名字,一个检测器
我们为常见的语音助手名字发布了七个合成唤醒词数据集——hey_computer、hey_mycroft、hey_siri、alexa、home_assistant、voice_assistant、wake_up。训练一个到处都能用的检测器。
- Datasets
- Wakewords
- Speech
- Synthetic
- 1 分钟阅读
推出 phoonnx:OpenVoiceOS 全新的 TTS 框架
phoonnx 现已成为 OpenVoiceOS 的主要文本转语音框架——一套完整的 VITS/ONNX 训练和推理栈——首发即为 Miro 和 Dii 带来全新的巴斯克语语音。
- phoonnx
- TTS
- OVOS
- ONNX
- 2 分钟阅读
OpenVoiceOS 与 Home Assistant:语音自动化梦之队
Home Assistant 负责自动化,OVOS 负责语音。三个集成层让这一组合得以运转:面向 HA 语音流水线的 Wyoming 桥接、作为对话代理的 ovos-persona-server,以及将 OVOS 设备呈现为原生 HA 实体的 HiveMind。
- OVOS
- Home Assistant
- Smart Home
- Voice Automation
- 1 分钟阅读
从零开始制作合成语音
为文本转语音系统创建一个语音通常需要一个真人花费数小时来录制音频。这既昂贵又耗时,而且在许多语言或口音中,这些语音根本就不存在
- TTS
- Synthetic Data
- Voice Cloning
- OVOS
- 1 分钟阅读
Miro 和 Dii 的 TTS 训练数据:覆盖 20 个语区的 40 个开放数据集
我们发布了 Miro 和 Dii 语音的 40 个合成训练数据集,涵盖葡萄牙语、荷兰语、德语、法语、意大利语、日语、西班牙语等等。大规模语音克隆:每种语言都有两个一致的身份。
- TTS
- Voice
- Datasets
- Miro & Dii
- 1 分钟阅读
不让任何语言掉队
通过语言检测、翻译插件和双向翻译能力,消除 OpenVoiceOS 中的语言障碍。
- OVOS
- multilingual
- language-detection
- translation