記事
工房から
音声AI、OpenVoiceOSの開発、合成データ、少数言語の音声技術に関するノート。
- 1 分で読めます
オープン音声モデルを実際に動かす: エクスポートと量子化
研究用の GitHub ページに載っている学習済み音声モデルは、それだけでは音声アシスタントではありません。私たちはオープンな ASR と TTS のチェックポイントを ONNX、CoreML、GGUF に変換し、量子化し、出力を検証したうえで — OpenVoiceOS の下に結果を公開し、それがカバーするすべての言語が実際のオフラインアシスタントとして出荷されるようにします。
- ONNX
- CoreML
- GGUF
- ASR
- 2 分で読めます
機械とともに移植する、そして私たちが答えられなかったライセンスの問い
私たちは espeak-ng の G2P、Cotovia、AhoTTS、HermiT を含むいくつかの C、C++、Java のプログラムを純粋な Python として書き直しました。AI が元のソースを読み、人間が作業を指揮しました。私たちの側の人間は誰も元のソースを読んでいません。これは二つの別個の問いを提起します。その結果物はそもそも所有され得るのか、そしてそれは入力の派生物なのか? 私たちは答えるよりも安上がりだったので upstream のライセンスを維持しました。私たちはこの問いが今も未解決だと考えています。
- FOSS
- Licensing
- Open Source
- Python
- 3 分で読めます
純粋な ONNX 音声ライブラリ群
TigreGótico は、帯域拡張、音声クローニング、話者埋め込み、VAD、単語アクセント、音素化、TTS、そしてそれらすべてを採点する指標ライブラリからなる音声ライブラリ群を維持しています — これらは一つのランタイムルールを共有します。onnxruntime と numpy だけを使い、PyTorch も GPU も不要です。
- ONNX
- TTS
- voice cloning
- VAD
- 2 分で読めます
音韻論スタックはどう組み合わさっているか
私たちのテキストから発音へのスタックのアーキテクチャ案内: 表記法のための scriptconv、言語間の書記素から IPA へのエンジンである orthography2ipa、ポルトガル語・バスク語・ミランダ語・バランケーニョ語・アラビア語のためにその上に構築された言語固有のフロントエンド、そして音に基づく検索のための phonematcher。各レイヤーがなぜ存在するのか、候補ラティスとは何か、そして実際の方言出力を示します。
- G2P
- IPA
- Phonetics
- NLP
- 2 分で読めます
音声クローニングエンジンを選ぶ
voiceclonnx は、kNN 特徴交換から AR コーデック LM まで、10 の音声変換エンジンを一つの API の背後で動かします。これは、その背後にあるモデル系統、明瞭度と話者類似度の間の実際に測定されたトレードオフ、そして特定の仕事のためにエンジンを選ぶ方法についての手引きです。
- ONNX
- voice cloning
- voice conversion
- self-hosted
- 2 分で読めます
悪い音声をクリーンにする: audiosronnx におけるノイズ除去と帯域拡張
audiosronnx の二つの別個の仕事 — ノイズの除去と失われた高周波の再構築 — への深掘り。実際のエンジンレジストリ、モデルサイズとライセンス、不採用モデルのリスト、そして出力が実際に改善したかどうかを確認する方法を扱います。
- ONNX
- denoising
- bandwidth extension
- speech
- 2 分で読めます
聴取パネルなしで音声品質を測定する
speechonnxmetrics の実践ガイド: MOS、参照なし MOS 予測器、侵襲的信号指標、ASR ベースの WER/CER が実際に何を測っているか、それぞれをいつ適用するか、実際の音声からの実際のスコア、そしてなぜ予測された MOS が真実ではなく証拠なのか。
- speechonnxmetrics
- TTS
- ONNX
- evaluation
- 2 分で読めます
文字体系と音声表記法: scriptconv が実際に変換しているもの
文字体系を検出し音声表記法の間を変換する、依存関係のないライブラリ scriptconv への深掘り。IPA、ARPABET、X-SAMPA、ISO-15924 文字体系検出、アラビア語のための Buckwalter 音訳、字母へのハングル分解、かなの変換を、実際に実行された例と正直な限界とともに扱います。
- IPA
- Phonetics
- NLP
- Linguistics
- 1 分で読めます
あなたのセンチメントモデルは不満と別れを見分けられない
怒っているように見えるサポートメッセージが二つ届く。一人はエスカレートしようとしている、もう一人は声をかけずに去ろうとしている。ほぼすべての感情モデルがこの二人を見分けられない――同じ軸が欠けているからだ。emotion-algebra を紹介する。
- Affective Computing
- Emotion
- Machine Learning
- LILACS
- 1 分で読めます
なぜ私たちはデータを蓄えるのか:スクレイピングしたカタログから、より賢い音声・言語モデルへ
きれいで、型付けされ、出所のしっかりしたデータは、私たちが提供するすべてのモデルの原材料です。当社のスクレイパーが構築するカタログが、いかにして ASR のバイアシング用語彙、意図分類器、合成 NER コーパス、G2P 辞書、TTS 音声 — そして LLM のための誠実な燃料 — になるのか。
- Datasets
- Data Collection
- ASR
- NLP
- 1 分で読めます
みんながアプリを出すなら、私たちは音声を出す:ウェブサイトを音声アプリに変える
重要なサイトはどれもモバイルアプリに包まれてしまいました。私たちは音声と CLI の時代のために、その逆の動きを提案します。すなわち、サイトごとにきれいな API と音声スキルを用意し、ウェブが耳とキーボードで閲覧できるようにするのです。一度に 1 サイトずつ、それが積み重なって音声ブラウザになります。
- Voice
- Accessibility
- OpenVoiceOS
- Web Automation
- 1 分で読めます
2026 年の Usenet:学習と評価のためのきれいな AI 以前のテキストコーパス
Usenet は AI 以前の人間の言説の手つかずのアーカイブです — 数十年にわたるニュースグループの投稿はすべて人間によって書かれ、言語モデルには一切触れられていません。それが言語モデルおよび音声モデルの学習と評価にとって価値あるデータとなります。私たちはそれを収集する小さな Python ツールを作りました。
- Usenet
- Datasets
- NLP
- 1 分で読めます
2 つの声、すべての言語へ:Miro と Dii
TigreGótico は OpenVoiceOS と提携し、アシスタントに 2 つの一貫した音声アイデンティティ — Miro と Dii — を与えます。当社の音声クローニング技術と phoonnx エンジンで構築され、あらゆる言語で同じように聞こえます。誰かが要望するすべての言語に 2 つの TTS モデルを、危機言語も含めて。
- phoonnx
- TTS
- OVOS
- voice cloning
- 1 分で読めます
正しく発音する:TTS のためのポルトガル語異音同綴語の曖昧性解消
多くのヨーロッパポルトガル語の単語は、綴りは同じでも意味によって発音が異なります — そして母音を間違えると、TTS 音声は別の単語を口にしてしまいます。私たちは 27 語にわたる 56,891 文からなる、意味ラベル付きのオープンなデータセット bifonia-pt-homographs と、重量級の POS タガーが約 75% で頭打ちになるところで約 94% に達する、依存関係ゼロの小さなリゾルバを構築しました。
- Datasets
- Portuguese
- TTS
- Grapheme-to-Phoneme
- 1 分で読めます
ジャガイモの上でも動く TTS モデル
phoonnx は、低スペックのハードウェアでも快適に動作するように作られた、VITS ベースのテキスト読み上げのための研究フレームワークです。GPU なし、クラウドなし、API キーなし — 約 1,565 万パラメータの ONNX 音声と CPU だけ。良質な音声がどれほど小さくできるか、そして私たちがどう学習させるかをご紹介します。
- phoonnx
- TTS
- ONNX
- VITS
- 1 分で読めます
音楽データベース・スクレイパーのご紹介
音楽ソース向けに私たちが維持している型付き Python クライアント群を巡る案内 — Bandcamp、SoundCloud、SomaFM、TuneIn、iHeartRadio、そして偉大な音楽百科事典まで — すべてが一貫した型付きメディアメタデータを、一つのクリーンなインターフェースの背後で出力し、同じ準拠的で低ボリュームな HTTP トランスポートの上で動作します。
- Scrapers
- Media Metadata
- Music
- Python
- 1 分で読めます
多言語の文タイプ・データセット:疑問文、命令文、平叙文
sentence-types-multilingual を公開しました。7言語にわたる約70,000文を、文法的なタイプ(疑問文、命令文、平叙文、感嘆文)で分類したものです。これは little_questions 経路制御ライブラリの背後にある訓練用コーパスです。
- Datasets
- Multilingual
- NLP
- Intent
- 2 分で読めます
回復力ある公開データアクセスのための、組み合わせ可能でそのまま差し替えられる requests セッション
ホットパスでヘッドレスブラウザを使わずに公開 Web ページを確実に読み取るための、組み合わせ可能な 2 つの requests.Session サブクラス: TLS 互換のトランスポート、JS チャレンジ向けの FlareSolverr プロキシ、Wayback Machine へのフォールバック、そして IP を分散させるリクエスト — unblock_requests と anon_requests。
- HTTP
- Scraping
- Cloudflare
- Anti-Bot
- 1 分で読めます
Robots.txt、サイトマップ、そして倫理的なウェブスクレイピング
スクレイパーを構築する前に、まずサイトを偵察しましょう。sitemapper は robots.txt を読み込み、すべてのサイトマップを取得し、必要に応じてリンクグラフを巡回します。これにより、スクレイパーは力任せではなく、サイト自身の契約から出発できます。
- Web Scraping
- Sitemaps
- Ethics
- Robots.txt
- 1 分で読めます
ポルトガル語のための古典的NLP: 音節分割と書記素から音素への変換
ルールベースで完全にオフラインで動作する当社のポルトガル語NLPスタック — 音節分割を行う silabificador と、方言を考慮した書記素から音素への変換を行う TugaPhone — を紹介し、それらがルソフォン諸変種を対象とするより広範な orthography2ipa の取り組みとどのように結びつくかを解説します。ディープラーニングのブラックボックスはありません。決定論的で、高速、依存関係も最小限です。
- NLP
- Portuguese
- Phonemization
- Grapheme-to-Phoneme
- 2 分で読めます
820の言語に対応するグラフェムからIPAへの変換
orthography2ipa は、純粋なデータで構成され言語学的な裏付けを持つリソースであり、綴りをIPAに対応づけ、909の言語仕様、820の言語、20以上の語族にわたって音素が異音としてどのように表出するかをモデル化します。候補ラティス、maximal-munch トークナイザー、音韻的距離および文字体系距離の指標、方言系統、そして方言学の文献に引用づけられたスキーマ検証済みの仕様セット — 訓練済みの重みは一切なく、完全にセルフホスト可能です。
- G2P
- IPA
- Phonetics
- NLP
- 1 分で読めます
バランケーニョ語で初となる音素変換器のご紹介
g2p_barranquenho は、ポルトガルのバランコスで話されるイベロ・ロマンス系接触言語バランケーニョ語のための、初となるオープンな書記素-音素変換器です。規則は同自治体が新たに公開した正書法規約から導出されており、リポジトリに収録された原典に照らして検証できます。
- Phonemization
- Barranquenho
- Minority Languages
- NLP
- 1 分で読めます
絶滅危機言語のための音声クローニング:アストゥリアス語とアラゴン語のテキスト読み上げモデルの構築
アストゥリアス語(ast)とアラゴン語(an)という、商用音声のカバレッジがほぼ皆無の2つのロマンス系少数言語のための実験的なテキスト読み上げモデルを公開します。フィルタリングされたCommon Voiceデータ、ゼロショットのリボイシング、そしてphoonnxによるVITS学習を組み合わせたハイブリッドパイプラインで構築されています。
- TTS
- Asturian
- Aragonese
- Minority Languages
- 1 分で読めます
製造業における OVOS と HiveMind
EU プロジェクト COALA と WASABI は、OVOS + HiveMind を中心に産業用音声アシスタントのフレームワーク全体を構築し、独自のツール、UI、対話エンジンと統合しました。
- OVOS
- HiveMind
- Industry
- manufacturing
- 1 分で読めます
合成ウェイクワードデータセット: 7 つのアシスタント名、1 つの検出器
一般的な音声アシスタント名(hey_computer、hey_mycroft、hey_siri、alexa、home_assistant、voice_assistant、wake_up)向けに 7 つの合成ウェイクワードデータセットを公開しました。どこでも動作する検出器を学習しましょう。
- Datasets
- Wakewords
- Speech
- Synthetic
- 1 分で読めます
phoonnx のご紹介:OpenVoiceOS の新しい TTS フレームワーク
phoonnx が OpenVoiceOS の主要なテキスト読み上げフレームワークになりました — VITS/ONNX による完全な学習・推論スタックであり、まずは Miro と Dii の新しいバスク語音声から始まります。
- phoonnx
- TTS
- OVOS
- ONNX
- 1 分で読めます
OpenVoiceOS と Home Assistant: 音声オートメーションのドリームチーム
Home Assistant はオートメーションを担い、OVOS は音声を担います。この組み合わせを機能させるのは 3 つの統合レイヤーです。HA の音声パイプライン向けの Wyoming ブリッジ、会話エージェントとしての ovos-persona-server、そして OVOS デバイスを HA のネイティブエンティティとして表示する HiveMind です。
- OVOS
- Home Assistant
- Smart Home
- Voice Automation
- 1 分で読めます
合成音声をゼロから作る
テキスト読み上げシステムの音声を作成するには通常、実在の人物が何時間もかけて音声を収録する必要があります。これはコストがかかり、時間を要し、多くの言語やアクセントではそもそも音声がまったく存在しません。
- TTS
- Synthetic Data
- Voice Cloning
- OVOS
- 1 分で読めます
Miro & Dii TTS 学習データ: 20 ロケールにわたる 40 のオープンデータセット
ポルトガル語、オランダ語、ドイツ語、フランス語、イタリア語、日本語、スペイン語などにわたる Miro と Dii のための 40 の合成学習データセットを公開しました。大規模な音声クローニングにより、すべての言語に一貫した 2 つのアイデンティティを提供します。
- TTS
- Voice
- Datasets
- Miro & Dii
- 1 分で読めます
取り残される言語をなくす
言語検出、翻訳プラグイン、双方向翻訳機能を通じて、OpenVoiceOS における言語の壁を取り除く。
- OVOS
- multilingual
- language-detection
- translation