私たちは FOSS の音声・AI・データの専門家です。HiveMind スタックの 開発元として、また OpenVoiceOS の中核コントリビューターとして、私たちはプライバシーを 最優先し GDPR に準拠した音声技術を構築します。この技術はお客様のデータをご自身のハードウェア上に 保持します。さらに私たちは、手の届きにくい公開データをクリーンな API と厳選されたデータセットへと 変換することも同様に得意としています。
私たちの働き方
標準的な契約形態は、継続的なアクセスとサポートのための月額リテイナーであり、 個別の成果物(データセット、トレーニング済みモデル、カスタムプラグイン、統合など)は、 定義され次第、それぞれ別途スコープを定めて請求します。これにより、双方にとって予測可能な関係が 保たれます。お客様はチームに直接アクセスでき、それぞれの具体的な成果物には独自のスコープと価格が 設定されます。
私たちは、最初からスコープが明確に定められている単発のプロジェクト業務もお引き受けします。
あらゆるものを音声対応にします
私たちはあらゆるものに音声インターフェースを作成します。デバイス、アプリ、サービス、 あるいは製品ライン全体まで、話しかけたいものが何であれ、私たちは Open Voice Operating System と HiveMind を中心に築き上げてきた専門知識と、実戦で鍛えられたスタックを 再利用して、その音声レイヤーを構築します。カスタムのウェイクワード、Text-to-Speech(TTS)と Speech-to-Text(ASR)の接続、インテント処理、そしてオーダーメイドのコンポーネントを、 ゼロからではなく実証済みのオープンソース基盤から組み上げ、お客様ご自身のハードウェア上で動作させます。
カスタムのオフライン TTS 音声トレーニング
プロジェクトに独自の声が欲しいですか? 私たちはカスタムの高品質かつ完全オフラインの Text-to-Speech 音声をトレーニングします。特定の言語向けのデータセットをご用意いただくか、 参照音声をクローンしていただければ、その成果はデバイス上でローカルに動作し、OpenVoiceOS や Home Assistant にそのまま組み込める、高速でプライベートな TTS モデルとなります。 データは完全にお客様の管理下に置かれます。
私たちの音声がどのように聞こえるか気になりますか? 音声デモを試す — 私たちの Miro と Dii の音声が、20 以上の言語でブラウザ上でリアルタイムに合成されます。
お客様の言語と分野に合わせてファインチューニングした音声認識
私たちは最先端の Speech-to-Text モデル(Zipformer、Parakeet、Whisper など)を、 お客様の特定の言語、アクセント、分野固有の語彙に合わせてファインチューニングします。これにより、 お客様にとって本当に重要な単語や条件においても認識精度が保たれます。トレーニングデータが まだ存在しない場合には、私たちがそれを見つけ出し、適切な場合には私たちのデータセット構築 ツールチェーンを用いて合成します。この取り組みは Alpha Cephei とのパートナーシップに 支えられており、数十年にわたる自動音声認識の専門知識をお客様のプロジェクトにもたらします。
少数言語およびポルトガル語圏言語の音声技術
私たちは、主流のツールが無視する言語のための音声技術を構築します。これにはポルトガル語の 各変種や、その他のポルトガル語圏言語および少数言語が含まれます。音素化から ASR、TTS まで、 私たちは十分なサポートを受けられない言語コミュニティが、現代的でプライバシーを尊重した音声サポートを 得られるよう支援します。
データ抽出、クリーンな API とデータセット
膨大な価値あるデータが公開ウェブ上に存在していますが、その多くは事実上到達できません。 構造化されていないページの中に閉じ込められていたり、ボット対策の背後にあったり、文書化されていない エンドポイントを通じてのみ公開されていたり、どの検索エンジンもインデックスしない形式であったりします。 私たちはそれを取り出し、使える形にします。
- 回復力のあるスクレイパーとパーサー — 自動化に抵抗するソース向けに、ページや防御策が変化しても 動作し続けるよう設計されています。
- API のリバースエンジニアリング — 文書化されていない、あるいは非公開のエンドポイントを マッピングし、クリーンで型付けされた、文書化されたクライアントライブラリとして再公開します。
- 雑然としたソースを覆う一つのクリーンな API — 利用者ごとに個別のスクレイピングを行うのではなく、 一貫した単一のインターフェースを提供します。
- データセットの構築 — 抽出したデータを、明確な来歴を持つ構造化・バージョン管理された ML 対応のデータセットへと整備します。また、意味がある場合にはオープンなデータセットとして 公開することもできます。
これは、私たち自身のクライアントライブラリや、私たちが公開するデータセットを支えるものと 同じツールチェーンであり、メディアメタデータの拡充から音声・言語モデルのトレーニングコーパスまで、 あらゆるものに供給されています。
音声対応でアクセシブルなウェブサイト
私たちがデバイスに提供するのと同じ音声スタックは、ブラウザ内でも動作します。 phoonnx.js を使えば、私たちの TTS 音声は クライアント側で合成されます。クラウド API も、リクエストごとの費用も、訪問者のマシンから 外に出ていくものもありません。このサイト上にある 音声デモ がその証です。話す静的ページです。
私たちはその機能を中心に、ウェブサイトやウェブアプリケーションを構築します。自らを音読できるサイト、 音声を第一とするインターフェース、そして耳で閲覧するユーザーのための設計段階からアクセシブルな ページなどです。パフォーマンス、アクセシビリティ、そしてプライバシーは、追加機能ではなく既定の 仕様です。私たちは公式の OpenVoiceOS ウェブサイトの開発と保守も行っています。