Alpha Cephei
Партнёрство в области распознавания речи, привносящее десятилетия опыта в автоматическом распознавании речи (ASR) — команда, стоящая за Vosk и моделями на базе Kaldi — в нашу работу по дообучению голосовых моделей и созданию датасетов.
Портфолио
Наша работа с открытым кодом — свободные, самостоятельно размещаемые библиотеки и инструменты, охватывающие голосовой ИИ, извлечение данных, наборы данных, NLP и игры, а также экосистему OpenVoiceOS и HiveMind, которую мы помогаем строить. Без привязки к поставщику, без обязательного облака.
Помимо кода, наши открытые наборы данных и модели опубликованы наHugging Face,а наши обучающие блокноты находятся в репозиторииml-notebooks.
Сообщество
Мы вносим вклад в проекты независимых партнёров и передаём работу, финансируемую из государственных средств, фонду OpenVoiceOS.
Партнёрство в области распознавания речи, привносящее десятилетия опыта в автоматическом распознавании речи (ASR) — команда, стоящая за Vosk и моделями на базе Kaldi — в нашу работу по дообучению голосовых моделей и созданию датасетов.
Испанская программа, развивающая языковые технологии для официальных языков страны (испанский, каталанский, баскский, галисийский). Финансирует разработку OVOS для создания загружаемых, уважающих приватность голосовых помощников, работающих на Raspberry Pi и персональных компьютерах. Финансируется Министерством цифровой трансформации Испании и Планом восстановления ЕС.
Программа Next Generation Internet Европейской комиссии (при софинансировании швейцарского SERI), поддерживающая OpenVoiceOS как стабильную, приоритизирующую приватность альтернативу голосовым помощникам от бигтеха. Фокус: поддержка нескольких языков, онбординг пользователей, стабилизация платформы и документация.
Независимый некоммерческий фонд, создающий управляемую сообществом, уважающую приватность открытую платформу голосового ИИ. TigreGótico является ключевым контрибьютором OpenVoiceOS, а его основатель входит в совет директоров фонда.
Обзор
Фильтруйте по области, чтобы узнать больше — всё это открытый код.
Асинхронная обёртка Python для CLI кодовых агентов (Claude Code, Gemini, opencode, Antigravity) за единым API Provider — одноразовые запросы, многоходовые сессии, типизированные потоковые события и паттерны пайплайна fan-out/делегирование/повтор.
Распознавание именованных сущностей с помощью алгоритма Ахо-Корасик.
Версионно-зависимое преобразование графем в фонемы на чистом Python без зависимостей для баскского и испанского — точно воспроизводит фронтенд AhoTTS и выдаёт односимвольную строку IPA, используемую для обучения голосов StyleTTS2/VITS.
Браузерный инструмент для выравнивания аудио с текстовыми транскрипциями и IPA на уровне слов, графем и предложений. Работает полностью на стороне клиента, без сервера, без зависимостей, без этапа сборки.
Анонимный HTTP с ротацией IP; сочетается с unblock_requests для ротации плюс обхода ботозащиты.
Преобразование арабского (MSA) текста в IPA на правилах с огласовкой ташкиль, построенное на orthography2ipa — контекстно-зависимое дерево токенов обрабатывает ассимиляцию солнечных букв, хамзат аль-васль, танвин и та-марбуту, предварительно огласовывая голый текст с помощью встроенных моделей ONNX.
Поиск и потоковое воспроизведение общедоступных аудиокниг из LibriVox и подобных источников.
Восстановление речи, шумоподавление и расширение полосы в чистом ONNX — повышает узкополосную речь до 48 кГц без torch во время выполнения.
Минимальная клиентская HTTP-библиотека для Python — лёгкая альтернатива requests.
Разрешение гетерофонных омографов европейского португальского для TTS — выбирает правильное произношение слов, пишущихся одинаково, но читающихся по-разному в зависимости от значения (sede = жажда или штаб-квартира, forma = форма для литья или форма). Правила на чистом Python плюс обученные модели, с открытыми датасетами.
Предобученные частеречные теггеры Брилла для 11 языков, поставляемые как готовые к использованию pickled-модели поверх NLTK — размечайте текст без обучения.
Движок инференса на базе ONNX для разговорного ИИ.
Пакет Python для получения информации о композиторах классической музыки из Classical Archives.
Многоязычный CRF-экстрактор ключевых слов / поисковых запросов — вытягивает запрос из вопроса на естественном языке с помощью CRF по признакам POS и орфографии, с предобученными моделями для каждого языка.
Предсказание эмоций/эмодзи DeepMoji в ONNX.
Обнаружение и преобразование между семью нормами португальской орфографии — дореформенное этимологическое письмо до 1911 года, реформы 1911/1943/1945/1971/1973 годов и Орфографическое соглашение 1990 года с его европейским и бразильским подвариантами.
Инструменты для направления разговоров к цели.
Структурированные данные и операции для работы с человеческими эмоциями.
Реализация на чистом Python без зависимостей фронтенда преобразования графем в фонемы espeak-ng — только текст в фонемы, без C-расширения. Воспроизводит бинарник espeak-ng байт-в-байт на выборке заголовочных слов из 86 языков и корпусе предложений из 31 языка; включает 117 языков.
Диалектно-чувствительный баскский фонемизатор текста в IPA на основе общей решётки произношения orthography2ipa — открытый, проверяемый, с указанием источников.
Преобразование графем в фонемы для барранкенью.
Протокол для построения иерархических сетей агентов — лёгкие устройства-спутники подключаются через зашифрованную mesh-сеть к любому диалоговому агенту: от OpenVoiceOS до LLM-персон и произвольных A2A-агентов. Экосистема охватывает транспортные протоколы, голосовые спутники, мосты в чаты, криптографию и обнаружение без настройки.
Плагин агентского протокола A2A для hivemind-core — соединяет hive с внешними серверами Agent-to-Agent (A2A) по JSON-RPC 2.0, передавая ответы спутникам потоком.
Простая база данных на JSON-файлах для Python.
Лёгкий движок интентов.
Движок сопоставления шаблонов ключевых слов для распознавания интентов.
Предельно простой детектор языка на чистом Python на основе списков слов.
Публикация телеметрии питания и системы Linux/SBC в Home Assistant через MQTT — CPU/GPU/RAM/диск, температуры, троттлинг, аудио + MPRIS, WiFi/Bluetooth — всё с автообнаружением. Построено на powerguess.
Разбор и классификация вопросов.
Генерация текста цепями Маркова из данных JSON.
Модели цепей Маркова, экспортированные в ONNX.
Индексируйте, канонизируйте, дедуплицируйте и раздавайте медиакаталоги из YouTube и других источников.
Общий словарь медиа-метаданных и слой нормализации, который унифицирует сопоставление названий, исполнителей и идентификаторов между медиаклиентами и интеграциями Music Assistant.
Клиенты медиа-метаданных на базе Pydantic и беcключевой межисточниковый резолвер сущностей.
Фонемизатор на правилах для мирандского языка.
Библиотека машинного обучения и нейросетей в стиле scikit-learn, зависящая только от numpy и scipy — написана, чтобы её читали.
Клиент SoundCloud, выдающий типизированные релизы медиа-метаданных.
Открытая голосовая платформа, развиваемая сообществом и ориентированная на приватность. TigreGótico — один из ключевых участников всей экосистемы: поддерживает речевые плагины, сервисы STT/TTS, инструменты разработчика и формальные спецификации в десятках репозиториев.
Набор инструментов для передачи данных через звук на чистом Python — переносите текст и данные через аудиоканал (DTMF и другие) с помощью общих примитивов WAV/синус/Гёрцель. Основные схемы не имеют зависимостей.
Сопоставления графема-в-IPA и аллофонов для более чем 350 языков из более чем 20 семей — токенизатор IPA по принципу максимального захвата, метрики фонологического и графического расстояния, диалектные преобразования и подключаемый бэкенд G2P.
Фреймворк интеграции агентов для OpenVoiceOS — реализация голосовых агентных рабочих процессов.
Монитор шины сообщений OpenVoiceOS — наблюдайте трафик шины в реальном времени для отладки навыков, интентов и сервисов.
Плагин векторных эмбеддингов ChromaDB для OpenVoiceOS.
Плагин OVOS для нормализации текста диалога перед синтезом TTS (раскрытие чисел, сокращений).
Разбиение документов для поиска/RAG в OpenVoiceOS.
Плагин быстрого семантического переранжирования результатов запросов OVOS.
Плагин локальных эмбеддингов GGUF для OpenVoiceOS.
Плагин локальной LLM (GGUF) для OpenVoiceOS.
Локальный решатель на базе LLM с моделями GGUF в OpenVoiceOS.
GitHub-нативная платформа локализации для навыков и плагинов OpenVoiceOS — управляйте переводами полностью через Git, без внешнего сервиса.
Пайплайн интентов Model2Vec для обработки интентов в OpenVoiceOS.
Плагин ChatEngine для OVOS, проксирующий реплики диалога через шину сообщений OVOS — подключайте чат-интерфейсы напрямую к работающему ассистенту.
Сервер открытых метрик для OpenVoiceOS — собирает анонимные метрики использования и публикует их как открытые датасеты; разработан в рамках проекта ILENIA.
Арена бенчмаркинга плагинов OVOS — очные поединки с ELO-рейтингом для сравнения реализаций STT, TTS и других плагинов на реальных нагрузках.
Плагин эмбеддингов векторной базы данных Qdrant для OpenVoiceOS.
Плагин ASR OVOS с использованием акустической модели Citrinet, обученной на речевых данных ILENIA.
Плагин ASR OVOS с использованием дообученных Zuazo моделей Faster-Whisper для баскского языка.
Плагин ASR OVOS для баскского распознавания речи HiTZ.
Плагин ASR OVOS с использованием масштабно многоязычного распознавания речи Meta MMS.
Плагин ASR OVOS с использованием моделей ASR NVIDIA NeMo.
Плагин ASR OVOS для галисийского распознавания речи NOS.
Плагин распознавания речи для OVOS на основе onnx-asr — лёгкий ASR из ONNX-моделей, без torch.
Плагин ASR OVOS с использованием моделей wav2vec 2.0 для испанского и соофициальных языков.
Плагин ASR OVOS, объединяющий Whisper с языковой моделью для повышения точности.
Разворачивайте любой STT-плагин OpenVoiceOS как сетевой сервис — небольшой сервер, отдающий распознавание речи по HTTP спутникам и сторонним клиентам.
Плагин TTS OVOS для AhoTTS — системы синтеза речи для баскского языка, разработанной в рамках ILENIA.
Плагин TTS OVOS, оборачивающий Coqui TTS для испаноязычных голосов.
Плагин TTS OVOS для Cotovia — движка синтеза речи для галисийского языка.
Плагин TTS OVOS для многоголосого каталонского синтеза Matxa.
Плагин TTS OVOS для галисийского синтеза речи NOS.
Разворачивайте любой TTS-плагин OpenVoiceOS как сервис — простой flask-сервер, превращающий любой TTS-плагин в самостоятельно размещаемый API синтеза речи.
Аудио-суперразрешение для TTS в OVOS — FlashSR повышает синтезированную речь с 16 до 48 кГц через ONNX перед воспроизведением, делая любой голос ярче без переобучения.
Аудио-суперразрешение для TTS в OVOS — NovaSR повышает синтезированную речь с 16 до 48 кГц быстрым апсемплером FastSR, пропуская звук, уже записанный в 48 кГц.
Настройка Docker для OpenVoiceOS с сервисами Wyoming.
Фреймворк сквозного тестирования навыков OVOS с лёгкой внутрипроцессной средой выполнения.
Предельно простой парсер интентов по ключевым словам — прямая замена Adapt, сопоставляющая фразы с обязательными/опциональными слотами ключевых слов; создан в TigreGótico и передан OpenVoiceOS.
Фонетический нечёткий поиск и расстояние между сегментами.
Библиотека Python для многоязычной фонемизации и синтеза речи (TTS) с использованием моделей ONNX.
Дополнение для экранного диктора NVDA в Windows, озвучивающее через нейронные ONNX-голоса phoonnx, демонстрируя phoonnx как TTS-бэкенд для доступности.
Инференс VITS TTS прямо в браузере с onnxruntime-web. Пути Unicode и espeak-ng. Без сервера, без API.
Автоматизированный контроллер браузера на базе Selenium и Selenium Wire — сессии, обработка событий, взаимодействие с элементами и управление расширениями для скрапинга и тестирования там, где без полноценного браузера не обойтись.
Оценка или измерение энергопотребления устройства на Linux — библиотека Python с минимумом зависимостей и указанием происхождения каждого измерения (INA219, RAPL, PMIC Raspberry Pi, батарея или калиброванная ограниченная оценка).
Порт precise-onnx для браузера/Node.js для распознавания ключевого слова. Извлечение признаков MFCC и распознавание на базе ONNX, совместимое с моделями Precise .onnx.
Разрешение кореференции через POS местоимений и эвристики рода слов.
Скрапер Bandcamp, выдающий типизированные релизы медиа-метаданных.
HTTP-клиент Python и мост mediavocab для сервера Music Assistant — общий транспортный и конверсионный слой в основе интеграции OVOS с Music Assistant.
Библиотека Python для синтеза речи AhoTTS.
Порт на Python AhoTTS Iparrahotsa — движка синтеза речи для северного (континентального) баскского — аналог pyAhoTTS для диалекта Ипарральде, с hts_engine и вокодером AhoCoder. Разработан совместно с Aholab (UPV/EHU).
Типизированный клиент Python для Classical Archives.
Порт на чистом Python фронтенда G2P Cotovia для галисийского и испанского языков. Воспроизводит слогоделение, ударение и транскрипцию скомпилированного C-бинарника без подпроцессов.
Потоковый клиент Python для ежемесячных дампов данных Discogs.
Типизированный клиент Python и выгрузчик датасета в markdown для Erowid (erowid.org).
Порт на чистом Python движка рассуждений EYE N3 — подайте ему факты и правила Notation3, и он выводит новые факты через прямой/обратный вывод, вывод RDFS и OWL 2 RL, деревья доказательств и более 280 встроенных функций. Одна зависимость (rdflib).
Клиент скрапинга для fanedit.org / IFDB.
Обёртка на Python для движка интерактивной художественной литературы.
Клиент Python для Project Gutenberg — метаданные книг через открытый каталог.
Клиент API iHeartRadio.
Порт на чистом Python HermiT — DL-ризонера OWL 2 из Оксфорда — непротиворечивость, классификация и извлечение экземпляров через табло гиперрезолюции, без JVM и без зависимостей во время выполнения.
Клиент метаданных Python для IMDb. Сопоставляет свободные текстовые запросы с каноническими названиями IMDb.
Типизированный клиент Python для Infopédia — европейско-португальского словаря Porto Editora — разбирает каждую статью на произношения IPA, слогоделение, этимологию и значения, корректно разделяя гетерофонные омографы для работы с G2P и разрешением неоднозначности.
Пакет Python для взаимодействия с InspiroBot (inspirobot.me).
Типизированный клиент Python для Jazz Music Archives.
Клиент Python для LiveATC.net — находите, транслируйте и архивируйте живые и исторические аудиопотоки управления воздушным движением, с экспортом датасета для обучения ASR.
Скрапер / клиент API для MyAnimeList — аниме и манга.
Клиент API Encyclopaedia Metallum (Metal Archives).
Клиент метаданных Python для MusicBrainz — открытой музыкальной энциклопедии.
Типизированный клиент Python для Portal da Lingua Portuguesa.
Типизированный клиент Python для Prog Archives.
Типизированный клиент Python и выгрузчик датасета в markdown для PsychonautWiki (psychonautwiki.org).
HTML-скрапер на Python для rateyourmusic.com.
Скрапер Python для romhacking.net (RHDN) — общественной базы данных ROM-хаков, фанатских переводов, утилит для патчинга и документации.
Модульный асинхронный клиент Python для API Shazam, построенный поверх shazamio_core для надёжного аудиоотпечатка.
Клиент Python для публичного JSON API smwcentral.net — постраничный доступ к каталогу ROM-хакинга Super Mario World / SM64 / Yoshi's Island.
Клиент справочников о веществах TripSit и матрицы взаимодействий (снижение вреда).
HTML-скрапер на Python для PmWiki tvtropes.org.
Клиент Python для публичного JSON API kana VNDB (Visual Novel Database).
Клиент Python для WikiHow.
Типизированный клиент Python для MediaWiki API английского Wiktionary.
Многоязычный клиент-агрегатор «Слово дня».
Клиент SomaFM, выдающий типизированные релизы медиа-метаданных.
Реализация Rapid Automatic Keyword Extraction.
Библиотека автонастройки звука для raspOVOS — находит звуковые карты, HAT и USB-устройства на Raspberry Pi и настраивает их для голосового ассистента; разработана в рамках проекта ILENIA.
Клиент анонимного ремейлера электронной почты с поддержкой протоколов Cypherpunk и Mixmaster.
Ядро для письменностей и фонемных нотаций без зависимостей — определение ISO-15924, IPA ↔ ARPABET/X-SAMPA/Kirshenbaum/Cotovía, Бакуолтер ↔ арабский, хангыль → чамо, кана.
Докеризированный мост, который распознаёт аудио в помещении через Shazam и публикует метаданные трека (название, исполнитель, обложка, тексты, ссылки Apple Music / Spotify / Deezer) в MQTT с автообнаружением Home Assistant.
Инструмент слогоделения для португальского текста.
Простое распознавание именованных сущностей на правилах.
Утилита разведки сайтов для изучения структуры сайта перед созданием скраперов. Строит карту robots.txt, карт сайта и графов ссылок, используя транспорт unblock_requests для устойчивого исследования защищённых или сложных сайтов.
Фонемизатор для региональных акцентов европейского португальского.
Библиотека эмбеддингов диктора на чистом onnxruntime — извлечение эмбеддингов диктора, вычисление косинусного сходства и верификация личности диктора из моделей ONNX, без PyTorch во время выполнения.
Единый набор метрик оценки речи — нейросетевой MOS (UTMOS, NISQA, SIGMOS, DNSMOS), интрузивные (STOI, SI-SDR, MCD) и ASR (WER/CER) — только на numpy и onnxruntime.
Демон, который отслеживает монтирования SSHFS/rclone и автоматически перемонтирует их при отключении — с живой веб-панелью, REST API, метриками Prometheus, вебхуками и запланированными задачами синхронизации rsync/rclone.
Многоязычная расстановка словесного ударения для TTS-фронтендов, работающая только на onnxruntime и numpy.
Унифицированная библиотека абстракции погоды из нескольких провайдеров для Python. Запрашивайте OpenWeatherMap, Open-Meteo, MetNo, IPMA, NWS и другие через один согласованный API.
Лёгкая огласовка арабского (ташкиль) — единый компактный API поверх взаимозаменяемых моделей ONNX, восстанавливающих недостающие огласовки, без PyTorch и офлайн по умолчанию. Обеспечивает этап огласовки arbtok.
Обработчик лексикона и лингвистическая утилита для португальских диалектов.
Морфологический анализатор на правилах для португальского языка — разбивает слова на морфемы.
Инструменты преобразования графем в фонемы для португальского языка.
Лёгкий частеречный (POS) теггер для португальского языка.
Скрапер радио TuneIn, выдающий типизированные релизы медиа-метаданных.
Лёгкий скрапер YouTube, выдающий типизированные релизы медиа-метаданных.
Подкласс requests.Session, обходящий Cloudflare (имитация curl_cffi, FlareSolverr, откат на Wayback) — транспорт против ботозащиты, лежащий в основе наших скраперов.
Живой читатель USENET и скрапер статей для исследования альтернативных протоколов и архивирования.
Мост распознавания голосовой активности в реальном времени на базе ovos-plugin-manager. Публикует вероятность речи (0–100 %), уровень шума (дБ) и сглаженный бинарный сенсор обнаружения речи в MQTT — с автообнаружением Home Assistant.
Распознавание голосовой активности по-ONNX-овски — загрузите любую модель VAD за единым потоковым API с крошечной средой выполнения (numpy + onnxruntime). Аналог phoonnx для VAD; большинство бэкендов — это данные, а не код.
Многодвижковое преобразование голоса на чистом ONNX — переозвучивает любую речь голосом эталонного диктора без PyTorch при инференсе. 14 движков (kNN-VC, FreeVC, OpenVoice, RVC, CosyVoice…) за единым API VoiceCloner, плюс CLI и сборки INT8.
Тренер моделей ключевых слов, разработанный по гранту NLnet для OpenVoiceOS — создавайте собственные ключевые слова, работающие на устройстве, из ваших образцов.
Веб-приложение Flask для ручной разметки аудио ключевых слов — воспроизводите каждый фрагмент и размечайте слово, пол диктора и тип шума, накапливая корпус, готовый к обучению или оценке.
Сервис ASR OpenVoiceOS для протокола Wyoming — лёгкое распознавание речи.
Сервис TTS OpenVoiceOS для протокола Wyoming — лёгкий синтез речи.
Сервис распознавания ключевого слова OpenVoiceOS для протокола Wyoming.
Модульный асинхронный клиент Python для API Shazam — аудиоотпечаток через shazamio-core с типизированными моделями Track/Artist и скрапером каталога.
Компактная библиотека кодирования двоичных данных в текст (Base91, Z85B, Z85P) — быстрые реализации на C с запасными вариантами на чистом Python, все компактнее base64.