Портфолио

Открытый код

Наша работа с открытым кодом — свободные, самостоятельно размещаемые библиотеки и инструменты, охватывающие голосовой ИИ, извлечение данных, наборы данных, NLP и игры, а также экосистему OpenVoiceOS и HiveMind, которую мы помогаем строить. Без привязки к поставщику, без обязательного облака.


Помимо кода, наши открытые наборы данных и модели опубликованы наHugging Face,а наши обучающие блокноты находятся в репозиторииml-notebooks.

Сообщество

Работа с сообществом

Мы вносим вклад в проекты независимых партнёров и передаём работу, финансируемую из государственных средств, фонду OpenVoiceOS.

Alpha Cephei

Партнёрство в области распознавания речи, привносящее десятилетия опыта в автоматическом распознавании речи (ASR) — команда, стоящая за Vosk и моделями на базе Kaldi — в нашу работу по дообучению голосовых моделей и созданию датасетов.

ILENIA

Испанская программа, развивающая языковые технологии для официальных языков страны (испанский, каталанский, баскский, галисийский). Финансирует разработку OVOS для создания загружаемых, уважающих приватность голосовых помощников, работающих на Raspberry Pi и персональных компьютерах. Финансируется Министерством цифровой трансформации Испании и Планом восстановления ЕС.

NGI0 Commons Fund / NLnet

Программа Next Generation Internet Европейской комиссии (при софинансировании швейцарского SERI), поддерживающая OpenVoiceOS как стабильную, приоритизирующую приватность альтернативу голосовым помощникам от бигтеха. Фокус: поддержка нескольких языков, онбординг пользователей, стабилизация платформы и документация.

OpenVoiceOS

Независимый некоммерческий фонд, создающий управляемую сообществом, уважающую приватность открытую платформу голосового ИИ. TigreGótico является ключевым контрибьютором OpenVoiceOS, а его основатель входит в совет директоров фонда.

Обзор

Избранное

Фильтруйте по области, чтобы узнать больше — всё это открытый код.

Инструменты разработчика

agentpipe

Асинхронная обёртка Python для CLI кодовых агентов (Claude Code, Gemini, opencode, Antigravity) за единым API Provider — одноразовые запросы, многоходовые сессии, типизированные потоковые события и паттерны пайплайна fan-out/делегирование/повтор.

  • agents
  • async
  • CLI
  • orchestration
Фонетика и G2P

ahotts-g2p

Версионно-зависимое преобразование графем в фонемы на чистом Python без зависимостей для баскского и испанского — точно воспроизводит фронтенд AhoTTS и выдаёт односимвольную строку IPA, используемую для обучения голосов StyleTTS2/VITS.

  • G2P
  • Basque
  • Spanish
  • IPA
Распознавание речи

ALIGN

Браузерный инструмент для выравнивания аудио с текстовыми транскрипциями и IPA на уровне слов, графем и предложений. Работает полностью на стороне клиента, без сервера, без зависимостей, без этапа сборки.

  • IPA
  • audio-text alignment
  • browser-based
  • JavaScript
Данные и скрейпинг

anon_requests

Анонимный HTTP с ротацией IP; сочетается с unblock_requests для ротации плюс обхода ботозащиты.

  • HTTP
  • IP rotation
  • privacy
Фонетика и G2P

arbtok

Преобразование арабского (MSA) текста в IPA на правилах с огласовкой ташкиль, построенное на orthography2ipa — контекстно-зависимое дерево токенов обрабатывает ассимиляцию солнечных букв, хамзат аль-васль, танвин и та-марбуту, предварительно огласовывая голый текст с помощью встроенных моделей ONNX.

  • Arabic
  • G2P
  • IPA
  • diacritization
Медиа и музыка

audiobooker

Поиск и потоковое воспроизведение общедоступных аудиокниг из LibriVox и подобных источников.

  • LibriVox
  • audiobooks
  • scraper
Синтез речи

audiosronnx

Восстановление речи, шумоподавление и расширение полосы в чистом ONNX — повышает узкополосную речь до 48 кГц без torch во время выполнения.

  • ONNX
  • audio super-resolution
  • speech enhancement
Инструменты разработчика

baresipy

Минимальная клиентская HTTP-библиотека для Python — лёгкая альтернатива requests.

  • HTTP
  • Python
  • client
  • lightweight
Фонетика и G2P

bifonia

Разрешение гетерофонных омографов европейского португальского для TTS — выбирает правильное произношение слов, пишущихся одинаково, но читающихся по-разному в зависимости от значения (sede = жажда или штаб-квартира, forma = форма для литья или форма). Правила на чистом Python плюс обученные модели, с открытыми датасетами.

  • grapheme-to-phoneme
  • TTS
  • homographs
  • word-sense disambiguation
NLP и язык

brill_postaggers

Предобученные частеречные теггеры Брилла для 11 языков, поставляемые как готовые к использованию pickled-модели поверх NLTK — размечайте текст без обучения.

  • POS tagging
  • 11 languages
  • NLTK
NLP и язык

crf_query_xtract

Многоязычный CRF-экстрактор ключевых слов / поисковых запросов — вытягивает запрос из вопроса на естественном языке с помощью CRF по признакам POS и орфографии, с предобученными моделями для каждого языка.

  • keyword extraction
  • CRF
  • multilingual
Фонетика и G2P

desacordo_ortografico

Обнаружение и преобразование между семью нормами португальской орфографии — дореформенное этимологическое письмо до 1911 года, реформы 1911/1943/1945/1971/1973 годов и Орфографическое соглашение 1990 года с его европейским и бразильским подвариантами.

  • Portuguese
  • orthography
  • AO1990
  • text conversion
Фонетика и G2P

espyak

Реализация на чистом Python без зависимостей фронтенда преобразования графем в фонемы espeak-ng — только текст в фонемы, без C-расширения. Воспроизводит бинарник espeak-ng байт-в-байт на выборке заголовочных слов из 86 языков и корпусе предложений из 31 языка; включает 117 языков.

  • G2P
  • IPA
  • phonemization
  • espeak-ng
Фонетика и G2P

euskaphone

Диалектно-чувствительный баскский фонемизатор текста в IPA на основе общей решётки произношения orthography2ipa — открытый, проверяемый, с указанием источников.

  • Basque
  • G2P
  • IPA
  • TTS frontend
Voice PlatformsРекомендуемое

HiveMind

Протокол для построения иерархических сетей агентов — лёгкие устройства-спутники подключаются через зашифрованную mesh-сеть к любому диалоговому агенту: от OpenVoiceOS до LLM-персон и произвольных A2A-агентов. Экосистема охватывает транспортные протоколы, голосовые спутники, мосты в чаты, криптографию и обнаружение без настройки.

  • agent networks
  • distributed voice
  • protocol
NLnet

hivemind-a2a-agent-plugin

Плагин агентского протокола A2A для hivemind-core — соединяет hive с внешними серверами Agent-to-Agent (A2A) по JSON-RPC 2.0, передавая ответы спутникам потоком.

  • A2A
  • agent
  • interoperability
Умный дом

linux2mqtt

Публикация телеметрии питания и системы Linux/SBC в Home Assistant через MQTT — CPU/GPU/RAM/диск, температуры, троттлинг, аудио + MPRIS, WiFi/Bluetooth — всё с автообнаружением. Построено на powerguess.

  • MQTT
  • Home Assistant
  • power
  • system monitoring
Медиа и музыка

media-archivist

Индексируйте, канонизируйте, дедуплицируйте и раздавайте медиакаталоги из YouTube и других источников.

  • catalogue
  • homelab
  • indexing
  • media
Медиа и музыкаРекомендуемое

mediavocab

Общий словарь медиа-метаданных и слой нормализации, который унифицирует сопоставление названий, исполнителей и идентификаторов между медиаклиентами и интеграциями Music Assistant.

  • media metadata
  • normalization
  • vocabulary
Медиа и музыка

metadatarr

Клиенты медиа-метаданных на базе Pydantic и беcключевой межисточниковый резолвер сущностей.

  • Pydantic
  • media metadata
  • resolver
Инструменты разработчика

nupyml

Библиотека машинного обучения и нейросетей в стиле scikit-learn, зависящая только от numpy и scipy — написана, чтобы её читали.

  • machine learning
  • numpy
  • education
Voice PlatformsРекомендуемое

Open Voice OS

Открытая голосовая платформа, развиваемая сообществом и ориентированная на приватность. TigreGótico — один из ключевых участников всей экосистемы: поддерживает речевые плагины, сервисы STT/TTS, инструменты разработчика и формальные спецификации в десятках репозиториев.

  • FOSS
  • privacy-first
  • voice platform
Инструменты разработчика

OpenTone

Набор инструментов для передачи данных через звук на чистом Python — переносите текст и данные через аудиоканал (DTMF и другие) с помощью общих примитивов WAV/синус/Гёрцель. Основные схемы не имеют зависимостей.

  • data-over-sound
  • DTMF
  • audio
  • signal processing
Фонетика и G2PРекомендуемое

orthography2ipa

Сопоставления графема-в-IPA и аллофонов для более чем 350 языков из более чем 20 семей — токенизатор IPA по принципу максимального захвата, метрики фонологического и графического расстояния, диалектные преобразования и подключаемый бэкенд G2P.

  • 350+ languages
  • G2P
  • IPA
  • phonemization
NLnet

ovos-busmon

Монитор шины сообщений OpenVoiceOS — наблюдайте трафик шины в реальном времени для отладки навыков, интентов и сервисов.

  • messagebus
  • debugging
  • monitoring
NLnet

ovos-localize

GitHub-нативная платформа локализации для навыков и плагинов OpenVoiceOS — управляйте переводами полностью через Git, без внешнего сервиса.

  • GitHub-native
  • i18n
  • localization
  • no-infra
NLnet

ovos-messagebus-chat-plugin

Плагин ChatEngine для OVOS, проксирующий реплики диалога через шину сообщений OVOS — подключайте чат-интерфейсы напрямую к работающему ассистенту.

  • chat
  • messagebus
  • plugin
ILENIA

ovos-opendata-server

Сервер открытых метрик для OpenVoiceOS — собирает анонимные метрики использования и публикует их как открытые датасеты; разработан в рамках проекта ILENIA.

  • metrics
  • open data
  • server
NLnet

ovos-plugin-arena

Арена бенчмаркинга плагинов OVOS — очные поединки с ELO-рейтингом для сравнения реализаций STT, TTS и других плагинов на реальных нагрузках.

  • benchmark
  • ELO
  • plugins
NLnet

ovos-stt-server

Разворачивайте любой STT-плагин OpenVoiceOS как сетевой сервис — небольшой сервер, отдающий распознавание речи по HTTP спутникам и сторонним клиентам.

  • STT
  • server
  • self-hosted
NLnet

ovos-tts-server

Разворачивайте любой TTS-плагин OpenVoiceOS как сервис — простой flask-сервер, превращающий любой TTS-плагин в самостоятельно размещаемый API синтеза речи.

  • TTS
  • server
  • self-hosted
NLnet

ovos_tts_transformer_FlashSR

Аудио-суперразрешение для TTS в OVOS — FlashSR повышает синтезированную речь с 16 до 48 кГц через ONNX перед воспроизведением, делая любой голос ярче без переобучения.

  • TTS
  • super-resolution
  • ONNX
NLnet

ovos_tts_transformer_NovaSR

Аудио-суперразрешение для TTS в OVOS — NovaSR повышает синтезированную речь с 16 до 48 кГц быстрым апсемплером FastSR, пропуская звук, уже записанный в 48 кГц.

  • TTS
  • super-resolution
  • ONNX
NLnet

ovoscope

Фреймворк сквозного тестирования навыков OVOS с лёгкой внутрипроцессной средой выполнения.

  • OVOS skills
  • end-to-end testing
  • in-process runtime
NLnet, NLP и язык

palavreado

Предельно простой парсер интентов по ключевым словам — прямая замена Adapt, сопоставляющая фразы с обязательными/опциональными слотами ключевых слов; создан в TigreGótico и передан OpenVoiceOS.

  • intent parsing
  • NLP
Синтез речиРекомендуемое

phoonnx

Библиотека Python для многоязычной фонемизации и синтеза речи (TTS) с использованием моделей ONNX.

  • ONNX models
  • multilingual TTS
  • phonemization
Синтез речи

phoonnx-AddonNVDA

Дополнение для экранного диктора NVDA в Windows, озвучивающее через нейронные ONNX-голоса phoonnx, демонстрируя phoonnx как TTS-бэкенд для доступности.

  • NVDA
  • accessibility
  • screen reader
  • ONNX
Данные и скрейпинг

pombo_correio

Автоматизированный контроллер браузера на базе Selenium и Selenium Wire — сессии, обработка событий, взаимодействие с элементами и управление расширениями для скрапинга и тестирования там, где без полноценного браузера не обойтись.

  • browser automation
  • Selenium
  • scraper
Умный дом

powerguess

Оценка или измерение энергопотребления устройства на Linux — библиотека Python с минимумом зависимостей и указанием происхождения каждого измерения (INA219, RAPL, PMIC Raspberry Pi, батарея или калиброванная ограниченная оценка).

  • power
  • energy
  • RAPL
  • INA219
Слова активации

precise-onnx-js

Порт precise-onnx для браузера/Node.js для распознавания ключевого слова. Извлечение признаков MFCC и распознавание на базе ONNX, совместимое с моделями Precise .onnx.

  • ONNX
  • Wake words
  • Web
  • Audio
Умный дом

py-music-assistant

HTTP-клиент Python и мост mediavocab для сервера Music Assistant — общий транспортный и конверсионный слой в основе интеграции OVOS с Music Assistant.

  • Music Assistant
  • media metadata
  • API client
ILENIA

pyAhoTTS-Iparrahotsa

Порт на Python AhoTTS Iparrahotsa — движка синтеза речи для северного (континентального) баскского — аналог pyAhoTTS для диалекта Ипарральде, с hts_engine и вокодером AhoCoder. Разработан совместно с Aholab (UPV/EHU).

  • AhoTTS
  • Basque
  • ILENIA
  • TTS library
Фонетика и G2P

pycotovia

Порт на чистом Python фронтенда G2P Cotovia для галисийского и испанского языков. Воспроизводит слогоделение, ударение и транскрипцию скомпилированного C-бинарника без подпроцессов.

  • G2P
  • Galician
  • Spanish
  • phonemization
Данные и скрейпинг

pyerowid

Типизированный клиент Python и выгрузчик датасета в markdown для Erowid (erowid.org).

  • Erowid
  • Harm reduction
  • API client
  • Dataset
Инструменты разработчика

pyeye

Порт на чистом Python движка рассуждений EYE N3 — подайте ему факты и правила Notation3, и он выводит новые факты через прямой/обратный вывод, вывод RDFS и OWL 2 RL, деревья доказательств и более 280 встроенных функций. Одна зависимость (rdflib).

  • N3
  • reasoner
  • RDF
  • forward chaining
Инструменты разработчика

pyhermit

Порт на чистом Python HermiT — DL-ризонера OWL 2 из Оксфорда — непротиворечивость, классификация и извлечение экземпляров через табло гиперрезолюции, без JVM и без зависимостей во время выполнения.

  • OWL 2
  • reasoner
  • symbolic
  • logic
Медиа и музыка

pyimdb

Клиент метаданных Python для IMDb. Сопоставляет свободные текстовые запросы с каноническими названиями IMDb.

  • IMDb
  • Movies
  • Metadata
  • API client
Данные и скрейпинг

pyinfopedia

Типизированный клиент Python для Infopédia — европейско-португальского словаря Porto Editora — разбирает каждую статью на произношения IPA, слогоделение, этимологию и значения, корректно разделяя гетерофонные омографы для работы с G2P и разрешением неоднозначности.

  • Portuguese
  • dictionary
  • IPA
  • lexicon
Данные и скрейпинг

pyliveatc

Клиент Python для LiveATC.net — находите, транслируйте и архивируйте живые и исторические аудиопотоки управления воздушным движением, с экспортом датасета для обучения ASR.

  • API client
  • ATC
  • audio
  • scraper
Данные и скрейпинг

pypsychonaut

Типизированный клиент Python и выгрузчик датасета в markdown для PsychonautWiki (psychonautwiki.org).

  • PsychonautWiki
  • Harm reduction
  • API client
  • Dataset
Данные и скрейпинг

pyromhacking

Скрапер Python для romhacking.net (RHDN) — общественной базы данных ROM-хаков, фанатских переводов, утилит для патчинга и документации.

  • scraper
  • games
  • fan translation
Медиа и музыка

pyshazam

Модульный асинхронный клиент Python для API Shazam, построенный поверх shazamio_core для надёжного аудиоотпечатка.

  • Shazam
  • Audio fingerprinting
  • Music recognition
  • API client
Данные и скрейпинг

pysmwcentral

Клиент Python для публичного JSON API smwcentral.net — постраничный доступ к каталогу ROM-хакинга Super Mario World / SM64 / Yoshi's Island.

  • API client
  • games
  • scraper
Данные и скрейпинг

pytripsit

Клиент справочников о веществах TripSit и матрицы взаимодействий (снижение вреда).

  • TripSit
  • Harm reduction
  • Drug interactions
  • API client
ILENIA

raspovos-audio-setup

Библиотека автонастройки звука для raspOVOS — находит звуковые карты, HAT и USB-устройства на Raspberry Pi и настраивает их для голосового ассистента; разработана в рамках проекта ILENIA.

  • Raspberry Pi
  • audio
  • raspOVOS
Данные и скрейпинг

remailers

Клиент анонимного ремейлера электронной почты с поддержкой протоколов Cypherpunk и Mixmaster.

  • anonymity
  • email
  • privacy
  • remailers
Фонетика и G2P

scriptconv

Ядро для письменностей и фонемных нотаций без зависимостей — определение ISO-15924, IPA ↔ ARPABET/X-SAMPA/Kirshenbaum/Cotovía, Бакуолтер ↔ арабский, хангыль → чамо, кана.

  • IPA
  • transliteration
  • phoneme notation
  • zero dependencies
Умный дом

shazam2mqtt

Докеризированный мост, который распознаёт аудио в помещении через Shazam и публикует метаданные трека (название, исполнитель, обложка, тексты, ссылки Apple Music / Spotify / Deezer) в MQTT с автообнаружением Home Assistant.

  • Shazam
  • MQTT
  • Home Assistant
  • music recognition
Данные и скрейпинг

sitemapper

Утилита разведки сайтов для изучения структуры сайта перед созданием скраперов. Строит карту robots.txt, карт сайта и графов ссылок, используя транспорт unblock_requests для устойчивого исследования защищённых или сложных сайтов.

  • web scraping
  • site mapping
  • robots.txt
  • sitemap
Распознавание речи

speakeronnx

Библиотека эмбеддингов диктора на чистом onnxruntime — извлечение эмбеддингов диктора, вычисление косинусного сходства и верификация личности диктора из моделей ONNX, без PyTorch во время выполнения.

  • ONNX
  • speaker embeddings
  • speaker verification
Синтез речи, Распознавание речи

speechonnxmetrics

Единый набор метрик оценки речи — нейросетевой MOS (UTMOS, NISQA, SIGMOS, DNSMOS), интрузивные (STOI, SI-SDR, MCD) и ASR (WER/CER) — только на numpy и onnxruntime.

  • ONNX
  • evaluation
  • MOS
  • WER
Инструменты разработчика

sshfs-keeper

Демон, который отслеживает монтирования SSHFS/rclone и автоматически перемонтирует их при отключении — с живой веб-панелью, REST API, метриками Prometheus, вебхуками и запланированными задачами синхронизации rsync/rclone.

  • SSHFS
  • homelab
  • monitoring
  • self-hosted
Фонетика и G2P

stressonnx

Многоязычная расстановка словесного ударения для TTS-фронтендов, работающая только на onnxruntime и numpy.

  • ONNX
  • TTS frontend
  • word stress
Данные и скрейпинг

temporalis

Унифицированная библиотека абстракции погоды из нескольких провайдеров для Python. Запрашивайте OpenWeatherMap, Open-Meteo, MetNo, IPMA, NWS и другие через один согласованный API.

  • Weather
  • Multi-provider
  • API client
  • Open-Meteo
Фонетика и G2P

text2tashkeel

Лёгкая огласовка арабского (ташкиль) — единый компактный API поверх взаимозаменяемых моделей ONNX, восстанавливающих недостающие огласовки, без PyTorch и офлайн по умолчанию. Обеспечивает этап огласовки arbtok.

  • Arabic
  • diacritization
  • tashkeel
  • ONNX
NLP и язык

tugalex

Обработчик лексикона и лингвистическая утилита для португальских диалектов.

  • NLP
  • Portuguese
  • lexicon
NLP и язык

tugamorph

Морфологический анализатор на правилах для португальского языка — разбивает слова на морфемы.

  • NLP
  • Portuguese
  • morphology
Фонетика и G2P

TugaPhone

Инструменты преобразования графем в фонемы для португальского языка.

  • Portuguese phonemes
  • dataset
  • phonetics
  • Portuguese
Медиа и музыка

tutubo

Лёгкий скрапер YouTube, выдающий типизированные релизы медиа-метаданных.

  • YouTube
  • scraper
  • video
Данные и скрейпингРекомендуемое

unblock_requests

Подкласс requests.Session, обходящий Cloudflare (имитация curl_cffi, FlareSolverr, откат на Wayback) — транспорт против ботозащиты, лежащий в основе наших скраперов.

  • HTTP
  • anti-bot
  • scraping
Данные и скрейпинг

usenet

Живой читатель USENET и скрапер статей для исследования альтернативных протоколов и архивирования.

  • USENET
  • privacy
  • protocols
  • scraping
Умный дом

vad2mqtt

Мост распознавания голосовой активности в реальном времени на базе ovos-plugin-manager. Публикует вероятность речи (0–100 %), уровень шума (дБ) и сглаженный бинарный сенсор обнаружения речи в MQTT — с автообнаружением Home Assistant.

  • VAD
  • MQTT
  • Home Assistant
  • OpenVoiceOS
Распознавание речи

vadonnx

Распознавание голосовой активности по-ONNX-овски — загрузите любую модель VAD за единым потоковым API с крошечной средой выполнения (numpy + onnxruntime). Аналог phoonnx для VAD; большинство бэкендов — это данные, а не код.

  • ONNX
  • VAD
  • audio
  • streaming
Синтез речи

voiceclonnx

Многодвижковое преобразование голоса на чистом ONNX — переозвучивает любую речь голосом эталонного диктора без PyTorch при инференсе. 14 движков (kNN-VC, FreeVC, OpenVoice, RVC, CosyVoice…) за единым API VoiceCloner, плюс CLI и сборки INT8.

  • ONNX
  • voice conversion
  • zero-shot
  • multilingual
Слова активации

wakeforge

Тренер моделей ключевых слов, разработанный по гранту NLnet для OpenVoiceOS — создавайте собственные ключевые слова, работающие на устройстве, из ваших образцов.

  • NLnet
  • on-device
  • training
  • wake word
Слова активации

ww_tagger

Веб-приложение Flask для ручной разметки аудио ключевых слов — воспроизводите каждый фрагмент и размечайте слово, пол диктора и тип шума, накапливая корпус, готовый к обучению или оценке.

  • labeling
  • dataset
  • Flask
Медиа и музыка

xazam

Модульный асинхронный клиент Python для API Shazam — аудиоотпечаток через shazamio-core с типизированными моделями Track/Artist и скрапером каталога.

  • Shazam
  • async
  • audio fingerprinting
Инструменты разработчика

z85base91

Компактная библиотека кодирования двоичных данных в текст (Base91, Z85B, Z85P) — быстрые реализации на C с запасными вариантами на чистом Python, все компактнее base64.

  • encoding
  • serialization