Тексты
Из мастерской
Заметки о голосовом ИИ, разработке OpenVoiceOS, синтетических данных и речевых технологиях для языков меньшинств.
- 6 мин чтения
Экспорт и квантизация открытых речевых моделей, чтобы они реально работали
Обученная речевая модель на исследовательской странице GitHub — это ещё не голосовой ассистент. Мы конвертируем открытые чекпоинты ASR и TTS в ONNX, CoreML и GGUF, квантизируем их и проверяем результат — а затем публикуем результаты под OpenVoiceOS, чтобы каждый покрытый ими язык оказывался в реальном офлайн-ассистенте.
- ONNX
- CoreML
- GGUF
- ASR
- 16 мин чтения
Портирование с помощью машин и вопрос о лицензии, на который мы не смогли ответить
Мы переписали несколько программ на C, C++ и Java — G2P espeak-ng, Cotovia, AhoTTS, HermiT — на чистом Python, при этом ИИ читал исходный код, а человек руководил процессом. Никто с нашей стороны не читал оригиналы. Это поднимает два отдельных вопроса: можно ли вообще владеть результатом, и является ли он производным от входных данных. Мы сохранили лицензии оригинала, потому что это было дешевле, чем отвечать на вопрос. Мы всё ещё считаем этот вопрос открытым.
- FOSS
- Licensing
- Open Source
- Python
- 8 мин чтения
Семейство речевых библиотек на чистом ONNX
TigreGótico поддерживает набор речевых библиотек — расширение полосы пропускания, клонирование голоса, эмбеддинги дикторов, VAD, словесное ударение, фонемизация, TTS и библиотека метрик, чтобы оценивать их все — которые придерживаются одного правила времени выполнения: только onnxruntime и numpy, без PyTorch, без необходимости в GPU.
- ONNX
- TTS
- voice cloning
- VAD
- 10 мин чтения
Как устроен фонологический стек
Обзор архитектуры нашего стека текст-в-произношение: scriptconv для нотации, orthography2ipa как межъязыковой движок графема-в-IPA, языкоспецифичные фронтенды поверх него для португальского, баскского, мирандского, барранкеньу и арабского, и phonematcher для поиска по звучанию. Показывает, зачем существуют эти слои, что такое решётка кандидатов, и реальный диалектный вывод.
- G2P
- IPA
- Phonetics
- NLP
- 9 мин чтения
Выбор движка клонирования голоса
voiceclonnx запускает 10 движков голосового преобразования за одним API, от kNN-замены признаков до AR codec-LM. Это руководство по семействам моделей за ними, реальному измеренному компромиссу между разборчивостью и сходством дикторов, и о том, как выбрать движок под конкретную задачу.
- ONNX
- voice cloning
- voice conversion
- self-hosted
- 9 мин чтения
Приведение в порядок плохого аудио: шумоподавление и расширение полосы пропускания в audiosronnx
Глубокое погружение в две отдельные задачи audiosronnx — удаление шума и восстановление недостающих высоких частот — с реальным реестром движков, размерами моделей и лицензиями, списком отклонённых моделей и тем, как проверить, действительно ли результат стал лучше.
- ONNX
- denoising
- bandwidth extension
- speech
- 8 мин чтения
Измерение качества речи без панели слушателей
Рабочее руководство по speechonnxmetrics: что на самом деле измеряют MOS, безреференсные предикторы MOS, интрузивные сигнальные метрики и WER/CER на основе ASR, когда каждая применима, реальные оценки на реальном аудио, и почему предсказанный MOS — это свидетельство, а не истина.
- speechonnxmetrics
- TTS
- ONNX
- evaluation
- 7 мин чтения
Системы письма и фонетические нотации: что на самом деле конвертирует scriptconv
Глубокое погружение в scriptconv — библиотеку без зависимостей, которая определяет системы письма и конвертирует между фонетическими нотациями. Охватывает IPA, ARPABET и X-SAMPA; определение письменности по ISO-15924; транслитерацию Buckwalter для арабского; разложение хангыля на джамо; и конвертацию каны, с реальными, выполненными примерами и честными ограничениями.
- IPA
- Phonetics
- NLP
- Linguistics
- 10 мин чтения
Ваша модель тональности не отличит жалобу от прощания
Два гневных сообщения в поддержку. Один клиент собирается эскалировать, другой — уйти молча. Почти ни одна модель эмоций не может их различить — потому что у всех одна и та же недостающая ось. Знакомьтесь: emotion-algebra.
- Affective Computing
- Emotion
- Machine Learning
- LILACS
- 4 мин чтения
Почему мы копим данные: от скрейпленных каталогов к более умным моделям речи и языка
Чистые, типизированные, с хорошим провенансом данные — сырьё каждой модели, которую мы поставляем. Как каталоги, которые строят наши скрейперы, становятся словарями смещения для ASR, классификаторами интентов, синтетическими корпусами NER, лексиконами G2P, голосами TTS — и честным топливом для LLM.
- Datasets
- Data Collection
- ASR
- NLP
- 5 мин чтения
Если каждый выпускает приложение — мы выпустим голос: превращаем сайты в голосовые приложения
Каждый важный сайт обернули в мобильное приложение. Мы предлагаем обратный ход для эры голоса и CLI: чистый API плюс голосовой навык на каждый сайт, чтобы веб стал просматриваемым на слух и с клавиатуры. По одному сайту за раз это складывается в голосовой браузер.
- Voice
- Accessibility
- OpenVoiceOS
- Web Automation
- 2 мин чтения
Usenet в 2026: чистый до-ИИ текстовый корпус для обучения и оценки
Usenet — это первозданный архив до-ИИ человеческого дискурса: десятилетия постов из новостных групп, все написанные людьми, ничего не тронутого языковыми моделями. Это делает его ценными обучающими и оценочными данными для языковых и речевых моделей. Мы построили небольшой Python-инструмент для его сбора.
- Usenet
- Datasets
- NLP
- 3 мин чтения
Два голоса, все языки: Miro и Dii
TigreGótico объединяется с OpenVoiceOS, чтобы дать ассистенту две согласованные голосовые идентичности — Miro и Dii — которые звучат одинаково на каждом языке, построенные с помощью нашей технологии клонирования голоса и движка phoonnx. Две модели TTS для каждого языка, о котором кто-то попросит, включая языки под угрозой исчезновения.
- phoonnx
- TTS
- OVOS
- voice cloning
- 4 мин чтения
Произнести правильно: разрешение португальских гетерофонов для TTS
Многие слова европейского португальского пишутся одинаково, но произносятся по-разному в зависимости от значения — и ошибка в гласной заставляет голос TTS сказать не то слово. Мы построили bifonia-pt-homographs — открытый датасет с разметкой значений из 56 891 предложения по 27 словам — и крошечный резолвер без зависимостей, достигающий ≈94% там, где тяжеловесные POS-теггеры застревают на ≈75%.
- Datasets
- Portuguese
- TTS
- Grapheme-to-Phoneme
- 4 мин чтения
Модели TTS, которые работают на картошке
phoonnx — это исследовательский фреймворк для синтеза речи на основе VITS, созданный, чтобы комфортно работать на слабом оборудовании. Без GPU, без облака, без ключа API — только ONNX-голос на ~15,65 миллиона параметров и CPU. Вот насколько маленьким может быть хороший голос и как мы их обучаем.
- phoonnx
- TTS
- ONNX
- VITS
- 5 мин чтения
Представляем наши скрейперы музыкальных баз данных
Обзор семейства типизированных Python-клиентов, которые мы сопровождаем для музыкальных источников — Bandcamp, SoundCloud, SomaFM, TuneIn, iHeartRadio и великих музыкальных энциклопедий — все они выдают согласованные типизированные метаданные медиа за одним чистым интерфейсом и работают на одном и том же совместимом, низкообъёмном HTTP-транспорте.
- Scrapers
- Media Metadata
- Music
- Python
- 2 мин чтения
Многоязычный датасет типов предложений: вопросы, команды, утверждения
Мы опубликовали sentence-types-multilingual — почти 70 000 предложений на семи языках, классифицированных по грамматическому типу (вопрос, команда, утверждение, восклицание). Это обучающий корпус, стоящий за библиотекой маршрутизации little_questions.
- Datasets
- Multilingual
- NLP
- Intent
- 6 мин чтения
Компонуемые, готовые к работе сессии requests для устойчивого доступа к публичным данным
Два компонуемых подкласса requests.Session для надёжного чтения публичных веб-страниц без безголового браузера на критическом пути: TLS-совместимый транспорт, прокси FlareSolverr для JS-испытаний, откат к Wayback Machine и запросы с диверсификацией IP — unblock_requests и anon_requests.
- HTTP
- Scraping
- Cloudflare
- Anti-Bot
- 3 мин чтения
Robots.txt, карты сайта и этичный веб-скрапинг
Прежде чем строить скрапер, проведите разведку сайта. sitemapper читает robots.txt, получает все карты сайта и опционально обходит граф ссылок — чтобы ваш скрапер отталкивался от собственного контракта сайта, а не от грубой силы.
- Web Scraping
- Sitemaps
- Ethics
- Robots.txt
- 5 мин чтения
Классический NLP для португальского: слогоделение и графема-фонема
Обзор нашего стека NLP для португальского языка, основанного на правилах и полностью работающего офлайн — silabificador для слогоделения и TugaPhone для преобразования графемы в фонему с учётом диалекта — и того, как они связаны с более широкой работой orthography2ipa для лузофонных вариантов. Никаких чёрных ящиков глубокого обучения: детерминированно, быстро и с минимумом зависимостей.
- NLP
- Portuguese
- Phonemization
- Grapheme-to-Phoneme
- 8 мин чтения
Графема-в-IPA для 820 языков
orthography2ipa — это ресурс на чистых данных, лингвистически обоснованный, который отображает написание в IPA и моделирует то, как фонемы проявляются в виде аллофонов, охватывая 909 языковых спецификаций, 820 языков и более 20 языковых семей. Решётка кандидатов, диалектная родословная и набор спецификаций с валидацией по схеме, цитируемый по диалектологической литературе, — без обученных весов, полностью пригодный для самостоятельного размещения.
- G2P
- IPA
- Phonetics
- NLP
- 2 мин чтения
Представляем первый фонемизатор для барранкеньу
g2p_barranquenho — первый открытый конвертер графемы в фонему для барранкеньу, иберо-романского контактного языка Барранкуша, Португалия, — правила выведены из недавно опубликованной муниципалитетом орфографической конвенции и поддаются проверке по включённым в репозиторий источникам.
- Phonemization
- Barranquenho
- Minority Languages
- NLP
- 3 мин чтения
Клонирование голосов для языков под угрозой исчезновения: создание модели синтеза речи для астурийского и арагонского
Мы выпускаем экспериментальные модели синтеза речи для астурийского (ast) и арагонского (an) — двух миноритарных романских языков, практически не имеющих коммерческого голосового покрытия, — построенные по гибридному конвейеру: отфильтрованные данные Common Voice, zero-shot переозвучивание и обучение VITS через phoonnx.
- TTS
- Asturian
- Aragonese
- Minority Languages
- 3 мин чтения
OVOS и HiveMind в обрабатывающей промышленности
Проекты ЕС COALA и WASABI построили целый промышленный фреймворк голосового ассистента вокруг OVOS + HiveMind, интегрировав их со своими собственными инструментами, интерфейсом и движками диалога.
- OVOS
- HiveMind
- Industry
- manufacturing
- 1 мин чтения
Синтетические датасеты слов активации: семь имён ассистентов, один детектор
Мы опубликовали семь синтетических датасетов слов активации для распространённых имён голосовых ассистентов — hey_computer, hey_mycroft, hey_siri, alexa, home_assistant, voice_assistant, wake_up. Обучите детектор, который работает везде.
- Datasets
- Wakewords
- Speech
- Synthetic
- 3 мин чтения
Представляем phoonnx: новый фреймворк TTS для OpenVoiceOS
phoonnx теперь основной фреймворк синтеза речи для OpenVoiceOS — полный стек обучения и вывода на VITS/ONNX — начиная с новых баскских голосов для Miro и Dii.
- phoonnx
- TTS
- OVOS
- ONNX
- 4 мин чтения
OpenVoiceOS и Home Assistant: идеальная команда голосовой автоматизации
Home Assistant отвечает за автоматизацию; OVOS отвечает за голос. Три слоя интеграции заставляют эту связку работать: мосты Wyoming для голосового конвейера HA, ovos-persona-server в роли разговорного агента и HiveMind для отображения устройств OVOS как нативных сущностей HA.
- OVOS
- Home Assistant
- Smart Home
- Voice Automation
- 1 мин чтения
Создание синтетических голосов с нуля
Создание голоса для системы синтеза речи обычно требует, чтобы реальный человек часами записывал аудио. Это дорого, отнимает много времени, а для многих языков или акцентов такие голоса просто не существуют вовсе
- TTS
- Synthetic Data
- Voice Cloning
- OVOS
- 2 мин чтения
Обучающие данные TTS для Miro и Dii: 40 открытых датасетов на 20 языковых вариантах
Мы опубликовали 40 синтетических обучающих датасетов для голосов Miro и Dii на португальском, нидерландском, немецком, французском, итальянском, японском, испанском и других языках. Клонирование голоса в масштабе: каждый язык получает две согласованные идентичности.
- TTS
- Voice
- Datasets
- Miro & Dii
- 2 мин чтения
Ни одного языка без внимания
Устранение языковых барьеров в OpenVoiceOS с помощью определения языка, плагинов перевода и возможностей двунаправленного перевода.
- OVOS
- multilingual
- language-detection
- translation