Somos especialistas en voz, IA y datos de código abierto. Como creadores de la stack HiveMind y contribuidores centrales de OpenVoiceOS, construimos tecnología de voz privada y conforme con el RGPD, que mantiene sus datos en su propio hardware — y nos sentimos igualmente cómodos transformando datos públicos de difícil acceso en APIs limpias y conjuntos de datos curados.
Cómo Trabajamos
El contrato habitual es una iguala mensual que garantiza acceso continuo al equipo y soporte, con entregables concretos — datasets, modelos entrenados, plugins a medida, integraciones — presupuestados por separado a medida que se definen. Esto mantiene la relación previsible para ambas partes: usted tiene acceso directo al equipo y cada resultado concreto tiene su propio alcance y precio.
También aceptamos proyectos puntuales cuando el alcance está bien definido desde el principio.
Damos Voz a Cualquier Cosa
Creamos interfaces de voz para cualquier cosa. Sea lo que sea aquello con lo que quiera hablar — un dispositivo, una aplicación, un servicio o toda una línea de productos — construimos la capa de voz, reutilizando la experiencia y la stack probada que hemos desarrollado en torno al Open Voice Operating System y a HiveMind. Palabras de activación personalizadas, conexión de síntesis de voz (TTS) y reconocimiento de voz (ASR), gestión de intenciones y componentes a medida — ensamblados sobre una base de código abierto probada en producción, y funcionando en su propio hardware.
Entrenamiento de Voces TTS Offline a Medida
¿Quiere una voz única para su proyecto? Entrenamos voces de síntesis de voz totalmente offline y de alta calidad. Traiga un conjunto de datos en una lengua específica, o clone una voz de referencia — el resultado es un modelo TTS rápido y privado, que funciona localmente en su dispositivo y encaja directamente en OpenVoiceOS o Home Assistant. El control de los datos es siempre suyo.
¿Con curiosidad por saber cómo suenan nuestras voces? Pruebe la Demo de Voces — nuestras voces Miro y Dii se sintetizan en vivo en su navegador, en más de 20 lenguas.
Reconocimiento de Voz Ajustado a Su Lengua y Dominio
Ajustamos modelos de reconocimiento de voz de última generación — Zipformer, Parakeet, Whisper y otros — para su lengua, acento y vocabulario de dominio específicos, de modo que el reconocimiento aguante en las palabras y condiciones que de verdad le importan. Cuando los datos de entrenamiento aún no existen, los encontramos — y los sintetizamos cuando es apropiado — con nuestra cadena de construcción de datasets. Este trabajo se apoya en nuestra colaboración con Alpha Cephei, que aporta décadas de experiencia en reconocimiento automático de voz a su proyecto.
Tecnología de Voz para Lenguas Minoritarias y Lusófonas
Construimos tecnología de voz para lenguas que las herramientas convencionales ignoran — incluidas las variantes del portugués y otras lenguas lusófonas y minoritarias. De la fonemización al ASR y el TTS, ayudamos a las comunidades lingüísticas desatendidas a contar con soporte de voz moderno y respetuoso con la privacidad.
Extracción de Datos, APIs Limpias y Datasets
Hay una gran cantidad de datos valiosos que viven en la web pública pero que están, en la práctica, fuera de alcance — atrapados en páginas sin estructura, tras defensas anti-bot, expuestos solo a través de endpoints no documentados, o en formatos que ningún motor de búsqueda indexa. Nosotros los extraemos y los hacemos utilizables:
- Scrapers y parsers resilientes para fuentes que se resisten a la automatización, diseñados para seguir funcionando cuando las páginas y las defensas cambian.
- Ingeniería inversa de APIs — mapeamos endpoints no documentados o privados y los volvemos a exponer como bibliotecas cliente limpias, tipadas y documentadas.
- Una API limpia sobre fuentes caóticas — una única interfaz consistente en lugar de scraping hecho a medida para cada consumidor.
- Construcción de datasets — organizamos los datos extraídos en conjuntos estructurados, versionados y listos para ML, con una procedencia clara, y podemos publicar datasets abiertos cuando tiene sentido.
Es la misma cadena de herramientas que hay detrás de nuestras propias bibliotecas cliente y de los datasets que publicamos — y alimenta todo, desde el enriquecimiento de metadatos multimedia hasta los corpus de entrenamiento para modelos de voz y de lenguaje.
Sitios Web con Voz y Accesibles
La misma stack de voz que instalamos en dispositivos también funciona en el navegador. Con phoonnx.js, nuestras voces TTS se sintetizan del lado del cliente — sin API en la nube, sin coste por petición, sin que nada salga de la máquina del visitante. La Demo de Voces en este mismo sitio es la prueba: una página estática que habla.
Construimos sitios y aplicaciones web en torno a esa capacidad — páginas que se leen a sí mismas en voz alta, interfaces con la voz en primer lugar y páginas accesibles por diseño para quienes navegan de oído. El rendimiento, la accesibilidad y la privacidad son la base, no extras. También desarrollamos y mantenemos el sitio web oficial de OpenVoiceOS.