Wir sind Spezialisten für quelloffene Sprach-, KI- und Datentechnologie. Als Entwickler des HiveMind-Stacks und zentrale Beitragende zu OpenVoiceOS bauen wir datenschutzfreundliche, DSGVO-konforme Sprachtechnologie, die Ihre Daten auf Ihrer eigenen Hardware belässt — und wir fühlen uns ebenso zu Hause dabei, schwer erreichbare öffentliche Daten in saubere APIs und kuratierte Datensätze zu verwandeln.
Wie wir arbeiten
Der Standardauftrag ist ein monatliches Retainer für laufenden Zugang und Support, mit einzelnen Lieferergebnissen — Datensätze, trainierte Modelle, individuelle Plugins, Integrationen — die separat abgesteckt und abgerechnet werden, sobald sie definiert sind. So bleibt die Zusammenarbeit für beide Seiten planbar: Sie haben direkten Zugang zum Team, und jedes konkrete Ergebnis hat seinen eigenen Umfang und Preis.
Wir übernehmen auch eigenständige Projektarbeiten, deren Umfang von Anfang an klar definiert ist.
Wir machen alles sprachfähig
Wir schaffen Sprachschnittstellen für alles. Womit auch immer Sie sprechen möchten — einem Gerät, einer App, einem Dienst oder einer ganzen Produktlinie — wir bauen die Sprachebene dafür und nutzen dabei die Expertise und den in der Praxis bewährten Stack wieder, den wir rund um das Open Voice Operating System und HiveMind gebaut haben. Individuelle Aktivierungswörter, Verdrahtung von Sprachsynthese (TTS) und Spracherkennung (ASR), Intent-Verarbeitung und maßgeschneiderte Komponenten — zusammengesetzt aus einer bewährten Open-Source-Grundlage statt von Grund auf neu, und laufend auf Ihrer eigenen Hardware.
Training individueller Offline-TTS-Stimmen
Möchten Sie eine einzigartige Stimme für Ihr Projekt? Wir trainieren individuelle, hochwertige, vollständig offline arbeitende Text-to-Speech-Stimmen. Bringen Sie einen Datensatz für eine bestimmte Sprache mit oder klonen Sie eine Referenzstimme — das Ergebnis ist ein schnelles, privates TTS-Modell, das lokal auf Ihrem Gerät läuft und sich direkt in OpenVoiceOS oder Home Assistant einfügt. Die volle Kontrolle über Ihre Daten bleibt bei Ihnen.
Neugierig, wie unsere Stimmen klingen? Probieren Sie die Stimmen-Demo — unsere Stimmen Miro und Dii synthetisieren live in Ihrem Browser, in über 20 Sprachen.
Feinabgestimmte Spracherkennung für Ihre Sprache und Ihr Fachgebiet
Wir stimmen modernste Speech-to-Text-Modelle — Zipformer, Parakeet, Whisper und andere — auf Ihre spezifische Sprache, Ihren Akzent und Ihr Fachvokabular ab, so dass die Erkennung bei den Wörtern und Bedingungen zuverlässig bleibt, die für Sie tatsächlich zählen. Wenn die Trainingsdaten noch nicht existieren, finden wir sie — und synthetisieren sie, wo es angebracht ist — mit unserer Werkzeugkette zum Datensatzaufbau. Diese Arbeit wird durch unsere Partnerschaft mit Alpha Cephei gestützt, die jahrzehntelange Erfahrung in der automatischen Spracherkennung in Ihr Projekt einbringt.
Sprachtechnologie für Minderheiten- und lusophone Sprachen
Wir bauen Sprachtechnologie für Sprachen, die von gängigen Werkzeugen ignoriert werden — darunter Varianten des Portugiesischen sowie andere lusophone und Minderheitensprachen. Von der Phonemisierung über ASR bis TTS helfen wir unterversorgten Sprachgemeinschaften, moderne, die Privatsphäre achtende Sprachunterstützung zu erhalten.
Datenextraktion, saubere APIs und Datensätze
Sehr viele wertvolle Daten liegen im öffentlichen Web, sind aber praktisch unerreichbar — eingeschlossen in unstrukturierten Seiten, hinter Anti-Bot- Abwehrmechanismen, nur über undokumentierte Endpunkte zugänglich oder in Formaten, die keine Suchmaschine indexiert. Wir holen sie heraus und machen sie nutzbar:
- Widerstandsfähige Scraper und Parser für Quellen, die sich der Automatisierung widersetzen, so konstruiert, dass sie weiter funktionieren, wenn sich Seiten und Abwehrmechanismen ändern.
- API-Reverse-Engineering — wir kartieren undokumentierte oder private Endpunkte und stellen sie erneut als saubere, typisierte, dokumentierte Client-Bibliotheken bereit.
- Eine saubere API über chaotische Quellen — eine einzige konsistente Schnittstelle statt maßgeschneidertem Scraping für jeden Abnehmer.
- Datensatzaufbau — wir kuratieren die extrahierten Daten zu strukturierten, versionierten, ML-fertigen Datensätzen mit klarer Herkunft und können offene Datensätze veröffentlichen, wo es sinnvoll ist.
Es ist dieselbe Werkzeugkette, die hinter unseren eigenen Client-Bibliotheken und den von uns veröffentlichten Datensätzen steht — und sie speist alles, von der Anreicherung von Medien-Metadaten bis zu Trainingskorpora für Sprach- und Sprachmodelle.
Sprachfähige, barrierefreie Websites
Derselbe Sprach-Stack, den wir auf Geräten ausliefern, läuft auch im Browser. Mit phoonnx.js synthetisieren unsere TTS-Stimmen clientseitig — keine Cloud-API, keine Kosten pro Anfrage, nichts verlässt den Rechner des Besuchers. Die Stimmen-Demo auf genau dieser Website ist der Beweis: eine statische Seite, die spricht.
Wir bauen Websites und Webanwendungen rund um diese Fähigkeit — Seiten, die sich selbst vorlesen können, sprachorientierte Schnittstellen und von Grund auf barrierefreie Seiten für Nutzer, die per Gehör browsen. Leistung, Barrierefreiheit und Privatsphäre sind der Standard, keine Extras. Wir entwickeln und pflegen außerdem die offizielle OpenVoiceOS-Website.