Sprach-KI ist offenbar gerade so angesagt, dass Investoren mit Milliarden um sich werfen, sobald irgendetwas zuhören, antworten oder Meeting-Notizen machen kann. In diesen Goldrausch stürmt Treble, ein isländisches Startup, das 2020 von den Akustikingenieuren Finnur Pind und Jesper Pedersen gegründet wurde und gerade 18 Millionen Dollar in einer Erweiterung seiner Series A eingesammelt hat. Die Runde wurde von der Paladin Capital Group angeführt, mit Beteiligung der bestehenden Investoren KOMPAS VC, Frumtak Ventures, EIC und Omega ehf. Das folgt auf eine 12-Millionen-Dollar-Runde im Jahr 2024, womit Trebles Gesamtvolumen auf über 40 Millionen Dollar steigt. Zu den Kunden zählen Amazon und Logitech – vermutlich, weil selbst riesige Konzerne jemanden brauchen, der ihnen sagt, wie ihre Geräte klingen.

Trebles Pitch ist im Wesentlichen: All diese neuen Sprach-KI-Modelle und -Geräte müssen getestet werden, und Tests brauchen Daten. Viele davon. Statt wie alle anderen Aufnahmen aus dem Internet zu scrapen, erzeugt Treble synthetische Audiodaten für Sprachverbesserung, Rauschunterdrückung und Modelltraining. Es bewertet auch Sprach-KI-Modelle unter verschiedenen Bedingungen und speist das zurück an die Labore. Anfang des Jahres ging es eine Partnerschaft mit Hugging Face ein, um einen Benchmark für Spracherkennungsmodelle unter realistischen Bedingungen zu starten – weil irgendjemand die Maschinen benoten muss.

„Audio-KI ist wirklich eine Datenherausforderung, und hier liegen die größten Chancen, Modelle und Hardware der nächsten Generation zu ermöglichen“, sagte Pind gegenüber TechCrunch. „Bisher wurde so ziemlich jede klangbezogene KI aus Aufnahmen und Daten erstellt, die aus dem Internet gescrapt wurden. Wir glauben, dass akkurate Physiksimulation ein alternativer Weg sein kann, Daten für Klang zu erzeugen.“ Mit anderen Worten: Warum sich auf die chaotische reale Welt verlassen, wenn man sie simulieren kann?

Über Software hinaus übernimmt Treble Hardware-Design und -Tests aus einer Sprachperspektive. Es hilft Kopfhörer- und Lautsprecherherstellern, virtuell zu prototypen, wie ihre Produkte klingen könnten, testet, ob ein Smart Speaker Befehle versteht, je nachdem, wo er steht, und hat sich zuletzt auf Simulationstests für Smart Glasses und KI-Geräte verlagert. Pind ist besonders begeistert von Wearables, die Nutzern „übermenschliches Gehör“ verleihen könnten. „Vielleicht sind Sie in einem Restaurant und möchten nur Leute in einem Umkreis von zwei Metern hören, oder Sie sind in einem Seminar und möchten die Menschen um sich herum stummschalten“, sagte er. Denn nichts sagt Fortschritt wie das selektive Ignorieren der Menschen um einen herum.

Das Unternehmen hat auch physische KI ins Visier genommen – Robotik-, Automobil- und Drohnenfirmen –, um klangbasierte Funktionen durch Tests und Simulation zu ermöglichen. Francois Ruether, VP der Paladin Capital Group, sagte, Trebles Plattform hebe sich ab, weil sie verschiedene Modelle und Geräte simuliere, und ihre Bedeutung werde nur wachsen. „Unsere These ist, dass diese Infrastruktur, je mehr Produkte auf Klangverständnis angewiesen sind, über Sprach-KI, Wearables, Robotik und physische KI hinweg immer wertvoller wird“, sagte Ruether. „Kunden behalten das Eigentum an ihren Modellen, Produkten und Entwicklungs-Workflows, profitieren aber von einer gemeinsamen Grundlage einer simulationsnativen akustischen Infrastrukturschicht.“ Was eine schicke Art zu sagen ist: Jeder behält sein Zeug, aber alle brauchen Trebles simulierten Klang, damit es funktioniert.