AI głosowe jest najwyraźniej tak gorące, że inwestorzy rzucają miliardami dolarów na wszystko, co potrafi słuchać, odpowiadać albo robić notatki ze spotkań. W ten złoty interes wkracza Treble, islandzki startup założony w 2020 roku przez inżynierów akustyki Finnura Pinda i Jespera Pedersena, który właśnie zebrał 18 milionów dolarów w rozszerzeniu rundy Series A. Rundę poprowadziła Paladin Capital Group, a dołożyli się także dotychczasowi inwestorzy: KOMPAS VC, Frumtak Ventures, EIC i Omega ehf. To po zebraniu 12 milionów dolarów w 2024 roku, co daje Treble łącznie ponad 40 milionów. Firma ma wśród klientów Amazona i Logitech, przypuszczalnie dlatego, że nawet gigantyczne korporacje potrzebują kogoś, kto powie im, jak brzmią ich gadżety.
Argument Treble jest w istocie taki: wszystkie te nowe modele i urządzenia AI głosowego wymagają testowania, a testowanie wymaga danych. Mnóstwa. Zamiast wygrzebywać nagrania z internetu jak wszyscy inni, Treble generuje syntetyczne dane audio do poprawy mowy, redukcji szumów i trenowania modeli. Ocenia też modele AI głosowego w różnych warunkach i przekazuje wyniki laboratoriom. Na początku tego roku firma nawiązała współpracę z Hugging Face, by uruchomić benchmark dla modeli rozpoznawania mowy w realistycznych warunkach – bo ktoś musi oceniać maszyny.
„AI audio to tak naprawdę wyzwanie związane z danymi i tu kryje się najwięcej możliwości dla modeli i sprzętu nowej generacji” – powiedział Pind TechCrunchowi. „Do tej pory praktycznie całe AI związane z dźwiękiem powstawało z nagrań i danych wygrzebanych z internetu. Wierzymy, że dokładna symulacja fizyczna może być alternatywnym sposobem tworzenia danych dźwiękowych”. Innymi słowy: po co polegać na bałaganiarskim realnym świecie, skoro można go symulować?
Poza oprogramowaniem Treble zajmuje się projektowaniem i testowaniem sprzętu z perspektywy głosu. Pomaga firmom produkującym słuchawki i głośniki wirtualnie prototypować, jak ich produkty mogą brzmieć, testuje, czy inteligentny głośnik zrozumie polecenia w zależności od miejsca ustawienia, a ostatnio weszła w testy symulacyjne dla inteligentnych okularów i urządzeń AI. Pind szczególnie ekscytuje się wearables, które mogłyby dać użytkownikom „superludzki słuch”. „Może jesteś w restauracji i chcesz słyszeć tylko ludzi w promieniu dwóch metrów, albo jesteś na seminarium i chcesz wyciszyć ludzi wokół siebie” – powiedział. Bo nic tak nie mówi o postępie jak selektywne ignorowanie otaczających cię osób.
Firma celuje też w fizyczne AI – robotykę, motoryzację i drony – by umożliwić funkcje oparte na dźwięku poprzez testowanie i symulację. Francois Ruether, wiceprezes Paladin Capital Group, powiedział, że platforma Treble wyróżnia się tym, że symuluje różne modele i urządzenia, a jej znaczenie będzie tylko rosnąć. „Nasza teza jest taka, że im więcej produktów zależy od rozumienia dźwięku, tym ta infrastruktura staje się cenniejsza w AI głosowym, wearables, robotyce i fizycznym AI” – powiedział Ruether. „Klienci zachowują własność swoich modeli, produktów i workflowów, czerpiąc korzyści ze wspólnego fundamentu warstwy infrastruktury akustycznej natywnej dla symulacji”. Co jest wymyślnym sposobem powiedzenia: każdy zachowuje swoje rzeczy, ale wszyscy potrzebują symulowanego dźwięku Treble, żeby to działało.
The Good Times
Wiadomości w Twojej skrzynce.
Sardoniczne podsumowanie, dostarczane według Twojego harmonogramu. Bezpłatnie. Zrezygnuj kiedy chcesz.
Już subskrybujesz, ale nigdy do Ciebie nie docieramy? Zajrzyj do folderu spam i kliknij 'To nie spam' (lub 'Usuń ze spamu'), żeby wyciągnąć nas z czyśćca niechcianej poczty. Przy okazji pomożesz wszystkim innym.
Jeśli przez miesiąc nie otworzysz żadnego z naszych e-maili, zostaniesz automatycznie usunięty z listy.
Rewrite Article
Select parts to regenerate with a fresh AI pass. Translations will be updated automatically.
Generate AI Image
Creates a sardonic version of the article image using OpenAI.