Se pare că AI-ul vocal este atât de fierbinte în acest moment încât investitorii aruncă miliarde de dolari către orice poate asculta, răspunde sau lua notițe la ședințe. În această goană după aur își face loc Treble, un startup cu sediul în Islanda, fondat în 2020 de inginerii acustici Finnur Pind și Jesper Pedersen, care tocmai a ridicat 18 milioane de dolari într-o extindere a Seriei A. Runda a fost condusă de Paladin Capital Group, cu investitorii existenți KOMPAS VC, Frumtak Ventures, EIC și Omega ehf. contribuind și ei. Aceasta urmează unei runde de 12 milioane de dolari în 2024, aducând totalul Treble la peste 40 de milioane de dolari. Compania îi numără printre clienți pe Amazon și Logitech, probabil pentru că până și corporațiile gigantice au nevoie de cineva care să le spună cum sună gadgeturile lor.

Pitch-ul Treble este în esență: toate aceste noi modele și dispozitive de AI vocal au nevoie de testare, iar testarea are nevoie de date. Multe. În loc să extragă înregistrări de pe internet ca toată lumea, Treble generează date audio sintetice pentru îmbunătățirea vorbirii, suprimarea zgomotului și antrenarea modelelor. De asemenea, evaluează modelele de AI vocal în diferite condiții și transmite rezultatele către laboratoare. La începutul acestui an, a colaborat cu Hugging Face pentru a lansa un benchmark pentru modelele de recunoaștere vocală în condiții realiste - pentru că cineva trebuie să noteze mașinile.

"AI-ul audio este cu adevărat o provocare de date, și aici se află cele mai multe oportunități de a permite modele și hardware de generație următoare", a declarat Pind pentru TechCrunch. "Până în prezent, aproape tot AI-ul legat de sunet a fost creat din înregistrări și date extrase de pe internet. Credem că simularea fizică precisă poate fi o modalitate alternativă de a crea date pentru sunet." Cu alte cuvinte, de ce să te bazezi pe lumea reală dezordonată când o poți simula?

Dincolo de software, Treble face proiectare și testare hardware din perspectiva vocii. Ajută companiile producătoare de căști și difuzoare să prototipeze virtual cum ar putea suna produsele lor, testează dacă un difuzor inteligent poate înțelege comenzi în funcție de unde este plasat și, recent, s-a extins în testarea prin simulare pentru ochelari inteligenți și dispozitive AI. Pind este deosebit de entuziasmat de dispozitivele purtabile care ar putea oferi utilizatorilor "auz supraomenesc". "Poate ești într-un restaurant și vrei să auzi doar oamenii aflați la doi metri distanță, sau ești la un seminar și vrei să-i pui pe mut pe cei din jur", a spus el. Pentru că nimic nu spune progres ca ignorarea selectivă a oamenilor din jurul tău.

Compania își îndreaptă, de asemenea, atenția către AI-ul fizic - robotică, automotive și companii de drone - pentru a permite funcții bazate pe sunet prin testare și simulare. Francois Ruether, vicepreședinte al Paladin Capital Group, a declarat că platforma Treble se remarcă prin faptul că simulează diferite modele și dispozitive, iar importanța sa va crește. "Teza noastră este că, pe măsură ce tot mai multe produse depind de înțelegerea sunetului, această infrastructură devine din ce în ce mai valoroasă în AI vocal, dispozitive purtabile, robotică și AI fizic", a spus Ruether. "Clienții își păstrează proprietatea asupra modelelor, produselor și fluxurilor de lucru de dezvoltare, beneficiind în același timp de o fundație comună a unui strat de infrastructură acustică nativă de simulare." Ceea ce este un mod elegant de a spune: toată lumea își păstrează lucrurile, dar toți au nevoie de sunetul simulat al Treble pentru a funcționa.