음성 AI가 요즘 워낙 뜨거워서 투자자들이 듣고, 말대꾸하고, 회의록까지 받아쓰는 것이라면 뭐든지 수십억 달러를 던지고 있다. 이 골드러시에 뛰어든 트레블(Treble)은 2020년 음향 엔지니어 핀누르 핀드(Finnur Pind)와 예스페르 페데르센(Jesper Pedersen)이 설립한 아이슬란드 기반 스타트업으로, 최근 시리즈 A 확장 라운드에서 1,800만 달러를 유치했다. 이번 라운드는 팔라딘 캐피털 그룹(Paladin Capital Group)이 주도했고, 기존 투자자인 KOMPAS VC, 프룸타크 벤처스(Frumtak Ventures), EIC, 오메가 ehf.(Omega ehf.)도 참여했다. 이는 2024년 1,200만 달러 유치에 이은 것으로, 트레블의 총 투자 유치액은 4,000만 달러를 넘어섰다. 이 회사는 아마존과 로지텍을 고객으로 두고 있는데, 아마 거대 기업들조차 자신들의 가젯이 어떻게 들리는지 알려줄 누군가가 필요하기 때문일 것이다.

트레블의 핵심 제안은 본질적으로 이렇다: 이 모든 새로운 음성 AI 모델과 기기들은 테스트가 필요하고, 테스트에는 데이터가 필요하다. 아주 많이. 다른 사람들처럼 인터넷에서 녹음 파일을 긁어모으는 대신, 트레블은 음성 향상, 소음 억제, 모델 훈련을 위한 합성 오디오 데이터를 생성한다. 또한 다양한 조건에서 음성 AI 모델을 평가하고 그 결과를 연구소에 피드백한다. 올해 초에는 허깅페이스(Hugging Face)와 협력하여 현실적인 조건에서 음성 인식 모델을 위한 벤치마크를 출시했다. 기계를 채점할 사람이 있어야 하니까.

핀드는 테크크런치(TechCrunch)에 "오디오 AI는 정말로 데이터 문제이며, 여기에 차세대 모델과 하드웨어를 가능하게 할 가장 큰 기회가 있다"고 말했다. "지금까지 거의 모든 소리 관련 AI는 인터넷에서 긁어모은 녹음과 데이터로 만들어졌다. 우리는 정확한 물리 시뮬레이션이 소리 데이터를 만드는 대안이 될 수 있다고 믿는다." 다시 말해, 지저분한 현실 세계에 의존할 필요 없이 시뮬레이션할 수 있다면 왜 그러지 않겠는가?

소프트웨어 외에도 트레블은 음성 관점에서 하드웨어 설계와 테스트를 수행한다. 헤드폰과 스피커 회사가 제품의 소리를 가상으로 프로토타이핑하도록 돕고, 스마트 스피커가 놓인 위치에 따라 명령을 이해할 수 있는지 테스트하며, 최근에는 스마트 안경과 AI 기기를 위한 시뮬레이션 테스트로 영역을 확장했다. 핀드는 사용자에게 "초인적인 청력"을 줄 수 있는 웨어러블에 특히 열광한다. "식당에 있을 때 2미터 이내의 사람들만 듣고 싶거나, 세미나에서 주변 사람들을 음소거하고 싶을 수 있다"고 그는 말했다. 주변 사람들을 선택적으로 무시하는 것만큼 진보를 잘 보여주는 것은 없으니까.

이 회사는 또한 물리적 AI, 즉 로봇공학, 자동차, 드론 회사들을 겨냥하여 테스트와 시뮬레이션을 통해 소리 기반 기능을 구현하려 한다. 팔라딘 캐피털 그룹의 부사장 프랑수아 루에터(Francois Ruether)는 트레블의 플랫폼이 다양한 모델과 기기를 시뮬레이션한다는 점에서 두드러지며 그 중요성은 더욱 커질 것이라고 말했다. "우리의 투자 가설은 더 많은 제품이 소리 이해에 의존하게 되면서 이 인프라가 음성 AI, 웨어러블, 로봇공학, 물리적 AI 전반에 걸쳐 점점 더 가치 있게 된다는 것이다"라고 루에터는 말했다. "고객은 모델, 제품, 개발 워크플로우의 소유권을 유지하면서 시뮬레이션 네이티브 음향 인프라 계층이라는 공유 기반의 혜택을 누린다." 이는 모든 사람이 자신의 물건을 계속 소유하지만, 작동하게 하려면 트레블의 시뮬레이션된 소리가 필요하다는 것을 고급스럽게 표현한 것이다.