音声AIはどうやら今めちゃくちゃ熱いらしく、投資家たちは聞くこと、話し返すこと、あるいは会議の議事録を取ることのできるものなら何にでも数十億ドルを投げ込んでいる。このゴールドラッシュに乗り込んだのが、音響エンジニアのFinnur PindとJesper Pedersenが2020年に創業したアイスランド拠点のスタートアップ、Trebleだ。同社はシリーズAのエクステンションでちょうど1800万ドルを調達した。ラウンドはPaladin Capital Groupがリードし、既存投資家のKOMPAS VC、Frumtak Ventures、EIC、Omega ehf.も参加した。これは2024年の1200万ドル調達に続くもので、Trebleの累計調達額は4000万ドルを超える。同社はAmazonとLogitechを顧客に持つ。おそらく、巨大企業でさえ自分たちのガジェットがどう聞こえるかを教えてくれる誰かが必要なのだろう。

Trebleの売り込みは要するにこうだ。これら新しい音声AIモデルやデバイスはすべてテストが必要で、テストにはデータが必要だ。大量の。他のみんなのようにインターネットから録音をスクレイピングするのではなく、Trebleは音声強調、ノイズ抑制、モデルトレーニング用の合成音声データを生成する。また、さまざまな条件下で音声AIモデルを評価し、その結果をラボにフィードバックする。今年初めにはHugging Faceと提携し、現実的な条件下での音声認識モデルのベンチマークを立ち上げた。誰かが機械を採点しなければならないからだ。

「オーディオAIは本当にデータの課題であり、次世代モデルとハードウェアを可能にする最大の機会がここにある」とPindはTechCrunchに語った。「これまで、音に関連するAIのほとんどすべては、インターネットからスクレイピングされた録音とデータから作られてきた。正確な物理シミュレーションが、音のデータを作成する代替手段になり得ると我々は信じている。」つまり、シミュレートできるなら、なぜ厄介な現実世界に頼るのか、ということだ。

ソフトウェアだけでなく、Trebleは音声の観点からハードウェアの設計とテストも行う。ヘッドフォンやスピーカーメーカーが製品の音を仮想的にプロトタイプ化するのを支援し、スマートスピーカーが置かれた場所に基づいてコマンドを理解できるかをテストし、最近ではスマートグラスやAIデバイスのシミュレーションテストにも進出している。Pindは特に、ユーザーに「超人的な聴覚」を与えるウェアラブルに興奮している。「例えばレストランにいて、2メートル以内の人だけを聞きたいとか、セミナーにいて、周りの人の音をミュートしたいとか」と彼は言う。周りの人を選択的に無視することほど進歩を象徴するものはないからね。

同社はまた、物理AI——ロボティクス、自動車、ドローン企業——に照準を定め、テストとシミュレーションを通じて音ベースの機能を可能にしようとしている。Paladin Capital GroupのVPであるFrancois Ruetherは、Trebleのプラットフォームが際立っているのは、異なるモデルやデバイスをシミュレートするからであり、その重要性はますます高まるだろうと述べた。「我々のテーゼは、より多くの製品が音の理解に依存するようになるにつれ、このインフラが音声AI、ウェアラブル、ロボティクス、物理AI全体でますます価値を持つようになるというものだ」とRuetherは言う。「顧客はモデル、製品、開発ワークフローの所有権を保持しつつ、シミュレーション原生の音響インフラ層という共有基盤の恩恵を受ける。」これは、みんな自分のものは保持できるが、それを機能させるにはTrebleのシミュレートされた音が必要だ、というおしゃれな言い方だ。