语音AI现在显然火得不行,投资者们正把数十亿美元砸向任何能听、能回话、或者能记会议纪要的东西。在这场淘金热中,总部位于冰岛的初创公司Treble登场了。该公司由声学工程师Finnur Pind和Jesper Pedersen于2020年创立,刚刚在其A轮融资的扩展轮中筹集了1800万美元。本轮由Paladin Capital Group领投,现有投资者KOMPAS VC、Frumtak Ventures、EIC和Omega ehf.也纷纷跟投。此前该公司在2024年已融资1200万美元,使Treble的总融资额超过4000万美元。该公司的客户包括亚马逊和罗技,大概是因为即便是巨头企业也需要有人来告诉它们,自家的小玩意儿听起来到底怎么样。

Treble的卖点基本上是:所有这些新的语音AI模型和设备都需要测试,而测试需要数据。大量的数据。Treble不像其他人那样从互联网上抓取录音,而是生成合成音频数据,用于语音增强、噪声抑制和模型训练。它还会在不同条件下评估语音AI模型,并将结果反馈给实验室。今年早些时候,它与Hugging Face合作,推出了一项针对语音识别模型在真实条件下表现的基准测试——毕竟总得有人给机器打分。

“音频AI实际上是一个数据挑战,而这正是赋能下一代模型和硬件的最大机会所在,”Pind对TechCrunch表示。“迄今为止,几乎所有与声音相关的AI都是基于从互联网上抓取的录音和数据制作的。我们相信,精确的物理模拟可以成为创建声音数据的另一种方式。”换句话说,既然可以模拟,何必依赖那个乱糟糟的真实世界?

除了软件,Treble还从语音角度进行硬件设计和测试。它帮助耳机和音箱公司虚拟地制作产品声音原型,测试智能音箱能否根据摆放位置理解指令,并且最近还进入了智能眼镜和AI设备的模拟测试领域。Pind尤其对可能赋予用户“超人类听觉”的可穿戴设备感到兴奋。“也许你在餐厅里,只想听到两米范围内的人说话,或者你在研讨会上,想屏蔽周围的人,”他说。毕竟,没有什么比选择性地忽略身边的人更能代表进步了。

该公司还将目光投向了物理AI——机器人、汽车和无人机公司——通过测试和模拟来实现基于声音的功能。Paladin Capital Group的副总裁Francois Ruether表示,Treble的平台之所以脱颖而出,是因为它能模拟不同的模型和设备,而其重要性只会与日俱增。“我们的论点是,随着越来越多的产品依赖于理解声音,这种基础设施在语音AI、可穿戴设备、机器人和物理AI领域将变得越来越有价值,”Ruether说。“客户保留对其模型、产品和开发工作流的所有权,同时受益于一个共享的、模拟原生的声学基础设施层。”这是一种花哨的说法,翻译过来就是:大家都能保住自己的东西,但都得靠Treble的模拟声音才能让它运转起来。