A IA de voz aparentemente está tão quente no momento que investidores estão atirando bilhões de dólares em qualquer coisa que consiga ouvir, responder ou anotar reuniões. Nessa corrida do ouro entra a Treble, uma startup sediada na Islândia fundada em 2020 pelos engenheiros acústicos Finnur Pind e Jesper Pedersen, que acaba de levantar US$ 18 milhões em uma extensão de sua Série A. A rodada foi liderada pelo Paladin Capital Group, com os investidores existentes KOMPAS VC, Frumtak Ventures, EIC e Omega ehf. também contribuindo. Isso segue um aporte de US$ 12 milhões em 2024, elevando o total da Treble para mais de US$ 40 milhões. A empresa conta com Amazon e Logitech como clientes, presumivelmente porque até gigantes corporativos precisam de alguém para lhes dizer como seus aparelhos soam.

O argumento da Treble é essencialmente: todos esses novos modelos e dispositivos de IA de voz precisam de testes, e testes precisam de dados. Muitos deles. Em vez de raspar gravações da internet como todo mundo, a Treble gera dados de áudio sintéticos para aprimoramento de fala, supressão de ruído e treinamento de modelos. Ela também avalia modelos de IA de voz sob diferentes condições e realimenta os laboratórios com esses dados. No início deste ano, fez parceria com a Hugging Face para lançar um benchmark para modelos de reconhecimento de fala em condições realistas — porque alguém precisa dar notas às máquinas.

"A IA de áudio é realmente um desafio de dados, e é aí que estão as maiores oportunidades para viabilizar modelos e hardware de próxima geração", disse Pind ao TechCrunch. "Até hoje, praticamente toda a IA relacionada a som foi feita a partir de gravações e dados raspados da internet. Acreditamos que a simulação física precisa pode ser uma forma alternativa de criar dados para som." Em outras palavras, por que depender do mundo real bagunçado quando você pode simulá-lo?

Além do software, a Treble faz design e testes de hardware do ponto de vista da voz. Ajuda empresas de fones de ouvido e alto-falantes a prototipar virtualmente como seus produtos podem soar, testa se uma caixa inteligente consegue entender comandos com base em onde está colocada, e ultimamente tem avançado em testes de simulação para óculos inteligentes e dispositivos de IA. Pind está particularmente empolgado com wearables que poderiam dar aos usuários "audição sobre-humana". "Talvez você esteja em um restaurante e só queira ouvir pessoas em um raio de dois metros, ou esteja em um seminário e queira silenciar as pessoas ao seu redor", disse ele. Porque nada diz progresso como ignorar seletivamente as pessoas ao seu redor.

A empresa também está mirando a IA física — empresas de robótica, automotiva e drones — para viabilizar funções baseadas em som por meio de testes e simulação. Francois Ruether, VP do Paladin Capital Group, disse que a plataforma da Treble se destaca porque simula diferentes modelos e dispositivos, e sua importância só vai crescer. "Nossa tese é que, à medida que mais produtos dependem da compreensão do som, essa infraestrutura se torna cada vez mais valiosa em IA de voz, wearables, robótica e IA física", disse Ruether. "Os clientes mantêm a propriedade de seus modelos, produtos e fluxos de trabalho de desenvolvimento, enquanto se beneficiam de uma base compartilhada de uma camada de infraestrutura acústica nativa de simulação." O que é uma forma chique de dizer: todo mundo fica com suas coisas, mas todos precisam do som simulado da Treble para fazê-las funcionar.