La IA de voz está aparentemente tan de moda que los inversores están lanzando miles de millones de dólares a cualquier cosa que pueda escuchar, responder o tomar notas de reuniones. En esta fiebre del oro entra Treble, una startup con sede en Islandia fundada en 2020 por los ingenieros acústicos Finnur Pind y Jesper Pedersen, que acaba de recaudar 18 millones de dólares en una extensión de su Serie A. La ronda fue liderada por Paladin Capital Group, con los inversores existentes KOMPAS VC, Frumtak Ventures, EIC y Omega ehf. también aportando. Eso sigue a una recaudación de 12 millones de dólares en 2024, llevando el total de Treble a más de 40 millones. La compañía cuenta con Amazon y Logitech como clientes, presumiblemente porque incluso las corporaciones gigantes necesitan que alguien les diga cómo suenan sus gadgets.

El argumento de Treble es esencialmente: todos estos nuevos modelos y dispositivos de IA de voz necesitan pruebas, y las pruebas necesitan datos. Muchos. En lugar de extraer grabaciones de internet como todos los demás, Treble genera datos de audio sintéticos para mejora del habla, supresión de ruido y entrenamiento de modelos. También evalúa modelos de IA de voz en diferentes condiciones y retroalimenta eso a los laboratorios. A principios de este año, se asoció con Hugging Face para lanzar un benchmark para modelos de reconocimiento de voz en condiciones realistas, porque alguien tiene que calificar a las máquinas.

"La IA de audio es realmente un desafío de datos, y aquí es donde se encuentran las mayores oportunidades para habilitar modelos y hardware de próxima generación", dijo Pind a TechCrunch. "Hasta la fecha, prácticamente toda la IA relacionada con el sonido se ha hecho a partir de grabaciones y datos extraídos de internet. Creemos que la simulación física precisa puede ser una forma alternativa de crear datos para el sonido". En otras palabras, ¿por qué depender del desordenado mundo real cuando puedes simularlo?

Más allá del software, Treble hace diseño y pruebas de hardware desde una perspectiva de voz. Ayuda a las empresas de auriculares y altavoces a prototipar virtualmente cómo podrían sonar sus productos, prueba si un altavoz inteligente puede entender comandos según dónde esté colocado, y últimamente se ha movido hacia pruebas de simulación para gafas inteligentes y dispositivos de IA. Pind está particularmente entusiasmado con los wearables que podrían dar a los usuarios "audición sobrehumana". "Quizás estás en un restaurante y solo quieres oír a las personas dentro de un rango de dos metros, o estás en un seminario y quieres silenciar a las personas a tu alrededor", dijo. Porque nada dice progreso como ignorar selectivamente a las personas que te rodean.

La compañía también está poniendo sus miras en la IA física: robótica, automoción y empresas de drones, para habilitar funciones basadas en sonido a través de pruebas y simulación. Francois Ruether, vicepresidente de Paladin Capital Group, dijo que la plataforma de Treble se destaca porque simula diferentes modelos y dispositivos, y su importancia solo crecerá. "Nuestra tesis es que, a medida que más productos dependan de entender el sonido, esta infraestructura se volverá cada vez más valiosa en IA de voz, wearables, robótica e IA física", dijo Ruether. "Los clientes conservan la propiedad de sus modelos, productos y flujos de trabajo de desarrollo, mientras se benefician de una base compartida de una capa de infraestructura acústica nativa de simulación". Lo cual es una forma elegante de decir: todos pueden quedarse con sus cosas, pero todos necesitan el sonido simulado de Treble para que funcione.