OpenAI a annoncé jeudi que son API inclura désormais une série de nouvelles fonctions d'intelligence vocale, conçues pour aider les développeurs à créer des applications capables de parler, de transcrire et de traduire des conversations avec les utilisateurs. Parce que, apparemment, taper, c'est tellement la décennie dernière.

Le nouveau GPT-Realtime-2 de l'entreprise est un autre modèle vocal, conçu pour créer une simulation vocale réaliste capable de converser avec les utilisateurs. Contrairement à son prédécesseur (GPT-Realtime-1.5), celui-ci est doté d'un raisonnement de classe GPT-5, qu'OpenAI affirme avoir été créé pour traiter des demandes plus complexes des utilisateurs. Alors oui, il est plus intelligent, mais il ne peut toujours pas commander une pizza sans demander un pourboire.

Également lancé, GPT-Realtime-Translate, qui, comme son nom l'indique, fournit des services de traduction en temps réel qui « suivent le rythme » de l'utilisateur, de manière conversationnelle. La fonction prend en charge plus de 70 langues d'entrée (les langues qu'il peut comprendre) et 13 langues de sortie (les langues qu'il transmet à l'interlocuteur). C'est beaucoup de langues, mais on attend toujours qu'il traduise le sarcasme.

Enfin, il y a GPT-Realtime-Whisper, une nouvelle capacité de transcription qui offre aux utilisateurs une conversion parole-texte en direct pendant que les interactions se déroulent. Parce que prendre des notes manuellement, c'est tellement 2019.

« Ensemble, les modèles que nous lançons font passer l'audio en temps réel d'un simple appel-réponse à des interfaces vocales qui peuvent réellement travailler : écouter, raisonner, traduire, transcrire et agir au fil de la conversation », a déclaré l'entreprise. En d'autres termes, votre téléphone pourrait enfin vous comprendre lorsque vous dites « j'arrive » alors que vous êtes encore au lit.

À qui profiteront ces mises à jour ? Les entreprises souhaitant étendre leurs capacités de service client sont une cible évidente. Mais OpenAI note également que ces fonctions aideront l'éducation, les médias, les événements et les plateformes de créateurs. Parce que rien ne dit « éducation » comme un robot qui peut vous couper la parole.

Aussi utiles que ces outils puissent paraître d'un point de vue entreprise, ils pourraient aussi être mal utilisés. L'entreprise affirme avoir mis en place des garde-fous pour prévenir les abus comme le spam, la fraude ou d'autres méfaits en ligne. Certains déclencheurs sont intégrés au système afin que « les conversations puissent être interrompues si elles sont détectées comme violant nos directives de contenu nuisible ». Donc, si vous essayez de l'utiliser pour escroquer des petites vieilles, il raccrochera simplement. Comme c'est poli.

Tous les nouveaux modèles vocaux sont inclus dans l'API Realtime d'OpenAI. Translate et Whisper sont facturés à la minute, tandis que GPT-Realtime-2 est facturé à la consommation de jetons. Parce qu'à l'avenir, vous paierez pour chaque syllabe.