AI & Machine Learning 2026年5月8日 TechCrunch OpenAI、音声機能を追加、テキストでの会話はもう2019年の話 OpenAIはAPIに新しい音声機能を追加し、アプリが会話、翻訳、書き起こしができるようになり、ついにユーザーを理解できるようになるかもしれない。 0 0 シェア X / Twitter LinkedIn リンクをコピー Image: TechCrunch OpenAIは木曜日、APIに新しい音声インテリジェンス機能群を追加すると発表した。開発者がユーザーとの会話を話し、書き起こし、翻訳できるアプリを構築するのを支援するために設計された。どうやら、タイピングはもう前世紀のものらしい。 同社の新しいGPT-Realtime-2は、ユーザーと会話できるリアルな音声シミュレーションを作成するために構築された別の音声モデルだ。前身(GPT-Realtime-1.5)とは異なり、今回はGPT-5クラスの推論機能を備えており、OpenAIによると、ユーザーからのより複雑なリクエストに対応するために作成されたという。つまり、より賢くなったが、それでもチップを要求せずにピザを注文することはできない。 また、GPT-Realtime-Translateも発表された。名前が示すように、ユーザーと会話のペースを保ちながらリアルタイム翻訳を提供する。この機能は、70以上の入力言語(理解できる言語)と13の出力言語(話し手に伝える言語)をサポートしている。多くの言語に対応しているが、皮肉を翻訳できるようになるのはまだ先のようだ。 最後に、GPT-Realtime-Whisperは、インタラクションの発生中にライブの音声をテキストに変換する新しい文字起こし機能だ。手動でメモを取るのはもう2019年の話だから。 「私たちが発表するモデル群は、リアルタイム音声を単純な呼びかけと応答から、実際に仕事ができる音声インターフェースへと移行させます。会話が展開するにつれて、聞き取り、推論、翻訳、書き起こし、そして行動を起こすことができます」と同社は述べている。言い換えれば、あなたがまだベッドにいる間に「今向かっている」と言っても、あなたの電話はついにあなたを理解するかもしれない。 これらのアップデートの恩恵を受けるのは誰か?カスタマーサービス機能を拡張したい企業は明らかなターゲットだ。しかしOpenAIは、これらの機能が教育、メディア、イベント、クリエイタープラットフォームにも役立つと述べている。ロボットがあなたの話を遮ることができることが『教育』を意味するなら、何も言うことはない。 これらのツールは企業の観点からは有用に見えるが、悪用される可能性もある。同社は、スパム、詐欺、その他のオンライン上の不正行為などの悪用を防ぐためのガードレールを構築したと述べている。特定のトリガーがシステムに組み込まれており、「有害なコンテンツガイドラインに違反していると検出された場合、会話を停止できる」という。つまり、それを使って老婦人を騙そうとすると、電話を切られるだけだ。なんて礼儀正しいんだ。 新しい音声モデルはすべてOpenAIのRealtime APIに含まれている。TranslateとWhisperは分単位で課金され、GPT-Realtime-2はトークン消費量で課金される。未来では、すべての音節に対して支払うことになるからだ。