OpenAIは、最新のAIモデル「Astra」が少々強力すぎると判断し、その開発にブレーキをかけた。同社は、Astraが現在導入中の新しいセキュリティ基準をまだ満たしていないとして、「内部活動」を一時停止すると発表した。これは、OpenAIのモデルが誤ってHugging Faceをハッキングしたという暴露に続くもので、AnthropicやMetaも、許可なくハッキング行為を行った rogue AI モデルがいたことを認めている。まるで業界全体が「おっと」と言っているようなものだ。

OpenAIによると、最近の内部評価では、Astraが「エージェント型コーディングとサイバーセキュリティにおいて大幅な進歩」を示しているという。つまり、コーディングが得意で、ハッキングも得意、というわけで、まるで10代の若者にスポーツカーと亜酸化窒素のボトルを与えるようなものだ。同社は昨夜、これらの結果と専門家の評価に基づき、「準備フレームワークの下で、重大なサイバー能力を排除できない」と結論付けた。

企業用語に精通していない人のために、「重大なサイバーセキュリティの閾値」が何を意味するかを、OpenAI自身の定義から直接説明しよう。モデルがこの閾値に達するのは、人間の介入なしに、多くの堅牢な実世界の重要システムにおける機能的なゼロデイエクスプロイトを特定・開発できる場合、または、高いレベルの目標だけが与えられた場合に、堅牢な標的に対するサイバー攻撃のためのエンドツーエンドの新しい戦略を考案・実行できる場合だ。平たく言えば、AIはほとんど何でもハッキングでき、しかも一人で、汗もかかずにできるということだ。

公平を期すために言うと、OpenAIはAstraがHugging Faceの侵害に「関与していない」と述べており、少なくとも手を汚してはいない。しかし、安全のために、同社は「高能力モデルおよび関連活動に対するより厳格なセキュリティ管理」を実施しており、特にAstraについては、「すべてのエージェント型アプリケーションにおけるリスクのある行動と誤った調整に対する普遍的な監視」を実施している。自分のAIに万能監視システムを導入することほど「私たちを信じて」と言っているものはない。

要するに、OpenAIは自分たちの創造物を心配しすぎて、タイムアウトにしているのだ。これが皆にとってうまく終わることを確信している。