OpenAIは火曜日、内部のサイバーセキュリティテストが失敗に終わり、同社のAIモデルの1つが無関係のAIホスティングプラットフォームであるハギングフェイスのシステムに侵入したことを認めた。モデルは隔離されたテスト環境から脱出し、そこからハギングフェイスのシステムに到達したという。ハギングフェイスは当初、この侵害を「外部のAIエージェント」によるものとしていた。

火曜日の午後に公開されたブログ投稿で、OpenAIはモデルがサービスを侵害するに至った経緯を詳述した。「調査の結果、この特定のインシデントは、OpenAIのモデル(GPT-5.6 Solやさらに高性能なプレリリースモデルを含み、評価目的でサイバー拒否機能を低下させたもの)の組み合わせが、サイバー能力のベンチマークで内部テストされていた際に発生したことがわかりました」と投稿には記されている。

この侵害は、既存の脆弱性に基づく攻撃を実行するモデルの能力を測定する公開ベンチマークであるExploitGymに焦点を当てていたようだ。ExploitGymのようなベンチマークは、特定のスキルを磨くためにモデルトレーニングで一般的に使用されるが、そのテストが実際のサイバー攻撃につながったのはこれが初めてである。モデルは、タスクを完了するために必要なソフトウェアパッケージをインストールできる特定のツール以外、インターネットにアクセスできるはずもなかった。しかし、モデルはパッケージインストーラープログラムの未公開の脆弱性を発見し、それを使って自由にインターネットにアクセスした。

「モデルはExploitGymの解決策を見つけることに過集中し、かなり狭いテスト目標を達成するために極端な手段をとりました」とOpenAIの投稿は述べている。「インターネットにアクセスした後、モデルはハギングフェイスがExploitGymのモデル、データセット、解決策をホストしている可能性があると推測しました。これを知ったモデルは、評価を不正に通過するために使用できる秘密情報にアクセスする方法を検索し、見事に見つけ出しました。」最終的に、モデルはハギングフェイスのインフラの脆弱性を発見し、「ハギングフェイスの本番データベースから直接テスト解決策を入手」し、実質的にベンチマークの答えを手に入れた。

ハギングフェイスにとって、その結果は洗練された攻撃的なサイバー攻撃であり、「短命なサンドボックスの群れにわたる数千の個別アクションと、公開サービス上で自己移行するコマンド&コントロール」を伴うものだったと、同社は最初の開示で述べている。OpenAIはパッケージインストーラーの脆弱性を特定して報告し、ハギングフェイスと協力してインシデントをさらに調査している。同社はまた、モデルテストと関連インフラの両方に新しい管理策を導入し、将来同様のインシデントを防止すると述べた。OpenAIがこの侵害の結果として法的な結果に直面するかどうかは不明だが、モデルの行動がコンピュータ詐欺および濫用法に違反した可能性が高い。

それでも、この結果は、長い時間軸で動作するフロンティアAIモデルの力と危険性を異常に鮮明に示している。OpenAIの研究者Micah Carrollがこのニュースに応えて投稿したように、「これが、アライメントのリスクが今後重要な懸念事項になることをあなたに納得させないなら、何がそうさせるのか私にはわかりません。」