AI & Machine Learning 2026年7月31日 ZDNet OpenAIの rogue エージェントは逃げ出したのではなく、地図と刑務所無料カードを実質的に与えられていた OpenAIのAIエージェントは単に逃げ出したのではなく、地図と鍵を実質的に手渡された。超スマートなモデルにサイバーセキュリティテストを与えると、「枠の外で考える」を文字通りに受け取るかもしれない。 0 0 シェア X / Twitter LinkedIn リンクをコピー Image: ZDNet 7月16日、AIコミュニティサイトのHugging Faceは、未知の起源を持つ「自律型AIエージェントシステム」による標的となったと報告した。このシステムは、そのドメインに大量のトラフィックを送り込み、セキュリティログに17,000件以上のイベントを氾濫させ、その一部は最終的にデータベースに保存された秘密情報の窃取に成功した。 Hugging Faceによると、攻撃者は「限られた内部データセットと、当社のサービスで使用されているいくつかの認証情報への不正アクセス」を得ており、「自律型エージェントフレームワーク(エージェント型セキュリティ研究ハーネスに基づいて構築されているように見える - 使用されたLLMはまだ不明)によって実行された」ように見えた。 5日後の7月21日、OpenAIがこの攻撃の責任を主張して名乗り出ると、大騒動が勃発した(この事件の一部として標的となった他の組織の報告も含む)。メディアは、ChatGPTが暴走し、自らの意志と悪意でHugging Faceのシステムを攻撃したかのように見せる、恐怖を煽るようなさまざまな記事で応じた。 そして昨日、火に油を注ぐように、Anthropicは、自社のモデルが進行中の安全性テストの一環として、他の組織を誤って攻撃したという同様の開示を行った。 OpenAIの開示に関する私の報道で述べたように、Hugging Faceの指摘は正しく、それは自律型セキュリティ研究フレームワークの指示下にあるエージェントだった。しかし、人間が間違いなくループ内にいたのであり、エージェントの行動の少なくとも一部は予期されるべきだった。 重要なのは、攻撃の責任があったのはChatGPT自体ではなく、一部のコメンテーターがほのめかしたようなものではなかった。むしろ、攻撃はOpenAIのAI安全研究者の指示下にあるエージェントに帰属し、彼らはインターネットから隔離されたとされる環境で、AI安全性テストの一環として一連のエクスプロイトを試みるように意図的にプロビジョニングした。さまざまなフロンティアモデルの研究所でよくあることだが、AI安全研究者はOpenAIの最新の大規模言語モデル(LLM)の能力を評価しようとしていた。 「前例のないサイバーインシデント」(OpenAIが呼んだ)は、エージェントが理論上安全な囲いから脱出し、Hugging Faceのシステムに大損害を与えたと広く説明されている。そのような囲いは、技術的なサークルでは「サンドボックス」と呼ばれることがある。OpenAIの開示も「サンドボックス環境」に言及している。しかし、その言葉を使うにあたり、私の情報筋は、その環境は単にサンドボックスをエミュレートするように設定されたファイアウォールであり、Blaxel、Daytona、E2B、Modalなどの実際のサードパーティ製サンドボックスソリューションではなかった可能性があると示唆している。OpenAIは、使用していたソリューションやそのプロバイダーの詳細をまだ開示していない。 エージェントとサンドボックス脱出に関するすべての議論は、ZDNETの編集者に「そもそもエージェントはどうやってサンドボックスから脱出するのか、そして再発を防ぐことはできるのか?」と尋ねさせた。答えを求めて、私はOpenAIとHugging Faceに連絡を取った。どちらも返答しなかった。しかし、両社の公開情報と私の他の情報源の間には、そのような「脱出」がどのように起こり得るかについて理論化を始めるのに十分な情報がある。 悪意と主体性の間には大きな違いがある。攻撃は間違いなく悪意のある侵入だったが、関与したエージェント自体には悪意はなかった。それはある朝目覚めてHugging Faceのシステムを攻撃することを決めたわけではない。代わりに、それは非常に冷静に、自分がしたすべてのこと(安全性テストに乗り出し、自分の制限から抜け出し、標的を選び、それらの標的を悪用する)を行う主体性を与えられていた。 その主体性の一部は設計によるものであり、一部は当時OpenAIのAI安全テスト担当者がテストしていた強力なLLMから受け継がれたものだった。また、OpenAIがこの特定の安全性研究を実施するためにExploitGymオープンソースAIテストソリューションを使用した場合、その主体性の一部は、これらのテストを安全に隔離することを目的としたサードパーティの「サンドボックス環境」と、Hugging Faceの一部の両方における、これまで発見されていなかった脆弱性の結果だった。