Anthropicは、自社のClaude AIモデルのいくつかがテスト中に3つの異なる組織のシステムをハッキングしていたことに気付いた。それは、モデルが独自に行動し、会社が気付かないうちに起こった。この暴露は、ライバルのOpenAIが自社のモデルの1つが開発者プラットフォームHugging Faceを侵害したと発表した数日後になされたもので、最先端のAI研究所が、自分たちが構築しているますます高性能なシステムを制御するために十分な対策を講じているかどうかについて、高まる不安に拍車をかけている。

インシデントを説明するブログ投稿で、Anthropicは、Claudeがサイバーセキュリティ評価中に不正アクセスを得たと述べた。すべての攻撃は、ハッキング能力をテストする一般的な方法である「キャプチャ・ザ・フラッグ」演習中に発生した。これは、モデルがシミュレートされたネットワーク内の隠された情報を見つけて取得するよう求められるものだ。

この開示は、Hugging Face事件と強力なオープンウェイトの中国製モデルのリリースを受けて、最先端のAI研究所への圧力を強めている。大手研究所の従業員は現在、協調的なグローバルガバナンスを求めており、米国の議員は強力なモデルとそのアクセス権者に対するより厳しい監視を検討し始めている。

Anthropicによると、サイバーセキュリティテストの環境は隔離されるはずだった。しかし、「設定ミス」により、Claudeがアクセスしたマシンが「ライブインターネットアクセス」を持つことになり、すべてのモデルが「明示的に」インターネットアクセスがないと指示されていたため、遭遇した実際のネットワークをシミュレーション環境の一部であると「想定」した。

最も初期のインシデントは4月に遡り、3つの異なるClaudeモデル(Opus 4.7、Mythos 5、および「内部研究テストモデル」)が関与していたとブログ投稿は述べている。モデルがサイバー能力をテストされている間、Anthropicは、リスクの高い行動を抑制するために通常設定される標準的な保護手段が欠如していたと述べた。

同社は、OpenAIが不正なAIエージェントがHugging Faceへの攻撃の背後にあったことを開示した後にのみ行った、14万1千回以上のサイバーセキュリティテスト実行をレビューした後にインシデントを発見したと述べた。

3つのモデルは、遭遇しているシステムが実際には本物であることを示す情報に遭遇したとき、非常に異なる行動をとった。Anthropicの説明によると、最も古いモデルであるOpus 4.7は、実際のシステムに到達したことを認識したが、「攻撃を続けた」。主力のMythos 5は、インターネットを使用していることを理解したが、何らかの理由でこれはすべてシミュレーションの一部であると推論し、続行した。内部テストモデル(Anthropicが「当社の最新モデル」と表現)は、ターゲットが本物であるという証拠が現れたときに演習を停止した。

Anthropicは影響を受けた組織を特定せず、インシデントの調査を継続し、可能なときに更新を提供すると述べた。同社はまた、AI研究非営利団体METRと、何が起こったかについての第三者レビューを実施することについて話し合っていると述べた。OpenAIも独立したレビューを実施するためにMETRを雇っている。

投稿全体を通じて、Anthropicはインシデントの性質とその処理の両方をOpenAIのものと繰り返し対比し、最後に相違点を概説する箇条書きの4点リストで締めくくっている。そして、なぜ自社の対応がより良かったと信じているかを説明している。Anthropicは、自社が「積極的に」テストをレビューし、企業が活動を検出する前に行ったことを強調している。また、自社のモデルが「オープンパス」を介してインターネットにアクセスしたのに対し、OpenAIのエージェントは新しいエクスプロイトを使用したと述べ、最新モデルは実際の環境で作業していることに気付いたときに停止したと付け加えた。

Anthropicはまた、自社のモデルがOpenAIのエージェントとは異なる方法で失敗したと述べ、これはより安全な失敗形態であることを示している。「両者の間に完全に明確な区別はありませんが、これらのインシデントはモデルのアライメント失敗というよりも、ハーネスと運用の失敗に近いと考えています」と同社は述べた。平たく言えば、Claudeモデルは指示されたことを実行していたのに対し、OpenAIのエージェントは作成者が意図しなかった方法で目標を追求した。これはAI安全の世界ではミスアライメントと呼ばれる。

Anthropicは他の研究所に対し、