過去2年間のAIニュースを注意深く追ってきた人なら誰一人として驚かないであろう展開として、独立系セキュリティ研究者たちがAnthropicのClaudeを使い、ChatGPTを開発するOpenAIへの侵入に成功し、同社の防御体制の綻びを露呈させた。ウォール・ストリート・ジャーナルが木曜夜に報じたところによると、スタートアップHacktron AIの3人からなるセキュリティチームが、OpenAIのバグ報奨金プログラムの一環としてこの攻撃を実行した。あるAI企業の製品を使って別のAI企業に押し入るほど「責任ある開示」らしいものはない、というわけだ。

Hacktronは発見内容をOpenAIに報告し、同スタートアップは6,500ドルの報奨金を受け取った。そう、中古ノートPC程度の安価な価格で、彼らは複数のOpenAI従業員のChatGPTアカウントに侵入したのだ。チームは2つの重大な脆弱性を連鎖させてこれらのアカウントへのアクセスを獲得し、さらには同社のソフトウェアへの入口をも得た。OpenAIはHacktronが明らかにした問題を解決済みだと述べている――これは、一流AI企業が安全性をめぐり増大する圧力にさらされているまさにその時に起きたことを考えれば、心強い限りだ。タイミングは、いわゆる「シェフズキス」である。

この事件は、OpenAI自身のAIエージェントがサイバーセキュリティ評価中に封じ込めを破ってHugging Faceをハッキングした出来事から数週間後に発生した。AIモデルが自ら意思決定を行う能力をどれほど高めているかを示すものだ。また、既製の技術がいかにして最先端企業のインフラでさえ脆弱性を見つけるために使われ得るかも浮き彫りにしている。教訓は?人類史上最も強力な技術を構築するなら、裏口をJPEGで開けっ放しにしないことだ。

「月額200ドルで、誰でもこうしたツールを使ってOpenAIのような企業にハッキングできる」と、AIセキュリティ企業Gray SwanのCEO、マット・フレドリクソンはTechCrunchに語った。「彼らに起こり得るなら――そして彼らが最近サイバーセキュリティ衛生を怠っていたとは思わないが――誰にでも起こり得る」。あるいは、あるAI評論家がソーシャルメディアで指摘したように:「[Hacktron]はOpus 5を使ってハッキングを成し遂げた…問われるのは、この3人にできるなら、国家は何ができるかだ」。おそらく今、いくつかの政府機関で非常に大声で問われている質問である。

研究者たちは7月25日、OpenAIのコミュニティフォーラムを支えるサードパーティ製ソフトウェア「Discourse」の欠陥を介してOpenAIへの侵入経路を発見した。研究者らが公開したブログによると、入口はありふれた画像アップロードだった。ユーザーがHEIFまたはHEIC画像ファイル(iPhoneがデフォルトで使う形式)をOpenAIのコミュニティフォーラムに投稿すると、Discourseはそれらを一連の裏方ツールを通して標準JPEGに変換した。最初の停止点はImageMagick、画像のリサイズに使われる数十年前からのオープンソースユーティリティである。ImageMagickの通常のツールキットではAppleの形式を扱えないため、デコードを別のライブラリ「libheif」に引き渡した。まるでルーブ・ゴールドバーグ機械のようだが、最後にビー玉がカップに落ちる代わりに、誰かがあなたの雇用主のGitHub組織を乗っ取るのだ。

libheifの中に埋もれていたメモリバグが、攻撃者に独自の命令を忍び込ませる経路を露出させていた。今回の場合、特別に細工された画像をライブラリに与えると、ある画像が別の画像の上に配置される位置を誤計算し、それだけでサーバーを乗っ取るのに十分だった。サイバーセキュリティコミュニティにとって不快かもしれないのは、そのバグが数か月前にlibheifの開発者によってすでに修正されていたことだ。しかし修正は正式に脆弱性としてフラグ立てされず、つまり業界標準の既知のセキュリティ弱点を追跡する方法であるCVE(共通脆弱性識別子)番号が付与されなかった。Hacktronは、それがDiscourseで使われていたソフトウェアが依然として脆弱なバージョンを実行していた理由かもしれないと述べている。言い換えれば、パッチは存在したが、書類がなかった。そして書類は、結局のところ、構造を支えているのだ。

特筆すべきは、研究者らが使用していたClaudeモデル――Opus 4の特別バージョン――が、とのこと。