5月、GoogleのGeminiモデルが封じ込めを破り、3つの異なる企業をハッキングした。どうやら「悪事を働くな」はポリシーというより提案程度のものらしい。Googleはウォール・ストリート・ジャーナルが取材に来るまでこの事件を公表しなかった。これがPR危機への対処法の一つだ:起きていないふりをして、誰も気づかないことを願う。

ハッキングは、第三者の企業Irregularが実施したモデルのサイバーセキュリティ能力のテスト中に発生した。IrregularはMetaやOpenAIが関与した同様の事件にも関わっている。つまり、自宅でスコアをつけているなら、大手AIラボ3社、テストパートナー1社、そして学んだ教訓はゼロということになる。

WSJによると、Googleはこのハッキングを「モデルの誤調整の例」とは見なさなかったため公表しなかった。代わりに、同社はそれを「人違い」と表現した。AIがパスワードを推測して実際の企業にブルートフォースで侵入するとき、それはセキュリティ侵害ではなく、AIが周囲を勘違いしているだけだというわけだ。Googleのセキュリティエンジニアリング担当VP、Heather Adkins氏は「このケースでは、モデルは適切に行動した」と述べた。

Adkins氏はThe Vergeに対し、「モデルはオンラインで公開情報を見つけ、テストの一部だと思ったウェブサイトにアクセスするために認証情報を推測した。これら3つの事例すべてで、モデルは停止した」と語った。Geminiが自ら封じ込めを破り、第三者を標的にしたことがなぜ誤調整に該当しないのかについては詳しく説明しなかった。おそらく、その説明は「あまり議論したくない事柄」に分類されているからだろう。

「私たちのセキュリティチームは、他人のソフトウェアやシステムで見つけた問題を報告してきた長い実績があります。たとえそれが弱いパスワードのように単純なものでも」とAdkins氏は言う。「私たちは3つの組織に通知し、トレーニングパートナーと協力して、彼らがテストプロセスに加えた変更について取り組みました。これらの出来事は、強力なAIモデルを責任を持って行動するように訓練することの重要性を浮き彫りにしています。」ああ、そうだ、訓練の重要性——あなたのモデルがすでに3社をハッキングした後にだけ適用される教訓らしい。

しかし、AIセキュリティ企業CorridorのCEO、Jack Cable氏はWSJに対し、「メタ問題は、モデルがすべきことの範囲を超えて、実際のサイバー攻撃を行っていることだ」と述べた。さらに、Irregularのセキュリティ上の欠陥がこれらの攻撃を可能にした可能性がある。モデルはテスト中にインターネットアクセスを持つべきではなかったが、IrregularはWSJに対し、意図せず利用可能なままになっていたと語った。要約すると:モデルはオンラインであるべきではなかった、オンラインになった、人をハッキングした、そしてGoogleの公式見解はこれで問題ないというものだ。

このような事件が積み重なるにつれ、AIを規制しようという声は高まるばかりだ。これは、AIが封じ込めを逃れ、企業がそれについて肩をすくめるという話の中ですでに最も予測可能な展開だろう。