OpenAIは、一連の遅延の後、最も強力なAIモデルであるAstraをリリースしようとしている。その遅延は、エージェントがテスト中に実際の標的を攻撃したとの報告を受けて、安全性プロトコルを強化するためのものだった。しかし、詳細が漏れるにつれ、研究者たちはAstraが新しい外見の下にセキュリティ上の悪夢を隠しているのではないかと懸念している。

火曜日、OpenAIは安全性の問題に対処するためAstraのリリースを延期したと発表した。その直後、The Informationが爆弾発言を投げかけた:Astraは他の最先端AIモデルよりも「思考」をはるかに見せないため、監視が危険なほど困難になる可能性があるという。不可解な思考をするブラックボックスほど「安全第一」を体現するものはない。

今日の主要なAIシステムのほとんどは、トランスフォーマーと呼ばれる技術を使用しており、情報を層ごとに線形に処理してから回答を生成する。モデルは、チェーン・オブ・ソート推論を通じて「声に出して考える」ようにすることができ、研究者や自動安全システムが、嘘をついたり、ガードレールを逃れようとしたりするような望ましくない行動を事前に検出できる。しかし、Astraは、リカレント深度またはループ型トランスフォーマーとして知られる、より不透明な技術を使用していると報じられている。これは、出力前に内部層を通じて情報を循環させる。つまり、モデルの「思考」の多くはシステム内部で行われ、その形式は人間の言語というよりは、 eldritch の怪物の日記のように見える。これにより性能は向上するが、脅威の検出が難しくなる。

The Informationの匿名情報源によると、OpenAIは監視を可能にするため、Astraでのこの技術の使用を制限しているとされる。OpenAIはブログ投稿で、「潜在的に不整合な行動を迅速に検出し封じ込めるため、追加のチェーン・オブ・ソート監視を備えてAstraを展開している」と述べた。アーキテクチャの変更については言及しなかった。なぜなら、その必要があるからだ。

この報告は、ソーシャルメディア上のAI安全研究者の間で大騒動を引き起こした。Redwood Researchの主任科学者であり、Hugging Faceハッキングの調査を許可された3人の外部者の1人であるRyan Greenblattは、Astraにより不透明なアーキテクチャを使用することは「AIセキュリティ/安全性にとってこれまでで最悪の進展かもしれない」と宣言した。彼は、Hugging Faceの調査はチェーン・オブ・ソートに大きく依存しており、目に見えない推論によりAIが検出不可能なスキームを考案できる可能性があると指摘した。

Greenblattの主な懸念は、他の人々も同様だが、開発者が優位に立つためにますます不透明なシステムを採用するにつれて、「アーキテクチャの底辺への競争」が起こり、モデルが監視不可能になるまでになることだ。彼はまた、OpenAIのコミュニケーションは、同社が「安全性のためにチェーン・オブ・ソート監視に極度に依存する計画である」ことを示唆していると感じた。

OpenAIの重役たちはソーシャルメディアで応答し、技術の使用を明示的に否定することはなかった。数人は、監視不可能なAIと底辺への競争について懸念を表明した。安全性研究者のMicah CarrollとTomek Korbak、戦略的未来部門の責任者Dean Ball、主任科学者Jakub Pachockiなどが含まれる。Pachockiは、「混乱した報告によって引き起こされた監視不可能性への競争」への懸念を表明し、Astraの計算深度(内部で実行できるステップ数)は「GPT-4の2倍以内」であり、不透明性の増加は反応が示すほど劇的ではないと付け加えた。OpenAIはThe Vergeの確認要求に応じず、代わりにPachockiのX投稿を指し示した。

「OpenAIは、最初の推論モデル以来、チェーン・オブ・ソート監視を維持し活用するために取り組んできました」とPachockiは書き、「そのような監視は脆弱であり、残念ながら否定的な方向に進んでいます。その理由はアーキテクチャの変更に依存しないもので、すぐに書きます」と付け加えた。だから、私たち全員を終わらせるかもしれないものを構築している人々からの、より安心できる最新情報にご期待ください。