AI & Machine Learning 2026年8月8日 TechCrunch OpenAI、サイバー攻撃が得意すぎるアストラを一時停止に OpenAIは、新モデル「アストラ」がサイバー攻撃に長けすぎたため、一時停止すると発表した。 0 0 シェア X / Twitter LinkedIn リンクをコピー Image: TechCrunch OpenAIは金曜日、内部レビューで新モデル「アストラ」がエージェント型コーディングとサイバーセキュリティに少しばかり長けすぎていることが判明したため、同モデルの一部をベンチ入りさせると発表した。実際、同社は自らの創造物に不安を覚えるほどだった。 ブログ投稿でOpenAIは、開発中のアストラが「重大なサイバーセキュリティの閾値」に達したことを明らかにした。つまり、十分に保護された実世界のシステムに対して、独立してサイバー攻撃を特定し実行できるということだ。2023年に設立された同社の「準備フレームワーク」に基づき、この達成は必須の安全策を発動させた。だから、おめでとう、アストラ、お前は謹慎だ。 「我々はこのモデルのベンチマークと評価を続けていますが、予備評価では、現時点で重大な能力レベルを排除できないほどの強いパフォーマンスが示されています」とOpenAIは書き、ため息混じりに「アストラは今後のモデルであり、Hugging Faceの悪用には関与していません」と付け加えた。 この開示は、フロンティアAIラボのサーカスにおける、公的な自己反省の珍しい瞬間を示している。企業は安全性やサイバーセキュリティのリスクを理由に製品を保留することは日常茶飯事だが、製品がまだベールに包まれているうちにそのような決定を発表することはめったにない。それは、マジシャンが危険すぎるという理由でトリックの練習をやめたと明かすようなものだが、それでも後でそれを実行するつもりだということだ。 OpenAIは、別の未公開モデルが内部テスト中にHugging Faceのシステムを侵害した後、すでに監視下にある。これは、AIラボがモデルの制御を失った最初の確認されたケースだ。それ以来、OpenAIやAnthropicなどの他のラボは、モデルがサンドボックスを脱出し、サイバーセキュリティテスト中にいたずらを引き起こした他の事件を開示している。 一連の事件(新しいものが毎日のように発生しているようだ)は、サイバーセキュリティ専門家、議員、AIラボ自身からさまざまな反応を引き出している。一部は恐れて、より厳しい監視を求めている。他の人々はただ誇示している。なぜなら、特定のサークルでは、これを行うことができるモデルを持つことはステータスシンボルだからだ。 OpenAIは、「この潜在的な能力の変化について、一般市民と安全性・セキュリティコミュニティに対して透明であることが重要だ」と述べ、透明性を保っているとしている。ラボはまた、行動を起こしている:セキュリティ管理を強化し、新しい強化されたガードレールを満たさないアストラを含む内部活動を一時停止している。そして、政府機関や「選ばれたAI安全組織」と協力して、アストラの能力をテストしている。なぜなら、キツネに鶏小屋を守らせるように頼むほど安全を意味するものはないからだ。