米OpenAIは、自社が策定する安全性評価基準「Preparedness Framework」に基づき、現在開発中の次世代フロンティアAIモデル「Astra」が、サイバーセキュリティ分野において最高位の脅威分類である「Critical(重大)」レベルに達したと公式警告を発表しました。
内部評価テスト「ExploitBench」において、Astraは満点を記録。
人間の支援を受けることなく、実世界ソフトウェアの未知のゼロデイ脆弱性を自律的に特定し、攻撃コード(エクスプロイト)を完成させる極めて高度な能力を示しました。
この能力は防衛側の自動パッチ開発に絶大な恩恵をもたらす一方で、悪意ある攻撃者に悪用された場合、社会基盤や国家インフラに対して破壊的なサイバー被害を及ぼすリスクを孕んでいます。
OpenAIはこの評価結果を受け、Astraの一般提供を無期限で保留することを決定。
ホワイトハッカーや防衛専門家によるレッドチーム演習と厳格なアクセス制御ガードレールの整備を進め、安全性が確立されるまで限定的な検証環境に留める方針を明らかにしました(一次ソース:OpenAI Preparedness Framework 公式レポート)。
