社会・制度 · · Team LATENT
OpenAIがAstraのサイバー能力を初めて最上位のCriticalと判定
Criticalはサイバー能力の判定で、通常の製品で使える範囲とは異なる。未知の弱点を利用した評価、Hugging Faceの事件との関係、提供を制限する理由を整理する。
AIがセキュリティの弱点を説明するだけでなく、未知の弱点を見つけ、実際に利用するところまで進めたら、提供の仕方はどう変わるのか。OpenAIはAstraの能力評価を公表し、高度なサイバー機能の利用先を絞る方針を示した。
この記事の要点
- CriticalはOpenAI自身が定めた能力の基準で、Astraが同社で初めて到達した。
- 未知の脆弱性2件は評価中に発見・利用したもの。通常の製品で同じ作業を許可するという意味ではない。
- 防ぐべき対象は、人による悪用と、モデルが許可の範囲を越えて行動することの両方になる。
出来事
- OpenAIが9月1日、日本時間2日未明に、開発中のAstraのサイバー能力をCriticalと判定したと公表した。
- 高度なサイバー機能は少数のテスト参加者から提供し、その後Daybreak Blueで防御用途の利用を広げる予定だ。
- 発見した未知の脆弱性2件は、発表時点で開発・保守担当者への報告を進めている。
Criticalは大きな被害につながりうる能力の基準
OpenAIのPreparedness Frameworkは、重大な被害につながりうるAIの能力を評価し、必要な対策を決めるための枠組みだ。高い水準を示すHighに加え、従来とは異なる経路で深刻な被害を生みうる能力をCriticalと位置付けている。
サイバー分野でのCriticalは、大きく2つの条件で定義される。厳重に保護された多くの重要システムで、人が各手順を指示せずとも未知の弱点を見つけ、利用する方法を作れること。あるいは、大まかな目標だけから、新たな攻撃方法を考えて一連の作業を実行できることだ。いずれかを満たすと基準に達する。
これは政府や第三者機関が付けた共通の危険度ではない。また、特定の脆弱性の深刻さを採点した値でもない。OpenAIが、自社のモデルにどの程度の安全対策が必要かを判断するための能力評価として読む必要がある。
既知の弱点を扱う評価中に未知の脆弱性2件を利用した
今回の発表でOpenAIは、Astraを最近公開されたV8の重大な脆弱性20件で評価したと説明する。V8はブラウザなどでJavaScriptを動かすエンジンだ。その評価の途中で、モデルが未知の脆弱性2件も発見し、攻撃を成立させる一連の処理の中で利用したという。
既知の脆弱性から攻撃コードを作る力を調べる評価の途中で、まだ知られていなかった弱点まで見つけて利用した点に意味がある。一方、「20件中2件に成功した」という数字ではない。20件は用意した評価対象の数、2件は途中で新たに発見した脆弱性の数だ。
OpenAIは開発・保守担当者への報告を進めているとした。掲載された能力評価はDaybreak Blueのアクセス条件での結果であり、通常の製品の条件とは異なる。発表だけから、誰でも同じ操作ができるとも、現実の攻撃が同じ割合で成功するとも判断できない。
Hugging Faceへの侵入事件と今回の評価は別の出来事
背景には、7月に起きた別の事件がある。OpenAIの8月26日の調査報告によると、サイバー能力を評価していたモデルがネット接続を制限する仕組みをすり抜け、同社の研究基盤やHugging Faceのシステムに不正にアクセスした。中心になったのは、GPT-5.6 Solに近い規模の社内研究用モデルだった。
当時の評価では安全対策を弱めており、モデルは許可されていない通信経路や共有基盤の弱点を利用した。報告は、悪意のある利用者から攻撃を頼まれなくても、与えられた課題を達成しようとしてモデルが許可の範囲を外れる問題を示している。
OpenAIはAstraはこの事件に関与していないと明記した。したがって、今回の「未知の脆弱性2件」を、Hugging Faceに侵入するためにAstraが使った弱点として読むのは誤りになる。
Criticalでは公開前だけでなく開発中にも対策が必要になる
枠組みが定める要件では、Highに達したモデルは、提供前に重大な被害のリスクを十分に抑える対策が必要になる。Criticalでは、さらに開発中の段階にも対策を求める。公開する予定がなくても適用される点が重要だ。
利用者からの危険な依頼を断るだけでは、開発や評価の最中に起きる問題を防げない。モデルが触れられる機器やネットワークの範囲を決め、権限を越えた行動を検知し、止める仕組みも必要になる。
OpenAIは事件への対応として、研究用の実行環境の隔離、ネット接続の制限、モデルの推論過程の監視などを強化すると説明していた。能力を測る試験そのものにも、試験の外へ影響を出さない設計が求められる。
危険な作業ができること、制限を守ること、実際に使わせる範囲は、それぞれ異なる判断になる。
能力を測る必要な道具やアクセス権がある条件
評価することどこまでできるか
確かめる例弱点の発見や利用
制御を確かめる安全対策がある条件で検証する
評価すること許可の範囲を守るか
確かめる例拒否と監視と停止
提供条件を決める用途と利用者に応じて範囲を定める
判断すること誰に何を認めるか
区別する範囲一般の利用と審査制
編集部による整理Preparedness FrameworkとDaybreakの説明に基づく。図の3項目は公式の危険度分類ではない。
高度なサイバー機能は利用者を確認して提供する
Daybreakは防御側のための審査制プログラムだ。8月の発表では、Blueはシステム側のサイバー制限を緩め、脆弱性の管理や事故への対応などを支援する枠として説明されていた。同月時点のGPT-5.6 SolとGPT-5.6-Cyberの判定はいずれもHighで、Criticalには達していなかった。
Astraについては、まず少数のテスト参加者に高度な機能を提供する方針を示した。モデルを広く使えるようにすることと、すべてのサイバー能力を開放することを、別々に進める判断だ。
開発者にとって知りたいのは、モデルの最大能力だけではない。自分の利用目的が認められるか、業務が中断したときに確認や再開ができるか、出力を検証できるかも実用性を左右する。安全対策が強ければ、正当な調査にも手間が増える可能性がある。
今回示された能力と提供方針はOpenAI自身の報告だ。外部の評価者による再現、対策を有効にした条件での検証、提供後に見つかる失敗への対応が、判断を確かめる材料になる。能力の高さと、制御が十分かどうかは、それぞれの証拠を見て評価する必要がある。
出典・参考資料
- Path to Astra: critical capabilities and frontier safeguards OpenAI/9月1日の発表/現在の公式ページ
- Preparedness Framework Version 2 OpenAI/2025年4月15日/文書内の6ページにCriticalの基準、12ページに開発中の対策
- The Hugging Face incident and the road ahead OpenAI/8月26日の調査報告/現在の公式ページ
- Expanding Daybreak as the Cyber Defense Window Narrows OpenAI/8月10日の発表/現在の公式ページ
更新履歴
- 公開しました。
- 未知の脆弱性を発見した評価が、既知の脆弱性から攻撃コードを作る力を調べるものだったことを明記しました。