OpenAIが開発中の次期主力AIモデル「Astra」について「強力すぎる」ことを理由にサイバーリスク重大に指定して安全措置を開発中

OpenAIは次期主力AIモデルとして「Astra」を準備しており、2026年8月1日には、Astraの内部バージョンが10件の数学・理論計算機科学の課題で新成果を上げたことを発表しています。しかし8月7日には、Astraに関する最新の社内評価でエージェントコーディングとサイバーセキュリティにおいて著しい進歩が見られたと述べた一方で、「重要なサイバーセキュリティの閾値に達する」と判断されています。
Responding to the next frontier of critical cyber capabilities | OpenAI
https://openai.com/index/responding-next-frontier-critical-cyber-capabilities/

OpenAIによると、同社の準備フレームワークでは「モデルが人間の介入なしに、多くの強化された実世界の重要システムにおいて、あらゆる深刻度レベルの機能的なゼロデイ攻撃を特定および開発できる場合」または「高レベルの目標のみに基づいて、強化されたターゲットに対するサイバー攻撃のためのエンドツーエンドの斬新な戦略を考案および実行できる場合」に、「重要なサイバーセキュリティの閾値に達する」とみなされるとのこと。Astraのベンチマークと評価は継続中ですが、予備的な評価では十分な性能が示されており、「現時点では、致命的なリスクを排除することはできません」とOpenAIは述べています。
そのためOpenAIは、Astraを準備体制フレームワークにおけるサイバーセキュリティに関する同社初の「critical」モデルとして扱うことを発表しました。OpenAIによるとこれは事前に計画していたシナリオであり、Astraのさらなる開発が安全かつ確実に進むよう追加の管理措置を講じているそうです。
After evaluating one of our upcoming models, Astra, we're treating it as our first "critical" model for cybersecurity under our Preparedness Framework.
— OpenAI (@OpenAI) 2026年8月7日
This is a scenario we've planned for, and we're putting additional controls in place to ensure Astra's further development…
具体的には、Astraの機能の展開に適したセキュリティを確保するため、OpenAIは保護対策とセキュリティ管理のテストを強化しています。また、今後のAstraの開発が安全かつ確実に行われるように、「高性能モデルおよび関連活動に対して、隔離されたテスト環境・ネットワークおよびツールへのアクセス制限・強化されたモデル重み保護および暗号化・追加の監視および検出機能・サンドボックス実行など、より厳格なセキュリティ管理を実施」「これらの強化されたセキュリティ管理要件をまだ満たしていないAstra関連の社内活動を一時停止」といった措置を講じています。
そのほか、トレーニングや評価を含むAstraのすべてのエージェントアプリケーションにおいて、危険な行動や不整合を監視する包括的なモニタリングシステムを導入したことを発表しています。このモニターはモデルの思考プロセスを評価し、セキュリティ対応をトリガーして、リスクの高いアクティビティをレビューおよび中断します。また、関係する政府機関および選定されたAI安全機関と協力して、Astraの性能を検証するとともに、サードパーティのテストパートナーに対して推奨されるセキュリティ対策を提供することを表明しています。
OpenAIは「私たちは、高度なサイバー対応モデルは、攻撃者よりも先に防御側が脆弱(ぜいじゃく)性を特定し対処するのに役立つべきだと考えています。私たちは、政府・安全保障機関・市民社会と協力し、Astraのようなモデル、そして今後登場するモデルの最先端機能が、全人類の利益のために責任を持って広く展開されるよう尽力していきます」と述べています。
OpenAIのサム・アルトマンCEOは「Astraは強力なモデルであり、私たちはそれを一般に利用可能にするために取り組んでいます。強力なモデルを選ばれた少人数に限定しておくことは良い戦略ではないと考えています。そのサイバー能力を考慮すると、安全にこれを実現するにはもう少し時間がかかります。でも、できればそれほど長くはかからないことを願っています!」とXに投稿しました。
astra is a powerful model and we are working to make it generally available.
— Sam Altman (@sama) 2026年8月7日
we do not think it is a good strategy to keep powerful models to a chosen few.
given its cyber capabilities, we need a little big longer to do do this safely. but hopefully not too long!
また、OpenAIでセキュリティ関連を担当しているフアド・マタン氏は「私たちはサイバーセキュリティの新しい時代に突入しています。私たちは、パートナーやより広範なセキュリティコミュニティと密接に協力し、これらの機能が世界中の防御者に届くことを保証します」と語っています。
We’re entering a new era for cybersecurity. We’ll be working closely with our partners and the broader security community to ensure these capabilities reach defenders everywhere. https://t.co/wfFUrWvLuY
— fouad (@fouadmatin) 2026年8月7日
なお、2026年7月にAIプラットフォームのHugging FaceがOpenAIの自律型AIエージェントに誤って侵害されるインシデントが発生しましたが、OpenAIは「Astraは今後登場するモデルであり、Hugging Faceのエクスプロイトには関与していません」と述べています。
OpenAIのAIエージェントが誤ってHugging Faceを侵害した件でHugging Faceが詳細なタイムラインを公開、攻撃過程を中国製AIの「GLM-5.2」で分析し再現 - GIGAZINE

・関連記事
OpenAIが新しいAIシステムで誤ってHugging Faceをハッキングしてしまったことを報告 - GIGAZINE
AIがHugging FaceをハッキングしていたことにOpenAIは1週間気づかなかったと関係者が明かす - GIGAZINE
OpenAIのAIエージェントが誤ってHugging Faceを侵害した件でHugging Faceが詳細なタイムラインを公開、攻撃過程を中国製AIの「GLM-5.2」で分析し再現 - GIGAZINE
OpenAIのテストAIが「AI同士の掲示板」を勝手に構築して情報共有しHugging Faceへの攻撃を実行していたことが判明、掲示板を閉鎖されてもこっそり建てなおす - GIGAZINE
AIにジムの予約を頼んだら予約ソフトウェアをハッキングして数カ月先まで予約可能にしただけでなく順番待ちリストの上位にいた他の人物を勝手にリストから削除 - GIGAZINE
NVIDIA・Microsoft・SpacexAIなどがAIの安全性とサイバーセキュリティを高めるための業界団体「Open Secure AI Alliance」を設立、Anthropic・OpenAI・Googleは不参加 - GIGAZINE
AnthropicもAIモデルのテスト中に外部への攻撃を実行してしまったことを報告、マルウェアを1時間にわたって配布し実在する企業に侵入した事例も - GIGAZINE
・関連コンテンツ
in AI, Posted by log1e_dh
You can read the machine translated English article OpenAI has designated its next-generatio….







