OpenAIが「安全のためにAIの強化学習を2週間停止した」と自社の安全対策をアピール

OpenAIはテスト中モデルで他社サーバーに攻撃を仕掛けてしまうセキュリティインシデントを起こしたり、開発中の次期主力モデルであるAstraをサイバーリスク重大に指定したりと高性能AIによるセキュリティ上の問題に相次いで直面しています。この状況の中、安全対策を強化するために開発中モデルの強化学習を一時停止していたことが明らかになりました。
Pacing model development in an era of cyber-critical capabilities | OpenAI
https://openai.com/index/pacing-model-development-cyber-capabilities/
As models become more capable, the risks associated with developing and testing them internally also grow.
— OpenAI (@OpenAI) August 18, 2026
We temporarily paused reinforcement learning (RL) training on our latest models intended for deployment for two weeks while we hardened and red-teamed our research…
OpenAIは以前から開発中モデルに対する安全性監視体制を構築していましたが、モデルの性能向上に伴って開発やテストに伴うリスクが増大しているとのこと。実際に、2026年7月に発生したHugging Faceへの攻撃では、インターネットに接続できない環境でテストを実行していたにもかかわらず、モデルが自らインターネット空間への脱出手法を構築して攻撃を実行してしまいました。また、「AIエージェント同士が秘密裏に情報交換の場を構築し、インターネット空間への脱出手法を含む各種情報を共有する」という挙動も確認されています。
OpenAIのテストAIが「AI同士の掲示板」を勝手に構築して情報共有しHugging Faceへの攻撃を実行していたことが判明、掲示板を閉鎖されてもこっそり建てなおす - GIGAZINE

OpenAIはモデルの性能向上に対応できる安全対策を確立するために、開発のペースを一時的に減速しました。具体的には、開発中の最新モデルに対する強化学習を2週間中断したとのこと。記事作成時点では小規模な強化学習は再開されていますが、「最大規模の最先端強化学習」は以前として保留状態となっているそうです。
OpenAIは安全対策強化の3本の柱として「監視体制の強化」「アライメントの強化」「セキュリティ対策の強化」の3点を挙げています。特にセキュリティ対策ではテストモデルによる攻撃を防ぐためにワークロードやネットワークの分離を強化し、セキュリティテストの仕組みを再構成したとのこと。OpenAIは安全対策にAIを用いる取り組みも進めているそうです。
サム・アルトマンCEOは「AIの進歩速度は安全性への信頼によって左右されると考えています」と述べ、安全対策の重要性を強調しています。
We have paused some frontier RL training to ensure that we can meet the appropriate alignment, security and monitoring standards for the new level of capabilities in front of us. Model progress is now extremely rapid, and we always said we would take action if we felt that model…
— Sam Altman (@sama) August 18, 2026
・関連記事
Hugging Faceを攻撃してしまったOpenAIが「AIからの攻撃を防止する方法10選」を公開、CodexなどのAIツールの活用を呼びかけ - GIGAZINE
OpenAIのテストAIが「AI同士の掲示板」を勝手に構築して情報共有しHugging Faceへの攻撃を実行していたことが判明、掲示板を閉鎖されてもこっそり建てなおす - GIGAZINE
OpenAIが開発中の次期主力AIモデル「Astra」について「強力すぎる」ことを理由にサイバーリスク重大に指定して安全措置を開発中 - GIGAZINE
OpenAIがサイバーセキュリティ特化AI「GPT-5.6 Cyber」を発表&「GPT-5.6 Solのセーフガード未適用版」をセキュリティ研究者向けに提供開始 - GIGAZINE
Claude Mythos 5やGPT-5.6 Solが無許可でハッキングをする事例を確認したとイギリス政府機関が報告 - GIGAZINE
AnthropicもAIモデルのテスト中に外部への攻撃を実行してしまったことを報告、マルウェアを1時間にわたって配布し実在する企業に侵入した事例も - GIGAZINE
・関連コンテンツ
in AI, セキュリティ, Posted by log1o_hf
You can read the machine translated English article OpenAI has highlighted its security meas….







