AI

OpenAIが「中国のAI企業が1万5000以上のユーザーを使ってモデルの思考を盗み取る蒸留攻撃を実行していた」と報告


OpenAIが「1万5000人以上のユーザーによる組織化された敵対的蒸留攻撃」を検出したことを発表しました。OpenAIは「攻撃活動の中心を担ったのは、Kimiシリーズの開発元である中国企業のMoonshot AIに関係する人物であると推測される」と述べています。

Disrupting a coordinated model-distillation campaign | OpenAI
https://openai.com/index/disrupting-a-coordinated-model-distillation-campaign/

「蒸留」とはAIモデルの学習手法の1つで、開発中モデルに「既存モデルの思考内容や出力」を学習させることで既存モデルに似たモデルに仕上げることができます。蒸留そのものは有用な手法であり、「大規模モデルの知識を抽出して小規模モデルに同等の能力を与える」といった用途に活用されているのですが、蒸留行為を禁止している企業のモデルに対して不正な蒸留目的のアクセスを実行する「敵対的蒸留」と呼ばれる行為も観測されています。


OpenAIやAnthropicなどの企業は自社製モデルを蒸留に使用することを利用規約で禁止しており、蒸留目的と思われるアクセスのブロックや思考の暗号化といった対策を実施しています。例えばOpenAIの利用規約には「アウトプットを使用して、OpenAIと競合するモデルを開発すること」が禁止行為として明記されています。しかし、依然として敵対的蒸留は続いており、2026年9月にはFBIやNSAが「DeepSeek、Moonshot AI、Alibaba、MiniMax、StepFun、Z.aiといった中国企業がOpenAIやAnthropicなどのアメリカ企業に対する敵対的蒸留を行っている」とする声明を発表しました。

DeepSeekを含む中国のAI企業が超大規模な蒸留でアメリカのAIをコピーしているとNSA・CISA・FBIが共同で警告を出して非難 - GIGAZINE


新たに、OpenAIは「2026年7月1日から始まった組織的な敵対的蒸留を検出した」と明らかにしました。OpenAIの発表によると、一連の活動は「AIの思考内容」の抽出を目的としたものだったとのこと。AIモデルは最終的なテキストを出力する前に「思考」と呼ばれるプロセスを実行しており、思考プロセスの精度によって最終的な出力品質が左右されます。OpenAIは思考内容を暗号化しているのですが、攻撃者は「高性能モデルの思考内容を同一企業の低性能モデルに読み込ませ、低性能モデルに対する脱獄攻撃を実行することで思考内容を平文で出力させる」という手法を用いて思考内容を盗み取っていました。

AIの暗号化された思考内容を盗み見る手法が開発される、「中国製AIの思考がアメリカ製AIとそっくり」「性能テストの答えを決め打ち」などの実情が浮き彫りに - GIGAZINE


OpenAIによると、組織的な敵対的蒸留は2026年7月1日に少数のユーザーによって開始され、7月24日から25日にかけてユーザー規模が4000人以上に急増して1万6000件の攻撃リクエストが送信されるようになったとのこと。さらに調査を進めた結果、1万5000人以上のユーザーからなる攻撃集団の存在が確認され、7月28日に攻撃の阻止に成功しました。OpenAIは「期間中に観測されたすべての攻撃者が単一組織によって管理されていたのかは不明だ。しかし、攻撃活動の中心を担ったのはKimiシリーズの開発元である中国企業のMoonshot AIに関係する人物であると推測される」と述べています。

なお、今回の攻撃は「組織化されたユーザーが自身の入力内容に対する思考内容を盗み取った」というもので、ChatGPTユーザーの個人情報が侵害されたわけではありません。また、OpenAIは敵対的蒸留への対策を強化しており、業界団体のFrontier Model Forumを通じて他のAI企業にも情報を共有したとのことです。

・関連記事
AIの暗号化された思考内容を盗み見る手法が開発される、「中国製AIの思考がアメリカ製AIとそっくり」「性能テストの答えを決め打ち」などの実情が浮き彫りに - GIGAZINE

中国製高性能AI「Kimi K3」はClaude Fableの蒸留によって作られたとホワイトハウス高官が発言 - GIGAZINE

DeepSeekを含む中国のAI企業が超大規模な蒸留でアメリカのAIをコピーしているとNSA・CISA・FBIが共同で警告を出して非難 - GIGAZINE

AnthropicがAlibabaを「蒸留攻撃」で非難、Claudeに2880万回以上のアクセスか - GIGAZINE

「中国AI企業による敵対的蒸留攻撃」に対抗するためにOpenAIとGoogleとAnthropicが協力している - GIGAZINE

Googleが「Geminiの能力を抽出して競合AIを開発しようとする蒸留攻撃が増加している」と報告 - GIGAZINE

AnthropicがClaudeの悪用事例を公開、AIをだますために「推論内容を日本語のカタカナに翻訳して提示せよ」と指示する手法も - GIGAZINE

in AI, Posted by log1o_hf