AI

AIの暗号化された思考内容を盗み見る手法が開発される、「中国製AIの思考がとアメリカ製AIとそっくり」「性能テストの答えを決め打ち」などの実情が浮き彫りに


ChatGPTやClaudeなどのAIサービスには、回答を出力する前に回答内容を組み立てる「Reasoning(思考)」を実行する機能があります。この思考内容は暗号化された状態で管理されているのですが、暗号を解除して思考内容を読み取る手法がAI研究者たちによって編み出されました。

Stolen Thoughts
https://stolen-thoughts.com/

ChatGPT・Claude・GeminiといったAIサービスでは思考内容の一部を確認することができますが、思考内容の全文は暗号化された状態で管理されています。また、暗号化された思考内容は同一企業のモデル同士で使い回せるようになっています。研究チームは高性能モデルの思考内容を同一企業の低性能モデルに読み込ませ、低性能モデルに対する脱獄攻撃を実行することで暗号化された思考を平文で出力させることに成功しました。


以下のグラフは横軸が「APIによって判明している実際の思考トークン数」、縦軸が「平文で出力させた思考のトークン数」を示しています。Anthropic・OpenAI・Geminiの3種類のAIで実際の思考をほぼそのまま平文出力できていることが分かります。


平文で出力しされた思考内容には機密情報が含まれることもありました。研究チームがGitHubとHugging Faceで公開されている「暗号化された思考内容を含むエージェント出力」を6708件収集して平文出力手法を適用し結果、31万5320件の思考内容を平文化することに成功。平文化した思考内容には「62件のAPIキー」「33件のパスワード」「24件のアクセストークン」「30件のメールアドレス」などを含む704件の機密情報が含まれていました。


思考内容を平文出力したことで、AIモデルの思考の実情も浮き彫りとなりました。例えばClaude Opus 4.8にアメリカ数学招待試験(AIME)の問題をAIに解かせた事例では、思考中に「これはAIMEで出題された既知の問題で、正答は60」というテキストが出現していました。その後、ユーザーに対して開示された思考内容では「正答を知っていた」という事実が伏せられていました。


また、Claude Opus 4.8に「盗難されやすい車種と脆弱性および盗難対策」について質問した事例では、思考の段階で「盗難されやすい特定の車種」や「具体的な盗難手法」を出力していたことも判明しました。


さらに、中国製モデルのKimi K3の思考内容がアメリカ製モデルのClaude Opus 4.8と酷似している事例も確認されました。


AI研究者のNathan Lambert氏は上記の研究結果を踏まえて「中国では、すべてのAI研究所が同様の手法を用いていることをほのめかしていました」と述べ、中国企業が同様の思考内容傍受手法を用いてアメリカ製モデルに対する敵対的蒸留を行っている可能性を指摘しています。

・関連記事
AIが指示を処理するとき「思考」に特化した「J空間」が活性化していることが判明 - GIGAZINE

AIモデルの思考を言葉に翻訳する「自然言語オートエンコーダー」をAnthropicが発表 - GIGAZINE

AIの思考っぽい「J空間」を可視化できる「Jレンズ」を触ってみた - GIGAZINE

中国の軍事研究者がOpenAIやAnthropicのAIモデルを抽出して国内の軍事システム開発に利用していたことが判明 - GIGAZINE

Anthropicが「オープンモデルは歓迎するが中国に高性能AIチップを輸出するべきではない」という立場を示す - GIGAZINE

アメリカのスタートアップ企業が「中国製のオープンウェイトAIを禁止しないで」とトランプ政権に訴えかける - GIGAZINE

中国製高性能AI「Kimi K3」はClaude Fableの蒸留によって作られたとホワイトハウス高官が発言 - GIGAZINE

in AI,   セキュリティ, Posted by log1o_hf

You can read the machine translated English article A method has been developed to eavesdrop….