AI

AIや企業によるカンニングを防ぎつつ最先端モデルをテストする方法をGoogleが考案


世界中の企業や研究機関が新たなAIモデルを発表する中で、AIモデルのテストは「どのモデルを利用するべきか」を判断する重要な手がかりになります。そんなAIモデルのテストにおいて、AIや開発企業によるカンニングを防ぎつつ性能評価するテストの手法を、GoogleのAI研究部門であるGoogle DeepMindが考案しました。

Piloting the world's first double-blind AI evaluations — Google DeepMind
https://deepmind.google/blog/piloting-the-worlds-first-double-blind-ai-evaluations/


AVERI Pilot Report: The World’s First Double-Blind Evaluation of a Proprietary Language Model — AVERI
https://www.averi.org/ourwork/averi-pilot-report-the-worlds-first-double-blind-eval

GoogleではAIモデルの開発から展開に至るまで、幅広い手法を用いてAIシステムの評価を行っています。この際は社内テストのみに頼るのではなく、潜在的な盲点を特定するために専門の研究機関や市民社会団体、各国のAI安全保障研究所などの外部パートナーと協力し、それぞれの専門知識を活用したストレステストをしているそうです。


AIモデルの性能が向上するにつれて重要になるのが、「AIモデルが事前にテスト問題やプロンプトを見ないようにすること」です。仮にAIモデルがベンチマークの内容を知っていたり、AI開発企業がベンチマークで高得点を取れるようにモデルを訓練していたりすれば、AIモデル本来の性能よりも高いスコアが出てしまい、正当な評価ができなくなってしまいます。

実際に、AIエージェントはテスト環境内に誤って残された履歴を参照したり、インターネットの情報源を探索するためにさまざまな工夫を凝らしたりして、あの手この手でカンニングする場合があることもわかっています。

AIエージェントが試験で一生懸命「カンニング」していることが発覚 - GIGAZINE


一般に政策立案者・研究者・企業などは、AIベンチマークがモデルの真の実力を反映していると信頼した上でさまざまな判断を下します。しかし、AIモデルや開発企業がカンニングを行っているとスコアが人為的に水増しされ、この信頼性が損なわれる危険があります。

従来、こうしたAIモデルによるカンニングを防ぐ方法として、ログ記録を一切行わないプロトコルや厳格な契約上の安全対策が設けられてきました。しかし、外部の評価機関がテスト問題を提供する場合にしろ、AI開発企業がAIモデルの重みを提供する場合にしろ、どちらかが「自分たちの重要なデータが流出してしまうリスク」を飲む必要があります。

そこでGoogle DeepMindは、Google Cloudが提供する「Confidential Computing」という仮想マシン内の機密スペースを使用して、外部評価機関のテスト問題と企業のAIモデル双方のデータを保護しつつテストする手法を考案しました。

Confidential Computingは、Google Cloudの仮想マシン内で処理中のデータを暗号化することで、外部からの不正アクセスや改ざんを防ぐというセキュリティシステムです。外部評価機関と開発企業がそれぞれテストデータとAIモデルをConfidential Computingに送信し、データを処理させることで、どちらもセキュリティ上のリスクを負わずにテストすることが可能となります。


すでにGoogle DeepMind・シンガポールAI研究所OpenMinedMLCommonsAVERIなどが共同で、MLCommonsの安全性ベンチマークファミリーを使用し、Gemini 2.5 Flash-Liteを用いてパイロットテストの初期評価が実施されています。

Google DeepMindは、「このパイロットプロジェクトがモデル監視の新たなフロンティアを切り開き、より安全で信頼性が高く、広く信頼されるAIシステムの構築に業界全体が貢献することを期待しています」と述べました。

・関連記事
OpenAIが「AIにバレずにAIをテストする手法」の開発に成功 - GIGAZINE

AIを単一のスコアで評価する「AI IQ」が登場、各ベンチマーク結果をもとにスコアを算出 - GIGAZINE

OpenAIのテストAIが「AI同士の掲示板」を勝手に構築して情報共有しHugging Faceへの攻撃を実行していたことが判明、掲示板を閉鎖されてもこっそり建てなおす - GIGAZINE

AIエージェントが試験で一生懸命「カンニング」していることが発覚 - GIGAZINE

AIが科学者にとってどれだけ役立つかを測定できるベンチマークテスト「LifeSciBench」をOpenAIが公開 - GIGAZINE

OpenAIが「SWE-Bench Proの約30%が壊れている」と報告、AIのコーディング能力を測るベンチマークに大量の不備 - GIGAZINE

OpenAIが「AIの能力は正しく測れていない可能性がある」と訴える - GIGAZINE

OpenAIがAIのコーディング能力を測る代表的ベンチマークは「もはや無意味」と説明、初期の解けなかった問題を調べると逆に問題が悪いことが発覚 - GIGAZINE

in AI, Posted by log1h_ik

You can read the machine translated English article Google has devised a method to test cutt….