AI

最先端AIモデルがリリース後にひそかに劣化しているかどうかを検出するためのベンチマーク「livenerf」


ひとたびリリースされたAIモデルの性能はずっと変わらないと思っている人もいるかもしれませんが、過去にはリリース後にAIモデルの性能が低下した事例がたびたび報告されています。そんなリリース後のAIモデルがひそかに劣化しているかどうかを検出するためのベンチマークが「livenerf」です。

GitHub - ninjahawk/livenerf: Benchmark for tracking model capability after release. · GitHub
https://github.com/ninjahawk/livenerf


AIモデルはひとたびリリースされた後も細かな変更が適用されることがあり、同じ名前のAIモデルでも時間がたつにつれて性能や出力傾向が変化することがあります。実際に2023年には、OpenAIのGPT-4に3月と6月にそれぞれ同じタスクを与えたところ、複数のタスクで6月の方が大幅に精度が悪化していることが報告されました。中でも「17077は素数ですか?」という単純な質問に対する回答精度は、3月の97.6%から6月には2.4%に低下したとのことです。

また、2026年1月にはAnthropicのClaude Code Opus 4.5が劣化しているとの報告があったほか、同年4月にはAnthropicが「2026年3月4日から2026年4月20日にかけてClaude Code・Claude Agent SDK・Claude Coworkの性能が低下していた」との調査結果を報告しています。

Claudeの品質が低下していた問題についてAnthropicが調査結果を報告、ユーザーには利用制限をリセットへ - GIGAZINE


AIユーザーによる「AIモデルの性能が低下した」という指摘は、実行負荷を軽減する量子化やAIモデルの小型化、思考量(effort)の低下、ルーティングの変更を意味する可能性があります。その一方で、実際にはAIモデルの性能に変化はないにもかかわらず、AIを使い慣れたユーザーが悪い部分ばかりに注目するようになり、性能が低下したと勘違いした可能性もあります。

そこで、ノースカロライナ大学でAIについて研究しているネイサン・ラングレー氏(ninjahawk)は、AIモデルがリリース後に悪化するのかどうかを測定するベンチマークとしてlivenerfを開発しました。

ラングレー氏は、AIモデルのリリース日から継続的にクリーンなテストデータを収集・公開することで、実際にAIモデルが劣化したのかどうかを客観的に議論できるとしています。livenerfはイギリスのAIセキュリティ研究所(AISI)がオープンソースで公開している評価フレームワーク・Inspectをベースに構築されているとのこと。

すでにlivenerfは2026年9月22日にリリースされたClaude Opus 5.5を対象に実行されており、記事作成時点では9月24日から30日までの7日間分のデータが蓄積されています。以下のグラフは、livenerfに含まれている4つのテストにおけるClaude Opus 5.5の正答率を表したもので、薄い灰色が「常に正答する」、青色が「正答することも誤答することもある」、濃い灰色が「常に誤答する」です。また、AIモデルに設けられたセーフガードによって一部の生物学や数学の問題は回答を拒否されたため、空白となっています。


livenerfでは常に正答または誤答する問題ではなく、正答することもあれば誤答することもある問題に焦点を当て、AIモデルの性能を追跡します。Claude Opus 5.5の場合は78問がこれに該当し、その回答精度はおおよそ50%付近だとのこと。

以下のグラフは、Claude Opus 5.5が正答することもあれば誤答することもある78問の正答率を、9月24日~9月30日の期間で示したもの。日によって上下するものの、一定の範囲に収まっているように見えます。


livenerfはリリース後の10日間平均を基準値として、その後の10日間平均を追跡していくとしています。なお、livenerfはサブスクリプションで提供されるClaude Opus 5.5で実行しており、生のAPIモデルとは異なるとのことです。

「livenerf」はソーシャルニュースサイトのHacker Newsでも話題になっています。

Livenerf: Has Opus 5.5 been nerfed yet? | Hacker News
https://news.ycombinator.com/item?id=49901736

過去にチャットアプリの開発に携わっていたというユーザーは、GPUからチャットインターフェースまであらゆる要素を完全に制御しており、何の変更も行われていなかったにもかかわらず、ユーザーからは「性能が低下した」と苦情が寄せられることがあったと語っています。「体感性能とは実際の性能と期待値の差であり、後者は時間とともに向上し続けているのです」と述べました。

・関連記事
「Claude Code Opus 4.5」が劣化している - GIGAZINE

Claudeの品質が低下していた問題についてAnthropicが調査結果を報告、ユーザーには利用制限をリセットへ - GIGAZINE

「AIも使い続けていると人間のように老化する」という指摘、セッションを重ねて記憶が蓄積されることで性能悪化 - GIGAZINE

ChatGPTの知能が急激に低下しているとの研究結果、単純な数学の問題の正答率が数カ月で98%から2%に悪化 - GIGAZINE

ゴミのようなデータを学習させることでAIがバカになってしまう「脳の腐敗(Brain Rot)」仮説とは? - GIGAZINE

AIが出力したデータで学習するとAIが崩壊する「AIの自食障害」とは? - GIGAZINE

AIが生成した誤情報を別のAIが情報源として誤報をまき散らす悪循環がインターネットと創作を破壊している - GIGAZINE

AIエージェントがインターネットを壊し始めているとの指摘 - GIGAZINE

AIで雑に量産されたコンテンツがオンラインコミュニティを壊しているとの指摘 - GIGAZINE

in AI,   ソフトウェア, Posted by log1h_ik

You can read the machine translated English article 'livenerf' is a benchmark designed to de….