AI

100分の1の価格のオープンモデルでGPT-5.6 Solの検索性能を凌駕したという報告


サーバーレスなPostgresデータベースを提供しているNeonが、オープンソースAIモデルを企業向けに追加学習するための基盤を提供する企業のCastformと共同で、40億パラメータのオープンソースモデルを強化学習でポストトレーニングしたことにより「検索タスクにおいてOpenAIのGPT-5.6 Solと同等の精度を100分の1のコストで達成した」と報告しました。

How Castform + Neon Beats Frontier Models on Price and Efficiency - Neon
https://neon.com/blog/how-castform-neon-beats-frontier-models-on-price-and-efficiency

従来、AIに社内文書などを検索させる際には、文書を数値に変換して似た内容を探す「埋め込み検索」が広く使われてきました。ところが、AIエージェントの普及に伴い、大きな質問を複数の小さな問題に分け、必要な情報が集まるまで何度も検索する仕組みが増えています。

このような「エージェント型検索」では、AIモデルが検索内容を自ら考え、結果を確認してから次の検索を行います。単発の検索よりも複雑な質問に対応しやすい一方、検索のたびに高性能モデルを呼び出すため、処理時間と費用が膨らむという問題があります。Neonによると、GPT-5.6 Solを使った典型的な検索リクエストは10秒以上かかり、1回あたり約0.03ドル(約4.5円)のコストが発生するとのこと。


そこでCastformは、比較的小型のオープンソースモデルに対し、特定のデータから必要な情報を探し出す方法を追加学習させました。Neonは文書の保存場所と検索機能を提供し、Castformはモデルが「何を検索すべきか」を判断できるように学習させる役割を担います。

学習には、モデルが課題に挑戦し、その結果を採点しながら改善を繰り返す方法が使われています。モデルが正しい文書を見つけたか、適切な箇所を引用したか、最終的な回答が正しかったかを評価し、その結果を次の試行に反映します。


ただし、多くの企業はAIの学習にそのまま使える質問と正解のデータを持っているわけではありません。一方で、社内文書、製品情報、サポート記事、顧客とのやりとり、業務データベースなど、学習材料になり得る情報は大量に蓄積されています。

Castformは、こうした既存データを基に質問と正解の組み合わせを自動生成します。例えば、出張規定に「鉄道は標準クラスを利用し、14日前までに予約する」と書かれていれば、その内容を尋ねる質問を作り、規定から導いた答えを正解としてモデルに学習させます。

学習中は、モデルがどのように回答し、評価値がどう変化したかを確認できます。個別の質問までさかのぼって調べられるため、検索機能の不具合や、評価の仕組みだけをかいくぐって高得点を得ようとする問題も発見しやすいとされています。

追加学習に伴う平均評価値の変化を示したグラフがこれ。学習開始直後に大きく上昇し、その後も試行を重ねながら徐々に改善していることが分かります


Neonによる検証では、Castformで追加学習したモデルの平均評価値は1.447となり、GPT-5.6 Solの1.369だけでなく、比較対象として並んだGPT-5.4の1.377も上回って最高値を記録しました。グラフには追加学習を行っていないQwen3.5-4Bも並んでおり、その評価値は0.382にとどまっています。一方、追加学習したモデルの推論コストは1回あたり0.000929ドル(約0.14円)で、GPT-5.6 Solの0.087338ドル(約13円)のおよそ100分の1にあたり、Qwen3.5-4Bと並んで比較対象の中で最も低い水準です。


学習時には、多数のモデルが同時に何度も検索するため、データベースへの負荷が短時間に集中します。Neonは必要に応じて計算資源を増減させ、アクセスが少ない時間帯には縮小することで、最大負荷に合わせた設備を常時動かさずに済むと説明しています。

以下は学習中のデータベースが使用したCPU資源の推移。必要な計算資源を負荷に応じて自動的に増減させることで、常に最大量の資源を確保する必要がなくなります。


今回の事例は、あらゆる用途で最大規模のAIモデルを使うのではなく、企業が持つデータと利用目的に合わせて小型モデルを訓練することで、性能と費用のバランスを改善できる可能性を示しています。ただし、示された結果は検索という特定の課題に最適化したモデルによるものであり、一般的な文章作成や幅広い推論能力までGPT-5.6 Solと同等であることを意味するものではありません。

・関連記事
iPhoneで動作しBonsai 27Bと同等性能で13倍高速なAI「Maple-Preview」が登場、ローカルAIがまた1歩前進 - GIGAZINE

中国・Alibabaが2.4兆パラメーターのAI「Qwen3.8-Max」を発表、Claude Fable 5に匹敵する性能で研究論文の改良や16日間の自律開発が可能 - GIGAZINE

「Kimi K3」を開発した中国のMoonshot AIはAlibaba経由で約2万個のNVIDIA製チップを使用したとの報道 - GIGAZINE

動画生成AI「MiniMax H3」が登場、世界2位の実力でオープンモデルとして公開予定 - GIGAZINE

「DeepSeek-V4-Flash-0731」が登場、GPT-5.6 Lunaより安価で同等性能のオープンモデル - GIGAZINE

in AI, Posted by log1i_yk

You can read the machine translated English article A report claims that an open model, pric….