Xuan Liu氏らは9月17日(現地時間)、大規模言語モデル(LLM)の学習効率を高める新手法「GapFT」をarXivで発表した。モデルが単一のサンプルでは解けないものの、複数サンプル(K個以内)でなら解ける問題、すなわち「Pass@K-Pass@1ギャップ」に着目してファインチューニングすることで、限られた計算予算内でPass@1の性能を高める手法だという。
検証可能な報酬からの強化学習(RLVR)を用いた大規模言語モデルの訓練は、近年の事後学習で採用が広がっている手法の一つだ。従来、検証済み応答を用いる事後学習手法は、最初のデコードで既に正解に達していた問題と、K個のサンプル以内で誤りから回復できた問題とを区別せずに同列に扱ってきた。この結果、限られた学習予算の一部が、ポリシーが展開時点で既に解決できている問題を繰り返し学習させる訓練例に費やされ、非効率が生じていたという。
GapFTはこの非効率の解消を狙った手法だ。手法名は、単一サンプルでの正答率を示すPass@1と、K個のサンプルのいずれかが正答であれば成功とみなすPass@Kとの差に着目することに由来するとみられる。ソースとなるチェックポイントによる単一サンプルの結果をもとに訓練データを選定し、ポリシーが1回のサンプルでは失敗するものの、K個以内のサンプルでは解決できる問題に絞ってファインチューニングを行う。訓練例の数や処理トークン数、オプティマイザーのステップ数は既存手法と揃えた上で、Pass@1の性能を最大化するという目的自体は変更していない。
Llama-3.1-8Bを用い、LogiQA 2.0とReClorの各データセットで実験したところ、GapFTはソースモデルに対してPass@1の精度をそれぞれ14.4ポイント、13.9ポイント改善した。同じ学習率と予算条件のもとで均一な検証済みRFT(Reinforced Fine-Tuning)を上回り、データ量を3分の1に抑えた場合でも、検証済みデータを全量用いたファインチューニングに匹敵する性能を示したという。単一デコードでの精度は、ソースモデルにおいてベリファイアで選択したPass@4の精度と一致する水準だった。
Qwen2.5-7Bを用いた3シードでの再現実験でも、LogiQA 2.0とReClorの両タスクで均一RFTに対する明確な優位が維持された。複数のモデルやタスクにわたって有効である可能性があるとしている。
参考: arXiv cs.LG — 2026年9月30日 13:00 (JST)
原文ハイライト"Learning from the Gap Between Pass@K and Pass@1"