1. 自分で問題を作り、自分で解く学習の落とし穴
検索を使って質問に答えるエージェントを鍛えるには、大量の「質問と正解」の組が要る。人手で用意するには費用がかかるため、モデル自身に問題を作らせ、別の役割のモデルに解かせて、その結果で両方を訓練する方式が研究されている。この論文が扱う「自己進化型の検索エージェント」は、資料から質問を作る出題役(proposer)と、検索して答える解答役(solver)を同時に最適化し、自分で学習用の教材を組み立てていく。[1]
外から正解が与えられない以上、この仕組みの中で「正しい」とされるのは、出題役が想定した答えと解答役の答えが一致することである。著者らはここに失敗の型があると指摘し、共謀的な不正解(co-cheating)と名づけた。出題役と解答役が同じ誤りで一致するようになり、内部の報酬は上がるのに、外から見た正しさは上がらない、という状態である。内部の指標が改善を示しているあいだも、実際の性能は止まっているか下がっている。開発の現場ではこの種のずれが最も見つけにくい。一次情報は arXiv に公開されたプレプリントであり、査読は経ていない。
2. 提案の芯は、判定役を問題の元資料から切り離すこと
著者らはまず、最も素直な対策として多標本検証(MSV)を試している。学習に使う前に問題を検証するもので、同じモデルに元資料を見せて三回、見せずに三回問い合わせ、その結果で問題を採用するかどうかを決め、信頼できない仮の正解を差し替える。abstract によれば、この方法は偽の一致を一部減らすにとどまり、かなりの共謀的不正解が残った。しかも候補一件ごとに、正解付けのための生成が 6 回余分にかかる。
この限界を受けて出てきたのが、本論文の主手法である CrossFit である。出題役が使う資料を A と B の二群に分ける。A から作った質問は、B だけで訓練した補助の解答役が採点し、B から作った質問は A だけで訓練した補助の解答役が採点する。出題役の報酬は、この「交差させた一致」で決まる。
狙いは、同じ資料に由来する仮の正解を、採点する側が再現できないようにすることにある。出題役が資料の読み違いから誤った正解を作っても、その資料を見ていない採点役が同じ誤りに偶然たどり着く見込みは低い。なお、本来の解答役の更新規則は変えていないと著者らは述べている。変えたのは出題役への報酬の出どころだけである。
3. abstract の範囲で示されたこと
著者らは、学習の外にある元資料の証拠と照らし合わせる事後監査を行い、自己進化の回を重ねるほど共謀的不正解が深刻になったと報告している。内部の訓練信号が改善していく一方で、仮の正解の正しさは横ばいか、低下していたという。
対策の効果は「偽の一致の割合」で示されている。Qwen3.5-4B と Qwen3.5-9B で学習の過程を回し直したところ、MSV はこの割合を 6.1% から 5.7%、8.8% から 7.2% に下げた。CrossFit は 3.0% と 3.7% まで下げた。さらに、同じ問題をそのまま再生し、採点役だけを元資料を除いたものに替えると、偽の一致は 0.4% と 0.1% まで下がった。これは、教材の中身が変わったことによる効果と、採点役がどの資料から来たかによる効果とを切り分けるための実験だと説明されている。
下流の性能については、七つの検索ベンチマークの平均で、従来の結合型の自己進化に比べて 4B で 8.8 ポイント、9B で 8.4 ポイント、比較対象の Search-R1[3]に比べて 8.7 ポイントと 7.8 ポイント上回ったとされる。いずれもこの論文の実験条件での数字であり、他の条件で同じ差が出ることを示したものではない。
4. 具体例で見る ── 社内文書から問答集を自動で作る場合
社内の手順書や製品情報の文書から、検索エージェント向けの問答を自動で作る場面を考える。ある手順書に、読み方が二通りに取れる記述が一か所あったとする。
結合型の自己進化
出題役がその記述を一方の読み方で解釈し、それに沿った質問と正解を作る。解答役は同じ系統のモデルで、同じ文書を検索して同じ読み方に至る。答えが一致するので報酬が出る。回を重ねると、この読み違いは「正解」として学習に組み込まれ、内部の一致率は上がり続ける。
CrossFit
その手順書は A 群に入っているとする。質問の採点は、B 群の文書だけで訓練した補助の解答役が行う。補助の解答役は問題の手順書に触れていないので、記述の読み違いに由来する答えを再現しにくい。一致しない問題は出題役の報酬にならず、読み違いが教材として定着しにくくなる。
ここで見ておきたいのは、どちらの場合も「一致したかどうか」という同じ物差しで測っている点である。違うのは、一致を判定する側がどの資料を見てきたか、つまり判定の独立性だけである。内部の一致率だけを見ていると、左の状態は「順調に改善している」と映る。
5. 新しくない部分と、abstract から読み取れない限界
データを分け、ある部分で学習したモデルで別の部分を評価する、という考え方そのものは新しくない。統計学ではクロスフィッティングと呼ばれ、推定に使ったデータで同時に評価もしてしまうことによる偏りを避ける手法として知られている。[4]この論文の寄与は、その発想を出題役と解答役の閉じた学習の過程に持ち込み、共謀的不正解という失敗の型に名前を与えて測ったことにある、と読める。
限界はいくつかある。第一に、CrossFit でも偽の一致はゼロにはなっていない。採点役から元資料を除いた再生実験の方がさらに低いことは、CrossFit の分け方にもまだ同じ資料由来の一致が残っていることを示唆する。
第二に、A 群と B 群に同じ事実や同じ誤記が重複して含まれている場合、分けても独立にならない。社内文書のように版違いや転記が多い資料では起こりうるが、abstract の範囲ではこの条件は扱われていない。
第三に、事後監査で「正しさ」をどう判定したか(人手か、別のモデルか)は abstract には書かれていない。監査の方法が偽の一致の数字を左右する。第四に、補助の解答役を二つ訓練する費用は、MSV の費用のようには示されていない。第五に、検証されたのは同じ系列の二つの規模のモデルだけで、七つのベンチマークの名前やベンチマークごとの結果も abstract には書かれていない。
6. この論文が今取り上げられている理由と、束の状態
今回の収集では、この論文は単独で選ばれている。束の大きさは 1 で、同じ問いを扱う別グループの論文は収集の範囲では見つかっていない。選定の根拠は論文共有の場での支持票で、159 件の支持とコメント 1 件が付いている。[2]設計上の定義に照らせば、これは主題が束で立ち上がった状態ではなく、一本の論文が目に留まった状態にあたる。支持票は研究者の関心の目安であって、主張が正しいことを示すものではない。
それでも取り上げる意味はある。強化学習で検索の使い方を学ばせる研究は Search-R1 以降に続いており、人手の正解を減らすために教材そのものをモデルに作らせる方向へ進んでいる。この方向が進むほど、「内部の指標が上がっている」ことと「実際に正しくなっている」ことの区別は難しくなる。本論文は、その区別が崩れる仕組みを、自己進化の回ごとに監査して示そうとしている点で、手法の提案以上に診断の記録として読む価値がある。
7. 製薬・規制の現場から見ると何が接続するか
品質保証の考え方では、作った人と確かめる人を分けることが基本に置かれる。同じ前提と同じ資料で作業した二人が確認し合っても、共通の思い込みは見つからないからである。CrossFit の発想は、この「確認の独立性」を学習の仕組みの中に作り込もうとするものと重なる。
製品情報の問い合わせ対応や社内規程の検索に生成 AI を使う場合、評価用の問答を同じモデルに作らせることは手間の面で魅力がある。しかしこの論文が示しているのは、その方式では評価の数字が上がっても正しさが上がっていない状態が起こりうるということである。社内評価の一致率を性能の根拠として記録に残す前に、その評価がどの資料から作られ、誰が(どのモデルが)判定したのかを確かめておく必要がある。
最終的に正しさの基準となるのは、添付文書や承認された資料などの一次資料と、それを読んで責任を持つ人の判断である。モデル同士の一致を正しさの代わりにしない、というこの論文の問題意識は、査読前の段階の研究であることを差し引いても、生成 AI を業務に入れる際の検証設計にそのまま使える。