1. 言葉にしない推論は、何を見ているのか確かめられない

画像と文章の両方を扱う大規模言語モデル(MLLM)は、図や写真について問われると、途中の考えを文章として書き出してから答えることが多い。いわゆる思考の連鎖である。これに対して潜在視覚推論(LVR)は、途中の計算を言葉ではなく連続値の「潜在トークン」で行わせる方式で、書き出す手間を省き、言葉にしにくい視覚的な情報を保ったまま推論できる、と期待されてきた。

ただし代償がある。文章で書かれた思考なら、人が読んで「どこを見て、どう考えたか」を点検できる。潜在トークンは人が読めないので、モデルが本当に画像の証拠を使って考えているのかを外から確かめにくく、何を学ぶべきかを直接教えることも難しい。この論文は、その確かめにくさを正面から測るところから始めている。一次情報は arXiv に公開されたプレプリントであり、査読は経ていない。[1]

2. 見つけた問題と、提案の芯

著者らはまず潜在トークンの振る舞いを分析し、「潜在の証拠と手柄の割り当てのずれ」(latent evidence-credit gap)と呼ぶ問題を見つけた。正解が変わるように画像を書き換えても、潜在トークンはそれに弱くしか反応しない、というものである。画像を見て考えているはずの部分が、画像の変化に鈍いということになる。

著者らは、この原因を GRPO による訓練で明示的な教師がないことにあると仮説を立てている。GRPO は、複数の回答を比べて最終的な答えの良し悪しで報酬を与える強化学習の手法である。[5]最終の答えに対する報酬だけでは、どの視覚的証拠を保つべきか、潜在トークンのどこに手柄を割り当てるべきかの手がかりが少なすぎる、というのが著者らの見立てである。

そこで提案されたのが ReaLVR である。モデルが自分で生成した潜在の推論の流れそのものに、視覚的証拠についての教師を与える。その際、二種類の対比を使う。正解とモデル自身が出した誤答を比べて、どこで強い教師が必要かを決める。関係する視覚的証拠と、問いに合わない証拠を比べて、何を保つべきかを指定する。

3. abstract の範囲で示されたこと

三つのモデル系列で、ReaLVR は評価に用いた既存の LVR 手法を一貫して上回ったと報告されている。Qwen2.5-VL-7B では、五つの課題の平均で 63.7% と、比較した中で最も高い値になったという。

著者らはまた、潜在空間での視覚推論を大規模化したのは自分たちが初めてであり、最大 235B の規模のモデルまで改善が続いたと主張している。改善の幅は abstract には書かれていない。「初めて」という位置づけも著者ら自身の主張であり、第三者が確認したものではない。

追加の分析として、問いに敏感に反応する潜在トークンの位置が増えたこと、関係する画像領域との対応が強まったこと、最も注目される潜在トークンについて固定した文脈への依存が強まったことが挙げられている。いずれも、潜在トークンが画像の証拠をより使うようになった、という解釈を支える材料として示されている。

4. 具体例で見る ── 図表を読ませて答えさせる場面

製品資料に載っている臨床試験の図、たとえば二群の推移を示すグラフを MLLM に読ませ、「どちらの群が上回っているか」を答えさせる場面を考える。潜在推論のモデルは途中の考えを書き出さないので、答えが合っていても、それが図を読んだ結果なのかは分からない。

画像を書き換えて確かめる

確認者:元の図を見せて「どちらの群が上回っているか」と尋ねる。
モデル:「A 群です」
確認者:二本の線の位置を入れ替え、正解が B 群になるように図を書き換えて、同じことを尋ねる。
証拠に鈍いモデル:「A 群です」(図が変わっても答えが変わらない)
証拠を使うモデル:「B 群です」

前者は、図ではなく問いの文面や学習時の傾向から答えている疑いがある。論文が言う「潜在の証拠と手柄の割り当てのずれ」は、この確かめ方を潜在トークンの単位で行ったときに見えた鈍さだと理解できる。ReaLVR は、このような書き換えに反応すべき箇所に教師を与えて、鈍さを減らそうとしている。

5. 新しくない部分と、abstract から読み取れない限界

入力を書き換えて出力が変わるかを見る方法は、モデルの判断根拠を調べる手段として以前から使われてきた。正解と誤答を対比させて学習の信号を強めることも、それ自体は広く知られた考え方である。この論文の寄与は、それらをモデル自身が生成した潜在の推論の流れに当てはめ、どこに・何を教えるかを分けて設計した点にあると読める。

限界はいくつかある。第一に、「ずれ」の測り方、すなわちどのような書き換えで、反応の強さをどう定義したかは、abstract の範囲では示されていない。第二に、63.7% という値と並べるべき比較手法の数値や、五つの課題の名前は abstract に書かれていない。どの程度上回ったのかは本文を読まないと判断できない。

第三に、改善が進んでも潜在トークンが人に読めるようになるわけではない。画像領域との対応が強まった、という分析は、モデルの内部が画像の証拠を使っていることを示唆するが、推論の中身を人が点検できるようになったことを意味しない。対応の強さは相関の指標であり、原因を示すものでもない。第四に、GRPO の教師不足が原因だという説明は、著者ら自身が「仮説」と書いている。

第五に、実装リポジトリは公開されているが、確認した時点の説明では学習済みモデルは「近日公開」とされていた。[3]結果を第三者が同じ条件で再現するには、現時点では学習からやり直す必要がある。

6. この主題が今なぜ束になっているか

今回の収集では、別のグループによる論文がもう一本、同じ束に入った。束の大きさは 2 である。Scaffolding Minds は、潜在の視覚的な目標表現を最適化してマルチモーダル推論を改善するという題の研究で、潜在トークンに何を表させるかを、表現の側から作り込もうとしている。[2]ReaLVR が「潜在の推論に視覚的証拠の教師を与える」側から近づいているのに対し、こちらは「潜在が目指すべき表現を整える」側から近づいていると整理できる。

共通しているのは、潜在推論は答えの正しさだけで訓練すると、何を見ているかが曖昧なまま残るという問題意識である。論文共有の場では 98 件の支持票、実装リポジトリには 7 件の star が付いている。[4]これらは話題になっていることの目安であり、主張の正しさや重要さを示すものではない。

7. 製薬・規制の現場から見ると何が接続するか

資材の審査や医療情報の回答で生成 AI に図表を読ませる場合、問われるのは答えが合っているかだけではない。その答えが資料のどの部分にもとづくのかを、後から示せることが求められる。思考を文章で書き出す方式なら、少なくとも説明の文面は残る。潜在推論はその文面を手放す代わりに、効率や性能を得ようとする方向である。

この論文はその方向の中で、画像の証拠を本当に使わせる工夫を示している。一方で、証拠を使うようになったことと、人がそれを点検できることは別の話である。規制のかかる業務で使うなら、潜在推論の性能向上を待つだけでなく、根拠となった箇所を別の手段で示させる仕組みや、人が一次資料に当たって確かめる手順を残しておく必要がある。

実務にそのまま使えるのは、具体例で示した確かめ方の方である。図や表の内容を正解が変わるように書き換え、答えが追随するかを見る。モデルの種類を問わず、導入前の検証に組み込める。査読前の段階の研究であることを踏まえ、この論文は手法そのものより、何を確かめるべきかを考える材料として読むのが妥当である。