図は、長期エージェントが思考の記録を積み上げる入口から始まる。まず決定後も文脈に思考が残り費用が積み上がる問題を示し、次に行動と観測は保ち、凍結した代理モデルの不確かさで思考だけを順位づけて落とす仕組みを描く。続く段は260件の課題での検証で、報酬が0.699から0.718に上がりトークンが最大33.3%減ったことを示すが、単一ベンチマークに限られる限界も添える。最後の段は、結論を外に書き出せば思考は捨ててよいという条件を、資材審査で根拠を台帳に書き出す設計に転用できることを示す。迂回路には、完成後の思考を短くする静的な圧縮という比較対象があり、損失を元の文と比べて測れ新しい行動を生まない。出口は根拠を台帳に書き出した再構成できる判断である。
イメージアブストラクト ── 記事の全体像を 1 枚に(画像を押すと拡大)

済んだ思考が、いつまでも席を占めている

長い作業を任される言語モデルのエージェントは、進むにつれて自分の思考の記録を積み上げていく。どう判断したか、なぜその道を選んだか。それらは決定が実行され、結果が観測された後も、そのまま文脈に残り続ける。文脈が伸びれば推論の費用が上がり、上がった費用は作業が長いほど効いてくる。すでに片が付いた思考のために、毎回同じ料金を払っているという状態である。

ここで素直に思い浮かぶのは、古い思考を削ればよいという手立てである。ところが著者らは、それが単純な要約の問題ではないと述べる。静的な思考の連鎖を縮める話と違い、エージェントの場合は履歴を削るとその後の行動が変わる。削った結果として別の道に入り、別の観測を得て、別の判断をする。だから「どこまで削れるか」ではなく「いつなら安全に忘れられるか」という問いになる。本稿が一次情報とするのは査読を経ていないプレプリントである。

行動は残し、思考だけを落とす

提案の芯は一つである。行動、道具の呼び出し、観測はそのまま保ったまま、思考の塊だけを順位づけて落とす。著者らはこれを、相互作用を踏まえた圧縮と呼んでいる[1]。学習を要さず、作業の進行中にその場で判断する方式だとされる。

順位づけには、凍結した代理のモデルが出す不確かさの度合いを使う。つまり、どの思考の塊が残すに値するかを、別途学習した判定器ではなく、固定された尺度で測る。方式が軽いことは利点であり、同時に限界でもある。尺度が固定なら、作業の種類が変わっても同じ基準で削られる。

静的な圧縮

出来上がった思考の連鎖を短くする。元の文と圧縮後の文を比べれば、どれだけ損なわれたかを測れる。削った結果が新たな行動を生むことはない。

相互作用を踏まえた圧縮

作業の途中で履歴を削る。削ったことで次の行動が変わり、変わった行動が別の履歴を作る。損なわれた量を後から比べる相手が存在しない。

abstract が述べている範囲

著者らは、WorkBuddyBench の 260 件の課題で評価している。平均報酬は 0.699 から 0.718 へ上がり、入力・出力・キャッシュ読み出しのトークンはそれぞれ 25.5%、14.4%、33.3% 減ったと報告されている。費用を下げたうえで成績が下がらなかった、という主張である。

もう一つ、abstract には興味深い観察が書かれている。局所的に思考を削ると、計算量の総量が非線形に変わる。著者らはこれを軌跡の増幅と呼ぶ。削ったぶんだけ減るのではなく、その後の相互作用が変わることで、減り方も増え方も予測しにくくなるということである。さらに、表現の探査と活性の差し替えを含む分析から、作業に必要な派生状態がコード・ファイル・道具の出力・環境からの反応として外に出された後は、過去の思考は置き換えやすくなると示唆している。ここまでが abstract の範囲であり、著者らの主張である。

現場に置き換えると、どう見えるか

長い引き継ぎのある仕事に当てはめると、この主張は次のように読める。

作業の引き継ぎに置き換えると

後任:「この条件、どうしてこう決めたんですか」
前任:「議事録は残っていませんが、決めた条件は仕様書に書いてあります」
後任:「仕様書どおりに動いているので、経緯は要りません」

結論が外に書き出されていれば、そこへ至った思考は捨ててよい。書き出されていなければ、思考が唯一の記録である。論文が言っているのはこの区別で、忘れてよい条件を外に出されたかどうかに置いている。逆に言えば、外に出す手立てが弱い作業では、削ってはいけない思考が増える。

新しくない部分と、読み取れない部分

不要になった作業記憶を落とすという考え方そのものは新しくない。要らない中間結果を捨てる最適化は計算機の歴史とほぼ同じ長さがある。この論文の新しさは発想ではなく、削除が後続の行動を変えてしまう設定を正面から扱い、削除の判定を学習なしの固定尺度に置いた点にあると読むのが妥当だろう。

abstract の範囲では読み取れないことも多い。どの程度の割合の思考が削られたのか。作業の種類ごとに成績がどう動いたのか。軌跡の増幅が悪い方向に出た事例はどれだけあったのか。いずれも条件が示されていない。とくに、評価が一つのベンチマークに寄っている点は注意して読むべきところである。作業の性質が変われば、外に出される派生状態の量も変わり、削ってよい思考の割合も変わるはずである。

なぜこの主題が、いま束になっているのか

同じ時期に、疫学のモデルを人工知能のエージェントで駆動する枠組みを扱う論文が並んでいる[2]。扱う対象は遠いが、問いは重なっている。長い工程を任されたエージェントが、何を自分の中に抱え、何を外の仕組みに預けるか。疫学の側では、計算の担い手が外部のモデルであり、エージェントはその呼び出しと解釈を担う。忘却の側では、外に出された状態があるからこそ思考を捨てられる。どちらも、エージェントの内側と外側の境界をどこに引くかという同じ問いの別の面である。

この主題で立っている系統は、同じ問いを扱う論文の束だけである。読者の票も、実装の追随も、報道の追随も、収集の範囲では確認できていない。当サイトの選定では話題の広がりを互いに独立した系統で測るが、束が立っていることは研究者が同じ問いに寄っていることを示すだけで、答えが出たことを示すものではない。票の多寡と同じく、正しさとは別の軸である。

資材審査の工程から見ると、どこが接続するか

ここには、規制の現場と正面からぶつかる点がある。この論文が費用として扱っている思考の履歴は、資材審査の文脈では記録そのものである。なぜこの表現を可とし、なぜこの図表を差し戻したのか。その判断過程が残っていなければ、後から同じ基準で審査されているかを確かめられない。監査で問われるのは結論ではなく、結論に至った筋道である。

もっとも、論文の主張を反転させると、審査の設計に使える読み方も出てくる。忘れてよいのは派生状態が外に出された後だという条件は、裏返せば判断の根拠を外に書き出せという要求である。頭の中で突き合わせた結果だけを残すのではなく、どの資料のどの記載と照らしたかを台帳に落とす。そこまで書き出されていれば、思考の過程を逐語で保存していなくても、判断は再構成できる。

一方で、費用を下げるために履歴を削る設計を審査の道具に持ち込むなら、削除の判定が固定尺度であることは危うい。どの思考を捨てたかの記録が残らなければ、削除そのものが監査の対象外になる。何を捨てたかを記録しない仕組みは、捨てた判断を説明できない。費用は測れるが、消えた根拠の代償は事後にしか測れない。