
履歴に残った古い前提が、次の判断を狂わせる
長い手順を踏む仕事をエージェントに任せると、失敗の出かたが変わる。一つの操作を間違えるのではなく、途中で置いた前提が古くなったまま履歴に残り、その後の判断をじわじわ曲げていく。著者らはこれを、仕事の状態が汚れることと呼んでいる。根拠のない思い込み、すでに条件が変わった計画、確かめずに済ませた推測 ── どれも履歴の中では、確かめられた事実と同じ見た目で並ぶ。
もう一つ、この論文が指摘するのは、言語による世界モデルの作りかたである。これまでの多くは、道具を呼んだときに環境が返してくる応答を予測しようとしてきた。ところが応答は、実行してみるまで決まらない部分が大きい。実際に実行できる場面では、その予測にかける労力は報われにくい。著者らはここを出発点に、予測する対象を取り替える[1]。本稿の一次情報は査読を経ていない arXiv のプレプリントである。
応答を模すのをやめ、進捗の変わりかたを模す
提案の芯は一つである。道具の応答を模擬するのではなく、推論と行動が仕事の進みぐあいをどう変えるかを模す。著者らはこの枠組みを Agent-Editing World Model と呼び、AEWM と略している。
AEWM は二つの部品を組み合わせる。一つは行動の判定で、その場の決定を、要となるもの、探りを入れるもの、雑音であるものに切り分ける。もう一つは状態の書き換えで、同じ観測の履歴から、雑音と判定された推論と行動の続きを書き直す。批評を添えるのではなく、続きそのものを差し替える。
この二つを実際の実行と組み合わせた仕組みが EditAct である。批評を返して本体に読ませるのではなく、以後の判断が乗っている状態を直接変える。ここが、助言を与える従来の形との分かれ目である。訓練は、検索、端末操作、ソフトウェア開発の三つの領域にまたがって、中間段の学習と教師つきの微調整で行われたと述べられている。
abstract が述べている範囲
abstract に書かれているのは次の範囲である。行動の判定については、著者らが作った評点表の上で 70.5% のマクロ F1 に達し、最も強い比較対象を 10.6 ポイント上回ったという。六つの評点表と三つのエージェント本体にわたって、EditAct は平均の点数を最も強い比較対象より 3.2 から 6.7 ポイント高めたとしている[1]。
さらに、検証済みの EditAct の軌跡に対して棄却抽出による微調整を行った形を AEWM-RFT と呼び、三つの領域で自己微調整の形より 2.2 から 2.6 ポイント高かったと述べている。こちらは実行時に AEWM の誘導を必要としない。つまり、学習の材料として使い切ったあとは外せる、という主張である。ここまでが著者らの主張であって、確立した結論ではない。
現場に置き換えると、どう見えるか
履歴を書き換えるという言い方は抽象的に響くが、やっていることは次の違いに尽きる。
批評を添える形
仕組み:「その前提は、いまは成り立っていない可能性があります」
エージェント:(履歴にはもとの前提が残ったまま、指摘も並ぶ)
エージェント:(次の判断で、もとの前提を読み返して同じ方向へ進む)
状態を書き換える形
仕組み:(雑音と判定した推論と行動の続きを、同じ観測から書き直す)
エージェント:(次の判断は、書き直された状態の上で行われる)
エージェント:(もとの前提を読み返す機会そのものがない)
要点は精度ではなく、誤りを消すのか、誤りを残したうえで注意書きを足すのかという設計上の分かれ目にある。消す形は速いが、消した判断そのものの記録が薄くなる。足す形は記録が残るが、残ったものに引きずられる。
新しくない部分と、読み取れない部分
自分の出力を振り返って直す仕組みは、以前から積み上げられてきた[4]。推論と行動を交互に置く形も、すでに標準的な作りである[5]。この論文が持ち込んでいるのは、振り返りの結果を助言として渡すのではなく、履歴そのものを差し替える点と、決定を三つの種類に切り分けて書き換える対象を絞る点である。
読み取れないことも多い。どの決定を雑音と呼ぶかの境目をどう決めたのか、書き換えが誤った判定に基づいたときに何が起きるのか、書き換えの回数が増えたときに履歴の一貫性がどうなるのか。いずれも abstract の範囲では条件が示されていない。評点表を著者ら自身が作っているという点も、外からの追試を待つ必要がある。査読前のプレプリントであるから、判断は本文と査読の後に置くべきである。
票は付いたが、束にはなっていない
この論文には公開後 19 件の upvote と 2 件のコメントが付き、実装の公開も確認できる。星の数は 6 である[2][3]。読む価値があると判断した読者が一定数いて、手を動かした人がわずかにいる、という状態である。
一方で、同じ問いを扱う別の論文が同じ時期に並んだ形跡は、収集の範囲では確認できていない。束のサイズは 1 である。当サイトでは、話題の広がりを票・実装・報道・論文の束という互いに独立した系統で測る。票が付いたことは、正しさでも重要さでもない。読む価値があると何人かが思った、という以上の意味を持たせてはならない。世界モデルという言葉が広く使われるようになったぶん、言葉だけが一致して中身が違う論文が並びやすい点にも注意が要る。
資材審査の工程に、どこが接続するか
販売情報提供活動に関わる資材の点検は、長い手順を踏む仕事である。指摘を出し、修正を受け取り、修正が別の箇所と矛盾していないかを見て、また戻す。この往復のあいだに、途中で置いた前提が古くなる場面は珍しくない。添付文書の改訂が入った、引用元の条件が変わった、前の版で通した表現の根拠が別の資料に移った ── どれも、気づかなければ古い前提のまま次の判断に効いてくる。
この論文が扱っているのは、その「古い前提が履歴に残る」という形の失敗である。ただし規制の現場に持ち込むときは、書き換えという手立てをそのまま採れない。審査の記録は、誤った判断を含めて残さなければならない。何をどう直したかが追えなくなれば、監査で説明できるものにならないし、同じ誤りの再発も検出できない。
だから接続するのは、履歴を差し替える部分ではなく、決定を種類に切り分ける部分である。どの指摘が要で、どれが探りで、どれが捨ててよい雑音なのか。これを人が区別しているうちは、区別の基準が担当者の頭の中にしかない。基準を外に出して書き下すこと自体は、機械を入れるかどうかとは別に意味がある。そのうえで、書き換えではなく注記として残す形を選ぶ ── 順序はそちらになる。