携帯端末の計画エージェント開発は、実機を試す費用の壁で軌跡を人手で集められない。データを作る段で専門エージェントが課題を組み、軌跡を集め偏りを均す。教え学習する段で計画を教え込み、模擬と実環境を混ぜた強化学習へ進み、費用を抑える報酬設計を使う。実行し手直す段で証拠の輪が記憶・技能・道具を束ね、失敗の軌跡を戻してモデルと仕組みを共に直す。人が関門に立つ輪がこの三段を外側から包み、渡さない判断を先に書き、自分のデータで育つ偏りの経路を抑える。出てくるのは総合成績が最も良かった計画エージェントで、証拠を残す設計と人の関門の位置が、規制の現場で説明できる自動化につながる。
イメージアブストラクト ── 記事の全体像を 1 枚に(画像を押すと拡大)

実機を触らせる開発は、そこで詰まる

携帯端末を操作するエージェントを作ろうとすると、机上の課題では出てこない壁にぶつかる。画面の状態は刻々と変わり、同じ手順が次も通る保証がない。手順は長く、途中の一手が外れれば最後まで外れる。そして何より、実機を相手にした試行には費用と時間がかかる。学習に必要な量の軌跡を、人が端末を触って集めるやり方では届かない。

著者らはここを出発点に置いている。abstract の書き出しにあるのは、大規模言語モデルの進み方が、AI を受け身の生成装置から、工学や科学の作業そのものに参加する側へ押し出しつつあるという見立てである。そこから出てくる問いはひとつ。AI は開発の対象であると同時に、次の AI を作る側に回れるのか。携帯端末の計画作業は、この問いを試すには厳しい題材だという。長い手順は信頼性を試し、実機の費用は開発の規模を縛る。

芯にあるのは、三つの工程を同じ約束事でつなぐこと

提案の芯を一つに絞るなら、行動・反応・検証という共通の約束事を通して、データを作る工程と、学習する工程と、運用する工程を一本の輪につないだところにある。ばらばらに回していた三つを、同じ型の情報でつなぎ替えた、と言い換えてもよい。

abstract は、その輪を三つの層で説明している。ひとつめはデータの層で、人が関門に立つ形の仕組みを置き、専門化した複数のエージェントが課題を組み立て、端末とのやり取りの軌跡を集め、学習用のデータを選り分けて偏りを均す。学習側から返ってきた反応が、次にどんなデータを作るかを決める。ふたつめは学習の層で、計画を教え込む段から入り、実環境と模擬環境を混ぜた形での強化学習へ進む。ここで著者らは、推論と道具使用にかかる費用を抑えつつ成績を保つための報酬と優位度の設計を持ち込んだとしている。みっつめは、モデルと外側の仕組みを一緒に育てる層である。実行の証拠に基づく輪が、記憶・技能・道具を運用時に束ね、構造化された反応と失敗の軌跡を戻して、モデルと外側の仕組みの両方を合わせて手直しする。

abstract が述べている範囲

著者らは、携帯端末の計画作業を測るベンチマークにおいて、評価したモデルと仕組みのなかで総合成績が最も良かったと述べている。基となったモデルと比べて、道具の使用、記憶、技能、下位エージェントの連携のそれぞれで改善したという。さらに、携帯端末以外の作業を測るベンチマークでも改善が見られ、一般的な能力は概ね保たれたとしている。

abstract に具体的な数字は置かれていない。したがって どの程度の差なのかは、この記事の範囲では分からない。「最も良かった」という記述も、比較の対象として何を並べたかで意味が変わる。これは著者らの主張であって、確立した結論ではない。査読前のプレプリントである以上、方法の詳細と反証の扱いは本文と査読を待つほかない。

現場の作業で言い換えると

長い手順の作業を機械に任せるとは、実務ではこういうことになる。

一手ずつ指示する

人:「申請の画面を開いて」
機械:(開く)
人:「前回の内容を写して」
機械:(写す)
人:「日付だけ直して、保存して」

目的だけ渡す

人:「前回と同じ体裁で、今月分を出しておいて」
機械:(画面を開き、前回を探し、写し、日付を直し、保存する)
人:「どこで判断が分かれた?」
機械:(どの手で迷い、何を根拠に選んだかを返す)

右側が成り立つかどうかは、途中の一手が外れたときに立て直せるかで決まる。最後の答えが合っていたかだけを見ていると、途中で外れて偶然戻った場合と、最初から筋が通っていた場合を区別できない。この論文が実行の証拠を戻す輪を置いているのは、そこを区別するためだと読める。失敗の軌跡を捨てずに残す、という設計はその表れである。

新しくない部分と、読み取れない部分

データを作り、学習し、動かし、その結果でまた次のデータを作るという輪そのものは、目新しい発想ではない。能動学習と呼ばれる考え方は古くからあり、モデルの出力を使って次の学習データを作る手立ても、ここ数年ありふれたものになった。この論文が持ち込んでいるのは、その輪を 実機を相手にする作業という、最も費用のかかる場所で閉じたところである。

読み取れないことも多い。人が関門に立つとあるが、どの判断を人に残したのか。模擬環境と実環境をどう混ぜたのか。失敗の軌跡をどう選り分けたのか。いずれも abstract の範囲では条件が示されていない。加えて、輪を閉じる設計には固有の危うさがある。自分が作ったデータで自分を育てる以上、最初の偏りが増幅する経路が必ず開く。人の関門はそれを抑えるために置かれているはずだが、どこまで抑えられたかは、この範囲では確かめられない。

なぜ、いまこの主題が束になっているか

この論文には公開直後に 9 件の upvote が付いた。数としては控えめである。当サイトの選定でこれを拾ったのは票の多さではなく、同じ問いを扱う別の論文が同時期に並んだためで、束に入った論文は 2 本である。もう一方は、携帯端末の画面操作エージェントにおいて、実行を担う側を切り出して扱うものだった。

計画する側と実行する側を分けて考える、という切り口が同じ時期に複数の手から出ている。ここが観測できる事実である。ただし、票が集まったことも、束ができたことも、正しさや重要さを示す数字ではない。同じ問いに複数の手が同時に伸びている、という以上の意味を持たせてはならない。とくに束は、同じ道具立てが広まっただけでも立つ。

製薬・規制の現場から見ると、どこに接続するか

長い手順の作業を機械に任せる話は、資材の点検や申請書類の作成といった工程に、そのまま重なって見える。だが接続の仕方は、性能の話ではない。接続するのは、輪の側である。

ひとつは、失敗の軌跡を残すという設計である。規制の現場で求められるのは、うまくいった記録より、外れたときに何が起きてどう戻したかの記録である。実行の証拠を構造化して戻す仕組みは、そのまま監査で見せられる形に近い。逆に言えば、証拠を残さない自動化は、速くなっても説明できない。

もうひとつは、人が関門に立つ位置の決め方である。輪を閉じた仕組みでは、人がどこに立つかで品質の上限が決まる。全件を見るのでも、抜き取るのでもなく、どの判断だけは機械に決めさせないかを先に書き出す。この順序を逆にすると、費用が下がる工程から順に自動化が進み、最後に「誰も決めていない判断」が残る。資材の適正性や効能効果の範囲に関わる判断は、費用を理由に輪の中へ入れてよいものではない。