この論文は何を問題にしているか
言語モデルやエージェントを人の望む振る舞いに寄せるには、人が良し悪しを判断した出力が要る。判断の形はいくつかあるが、実際の現場でよく行われるのは、モデルが書いた答えを人が手で直し、直した版を正解として集める作業である。
著者らが挙げる困りごとは二つある。一つは時間だ。文章をまるごと書き直す作業は重く、注記者の負担がそのままデータの量を縛る。もう一つは性質の問題である。人が全面的に書き直した文章は、もはやモデルが書きそうな文章ではない。学習の理屈としては、モデル自身が出しうる分布の上でデータを集めたい(オンポリシーと呼ばれる考え方)のに、書き直しはそこから離れてしまう。この論文は査読を経ていないプレプリントであり、以下は著者らの主張として読む。
何を提案しているか
提案の芯は、直す単位を文章から語(トークン)へ下げることにある。onPanda と名づけられた道具の使い方は単純だ。注記者は出力を頭から読み、最初に不適切になった語の位置を特定する。そこでモデルが候補として挙げていた別の語を選ぶか、自分で正しい語を打ち込む。道具はその位置より後ろを切り落とし、直した前半部分から先を改めてモデルに生成させる。満足できる答えになるまで、位置を見つけて直して続けさせる、という往復を繰り返す。
この形をとると、出来上がった文章の大部分はモデル自身が書いたものになる。著者らはそこに二つの利点を見ている。第一に、データがモデルの出しうる分布の上に乗りやすい。第二に、どの位置でどう直したかという記録そのものが、位置の分かる細かい教師信号になり、直す前と後が自然に良し悪しの対として残る。道具は外部のツールや実行環境ともつながり、エージェントの行動記録に対しても同じやり方で注記できるとされる。
何を示したか ── abstract に書かれた範囲だけ
abstract が数字として挙げているのは一点である。小規模な対照実験において、手で後から書き直す方法と比べ、注記にかかる時間の中央値が 52% 減ったという。著者らはこれを「小規模な対照実験が示唆する」と書いており、断定はしていない。
あわせて、onPanda で注記したデータセット Panda-CVL と、語単位の修正を測るための課題集を公開したと述べている。
一方で、abstract の範囲では示されていないことが多い。対照実験に何人が参加し、どんな課題を扱い、どの母集団から選ばれたのか。時間が短くなったとして、出来上がったデータで学習したモデルが実際に良くなったのか。注記者の熟練度による差はどうか。いずれも条件が示されていない。時間の短縮はデータの質の証明ではない、という区別は、読む側が保っておく必要がある。
具体例で見る
やり方の違いは、原稿への赤入れに置き換えると見えやすい。
全面的に書き直す
出来上がった文章を読み、気になる箇所を含めて全体を自分の言葉で書き直す。手は入るが、文章は直した人のものになる。
外れた語から続けさせる
読み進めて最初に外れた一語を指し、そこだけ直して、続きは書き手に書かせる。直した位置が記録に残り、文章は書き手のものに留まる。
赤入れの場面に置き換えると
レビュー担当:「この一語のところから、表現が言い過ぎになっています」
起草者:「そこを直して、続きは書き直します」
レビュー担当:「頭から全部書き換えなくていい。外れた位置はここだけです」
どこから外れたかを指させる指摘は、直す側にも記録にも残る。この論文の道具がやっているのは、その指摘の仕方を機械の上に写したことである。
何が新しくないか/限界はどこか
語の単位で良し悪しを与える発想は新しくない。細かい位置に報酬を割り当てる学習の研究は以前から続いている[3]。人の好みから学ぶ枠組みも整備されてきた[4]。この論文が置かれているのは理論の側ではなく、その細かい信号を人手でどう集めるかという道具の側である。
限界もいくつか見える。第一に、「最初に不適切になった語」を人が一意に決められるという前提がある。文章の不適切さは一語に還元できないことが多い。全体の構成が外れている場合、最初の一語を直しても直らない。第二に、続きをモデルに書かせる以上、注記者は自分が書ける最良の文章ではなく、モデルが出せる範囲の中から選ぶことになる。直した結果の上限がモデルに縛られる。第三に、時間の短縮が確かめられたとしても、それは注記の効率であって、学習後の性能ではない。abstract はその接続を数字では示していない。
なぜいま、この主題が拾われているのか
この論文には公開の場で 24 件の投票が付き、公開された実装には 29 件の星が付いている。数としては大きくない。これらは話題の大きさを表す目盛りであって、主張の正しさを測る目盛りではない。実装が公開されていること自体は確かめられるが、それは追試ができる状態にあるというだけのことである。
背景として言えるのは、学習の手法が細かくなるほど、それを支える人手のデータの取り方が詰まってきた、という順序である。理屈の側で語の単位の信号が求められるようになったのに、集め方は文章の単位のままだった。この論文はその隙間を埋めにいっている。ただし査読前の段階であり、道具としての使い勝手が主張どおりかは、外部の追試を待つほかない。
製薬・規制の現場から見ると何が接続するか
資材の審査では、どこが問題かを指させるかどうかが、そのまま差し戻しの質を決める。「全体として言い過ぎ」という指摘は、起草者にとって直しようがない。どの記載のどの語が、どのルールに照らして外れているのかを指させる指摘だけが、次の版を良くする。この論文の道具が形にしているのは、まさにその指摘の粒度である。
ここから取り出せるのは、道具そのものよりも記録の設計だろう。審査で何を直したかを、対象の位置と理由の対として残す。そうした記録は、後から傾向を数える材料になるし、同じ指摘の繰り返しを見つける材料にもなる。実際、審査の記録が「修正依頼あり/なし」の粒度でしか残っていない組織は多い。位置と理由を残す形に変えるだけで、後工程の見え方は変わる。
一方で、そのまま持ち込めない点も明らかである。医薬品の情報提供では、外れの判断根拠が法令や自主基準の側にあり、担当者の語感で決まるものではない。語の単位で直せるようにすることと、直す根拠をルールに紐づけることは、別々に設計しなければならない。前者だけを速くすると、根拠の薄い修正が量産される。