AIを信じる根拠をどう作るか

AIが示す説明や採点、診断は、読む側にはもっともらしく見えます。しかしその確かさは、見た目だけでは判断できません。研究エージェントが添える「なぜこの結果になるはずか」という説明は、予測を良くしているかどうかが、ふつう測られていません。ある研究は、自然な説明の貢献を確認できなかったと報告しています。一方で、呼吸器診断のチャットボットは、2,400人を対象にした無作為化試験で、一般人の判断精度を高めたと示されました。この半日で見ていくのは、AIの出力が正しいという主張と、それを人の確認や検証できる手続きで裏づけた結果との差です。導入の判断が分かれるのは、AIの性能そのものより、その裏づけが用意されているかどうかだと見えてきています。
AIの研究エージェントは、実験を計画するときに「なぜこの結果になるはずか」という説明を添える。読む側はそれを手がかりに結果を見積もるが、説明が予測を良くしているかは、ふつう測られていない。あるプレプリント(自サイト)は、説明が予測に足した分を「予測上の貢献」と呼び、説明だけを入れ替えた予測の対で測る手順を組んだ。毒性試験と機械学習の課題で測ったところ、自然な説明の貢献は確認できなかったと報告している。説明がもっともらしく読めることと、予測の役に立つことは別の問いになる。
採点の側にも、同じ種類の見直しがある。正解が一つに決まらない課題で LLM を強化学習するとき、回答の要件を並べた採点基準(ルーブリック)で部分点を与えるやり方が広がっている。別のプレプリント(自サイト)は、その採点者が回答に書かれていない情報にも点を付けることがあると指摘し、これを Vacuous Credit(空の加点)と名づけた。対策として、証拠がある時だけ点を与える学習と、回答を見ながら基準を直す工程を交互に回す MetaRubric を提案している。点数が高いことは、書かれた内容が良いことの証明にならない。採点者の癖がそのまま学習の方向を決めてしまうためだ。
成功記録の扱いも問われている。難しい作業を学ばせるには、実際に成功した作業記録が役に立つ。ただ、その成功が特別な道具立て(ハーネス)の補助に頼っていると、本番の環境ではその補助が使えない。三つ目のプレプリント(自サイト)は、多様なハーネスの下で見つけた成功を手順書に抜き出し、漏れを点検して、一般的なハーネスでやり直させる Recursive Self-Rewrite(RSR)を提案した。端末作業の成功軌跡を、本番と同じ条件の学習データに書き直す手順である。成功したという記録も、補助なしで再現できるかを確かめて初めて使える。




