1. 正解率が高くても、尺度を使い切っているとは限らない

大規模言語モデルに長い文章を生成させるのではなく、文章を受け取って「該当/非該当」や段階評価の点数だけを直接返させる使い方がある。著者らはこれを直接判定モデル(direct-decision model)と呼ぶ。応答が速く、出力が構造化されているので、分類や自動評価に組み込みやすい。

著者らが問題にするのは、こうしたモデルの信頼性は正解率だけでは測れない、という点である。利用者が「とても悪い」から「とても良い」までの段階を渡したなら、モデルはその段階を忠実に使い分ける必要がある。正解率がそれなりに高くても、判定が中ほどの選択肢に寄り、両端の段階をほとんど使わないなら、その尺度は実質的に粗くなっている。[1]

分析の対象は、JEV と呼ばれるモデルの版 1.13 と、公開されている KEV モデル三つである。JEV と KEV の正式な名前や仕組みは、abstract には書かれていない。一次情報は arXiv に公開されたプレプリントで、査読前の段階にある。

2. 提案の芯は、条件を固定して「使われた段階の割合」を測ること

この論文は新しいモデルを作る論文ではなく、偏りを測る論文である。芯は一つに絞れる。題材と元の点数を固定し、正解の分布と選択肢の並び順を揃えたうえで、尺度の段階数だけを変えて、判定に使われた段階の割合を見ることである。

こうして条件を揃えるのは、他の説明を一つずつ外すためである。判定が偏る理由としては、正解そのものの偏り、選択肢の位置の偏り、選択肢の数の多さなどが考えられる。著者らは、これらを揃えても残る偏りを、判定の段階で選択肢の空間が縮む現象として切り出し、「順序尺度の利用バイアス(ordinal scale-utilization bias)」と呼んだ。正解率とも、正解の偏りとも、位置の固定とも、選択肢の数だけとも別の現象だ、というのが著者らの主張である。

3. abstract の範囲で示されたこと

出発点は、自然言語推論のベンチマーク ANLI での観察である。[4]JEV の正解率は 74.95% で、正解ラベルも選択肢の位置もほぼ均等なのに、全予測の 38.8%、誤りの 51.3% を「中立(Neutral)」に割り当てていた。迷うと中ほどに逃げる形の偏りである。

この偏りは ANLI に限らなかった。順序のある尺度を使う 36 のデータセットでは、最終判定が使った段階は、正解が実際に使っている段階の 67〜76% にとどまった。順序の無い分類の四つの課題では 87〜102% で、順序のある尺度で縮みが目立つ。選択肢の並び順をランダムにすると縮みは弱まったが、消えはしなかった。

尺度を細かくすると、偏りはさらにはっきりした。段階数を K=2 から 14 まで増やすと、どのモデルでも使われる段階の割合が下がり、K=14 では 26〜75% になった。一方で、各選択肢に割り当てられた確率そのものは、多くのモデルで広く散らばったままだったという。確率の上では迷いが残っているのに、最終判定では使う段階が縮む、という対比である。

最後に、BA-LoRA と呼ぶ追加学習を的を絞って行うと、教師付きの八つの尺度で、正解に対する利用割合がおよそ 47% から 86% に上がった。KEV の二つの大きさのどちらでも同じ傾向だった。著者らはこれを、縮みは学習で身についたもので動かせる、つまり構造上の変えられない限界ではないことの根拠としている。追加学習の土台にある LoRA は、事前学習済みモデルの重みを固定し、小さな行列だけを学習させる手法である。[5]コードとデータは GitHub で公開されている。[3]

4. 具体例で見る ── 自動評価の尺度を細かくした会議

社内の問い合わせ対応記録を、AI の判定モデルで重要度ごとに振り分けている部署を考える。精度を上げるために、重要度の段階を細かくしようという話が出た。

運用担当:いまの段階だと粗いので、もっと細かい尺度に変えたいと思います。細かくすれば、緊急度の差も拾えるはずです。

品質担当:細かくする前に、いまの尺度で各段階がどれくらい使われているかを見ましたか。正解率が十分でも、判定が真ん中の段階に集まっていて、両端がほとんど出ていないかもしれません。

運用担当:正解率しか見ていませんでした。両端が出ていないとすると、最も緊急な案件が「中程度」に入っている可能性がありますね。

品質担当:そうです。その状態で段階を増やすと、使われない段階が増えるだけかもしれません。まず段階ごとの判定の分布と、正解の分布を並べて比べましょう。

この会話の後半が、論文の問いにあたる。尺度を細かくしたことと、判定が細かくなったことは別であり、この論文の範囲では、段階を増やすほど使われる段階の割合はむしろ下がった。

5. 新しくない部分と、abstract から読み取れない限界

人が段階評価に答えるとき、中ほどの選択肢を選びやすい、両端を避けやすい、といった傾向があることは、質問紙調査の分野で古くから論じられてきた。言語モデルが選択肢の位置や並び順に影響されることも、すでに多くの研究で指摘されている。この論文の寄与は、それらの要因を揃えてもなお残る縮みを、判定の段階で起きる現象として切り出し、名前を付けて測れる形にした点にある、と読める。

限界もある。第一に、JEV と KEV がどういうモデル群なのかは abstract からは分からず、他の直接判定モデルや、文章を生成してから判定する方式に同じ偏りがあるかは示されていない。第二に、「正解が実際に使っている段階」を基準にした利用割合の定義の細部は、abstract には書かれていない。順序の無い課題で 100% を超える値が出ている点も、その定義を本文で確かめないと解釈しにくい。第三に、BA-LoRA で利用割合が上がったとき、正解率や判定の妥当性がどうなったかは abstract の範囲では示されていない。段階を広く使うようになっても、外れた段階に散らばるだけなら意味が無い。第四に、BA-LoRA という名前の手法の詳細も abstract には無い。

また、公開実装の star は 3 にとどまっており、第三者による再現が進んでいるとは言えない。

6. 束になっていない一本の論文として読む

この論文は Hugging Face の Daily Papers で 60 の upvote を集めた。[2]当サイトの選定で立った signal は読者の票の系統だけで、実装の追随も報道もまだ無い。upvote は「読む価値がある」と投じられた票であって、主張の正しさを示すものではない。

同じ問いを扱う論文の束もできておらず、束の大きさは 1 だった。AI を自動評価の採点役に使う研究は増えているが、「渡した尺度を採点役が使い切っているか」という問いが一斉に立ち上がっているとまでは言えない。

それでも取り上げるのは、評価の仕組みを作る側にとって、正解率とは別の点検項目を一つ足してくれる論文だからである。採点役のモデルを入れ替えたり、尺度を細かくしたりする判断は、実務で頻繁に起きる。そのときに何を見ればよいかを、具体的な指標で示している。

7. 製薬・規制の現場から見ると

製薬の現場には、段階評価が多い。有害事象の重症度や因果関係の評価、問い合わせの緊急度の振り分け、資材の表現リスクの評価などである。こうした作業の一次振り分けを AI の判定モデルに任せる検討は各所で始まっている。

持ち帰れる点は二つある。一つは、正解率に加えて、段階ごとの判定の分布を正解の分布と並べて確かめることである。判定が中ほどの段階に集まり、両端が出ていないなら、最も注意すべき案件が中程度に埋もれている可能性がある。安全性に関わる評価では、これは正解率の数字よりも重い問題になりうる。もう一つは、尺度を細かくすることを、判定を細かくすることと取り違えないことである。段階を増やす前に、いまの段階が使い切られているかを見るほうが先になる。

この論文の評価は公開データセットで行われたもので、製薬の評価業務で同じ偏りが同じ大きさで出るかは示されていない。この記事の読みも、プレプリントの abstract の範囲にとどまる。