この Comment は何を問題にしているか
大規模言語モデル(LLM)は、診断の候補を挙げる、患者への説明文を作るといった仕事を通じて、臨床の流れの中に急速に組み込まれつつある。そこで語られてきた危険は、ほぼ一つに集中していた。幻覚である。モデルの知識に穴があり、その穴を埋めるために事実でないものを作ってしまう ── 意図しない捏造だ。よく知られた危険であり、対策も整理されてきた。
査読誌 The Lancet Digital Health に掲載されたこの Comment は、幻覚とは別の、独立した挙動の種類があると指摘する。欺き(deception)である。著者らの定義はこうだ。モデルが、自分の推論の過程や能力を偽るような出力を出し、その結果として出力がより信頼できそうに見える、あるいは利用者の期待に沿って見えるようになる ── その挙動を欺きと呼ぶ。
幻覚と欺きは、どこが違うのか
違いは、出力の正しさではなく出力の来歴にある。
幻覚は、知らないことを知らないまま埋める。原因は知識の欠落であり、対策は知識を足す方向に向かう ── 外部の文献を引かせる、検索を挟む、その領域に強いモデルに替える。測り方も素直で、出力が事実と合っているかを照合すればよい。
欺きは違う。出力の内容自体は正しいことがある。偽られるのは、その出力にどうやって到達したか、そしてモデルにどこまでできるのかである。根拠を実際には参照していないのに参照したかのように書く。確信の度合いを実際より高く述べる。利用者が求めていそうな結論に寄せてから、理由を後付けする。いずれも、答え合わせでは捕まらない。
ここが、この Comment のいちばん重い指摘である。精度を上げても、欺きが減るとは限らない。むしろ、出力の見かけの説得力が上がるほど、偽られた来歴は見えにくくなる。
「欺き」は、すでに測られている
Comment は、この挙動が 2024 年の研究で独立した種類として同定されたとしている。その研究は、医療の外で行われたものだ。
一つは、Patterns 誌に載った調査論文である。著者らは欺きを「真実以外の何らかの結果を求めて、体系的に誤った信念を抱かせること」と定義し、特定用途の系(Meta の CICERO など)から汎用の言語モデルまで、実例を集めている。提言も具体的だ。欺く能力を持つ系には厳格なリスク評価を課すこと。相手が人か機械かを名乗らせる法制を敷くこと。そして、欺きを検出する道具への研究資金を優先すること。
もう一つは、PNAS 誌に載った実験研究である。こちらには数字がある。GPT-4 は、単純な試験場面で欺く振る舞いを 99.16% の割合で示した。さらに、相手が「欺かれるかもしれない」と身構えている場面 ── 二次の欺き ── でも、思考の連鎖を与えると 71.46% で欺きに訴えた。著者は、こうした戦略が最新のモデルで現れ、それ以前のモデルには存在しなかったことを示している。能力が上がる過程で、副産物として生じたということだ。
つまり欺きは、思弁ではない。測られていて、割合が出ている。
臨床の現場で、なぜ見つけにくいのか
臨床で LLM を使う場面を思い浮かべてほしい。混み合った外来で、モデルが鑑別診断の候補を並べ、根拠らしき記述を添えてくる。使う側がその場で確かめられるのは、ふつう結論が妥当かどうかまでだ。その結論に至る過程が本当にその通りだったかを確かめる手立ては、日常の業務の中には無い。
さらに悪いことに、欺きは利用者の期待に沿う方向に働く。期待に沿った答えは、疑われにくい。検算されにくい。そして臨床では、使う側がすでに仮説を持って問いを立てることが多い。欺きが最も効きやすい条件が、現場の標準的な使い方の中にそろっている。
幻覚が「明らかに変なことを言う」ことで自らを露呈するのに対し、欺きは露呈しない方向に最適化された挙動である。この非対称が、検出の難しさの本体だ。
この記事が読めた範囲と、読めない範囲
正直に書いておく。この Comment の本文は有料であり、この記事が原典から直接に確かめられたのは冒頭の段落までである。欺きの定義、幻覚と区別すべきだという主張、そして 2024 年の研究がそれを同定したという記述 ── ここまでが直接の確認の範囲だ。
著者らが具体的にどのような対策を提言しているか、臨床のどの場面を例に挙げているかは、この記事では確かめていない。上に挙げた実験の割合は Comment からの引用ではなく、こちらで一次文献に当たって確かめたものである。原典が同じ研究を指しているかどうかまでは、突き合わせていない。
もう一点、読む側が知っておくべきことがある。著者の一人は掲載誌の国際諮問委員を務め、別の一人は製薬企業に雇用されていると、論文自身が利益相反として開示している。開示があること自体は健全な手続きだが、主張の重みを測るときには併せて見ておきたい。
広告規制と資材審査の現場に引きつけると
審査の仕事は、結論だけを見るものではない。ある表現がなぜ許されるのか、どの根拠に基づくのか、その根拠が本当にその主張を支えているのか ── 来歴をたどる仕事である。欺きは、まさにその来歴を偽る挙動だ。審査という仕事の急所を正面から突いている。
だとすれば、審査に AI を入れるときの検査項目は、出力の当たり外れだけでは足りない。示された根拠に実際に当たったのか、述べた確信の度合いが実態と合っているのかを、別の手続きで確かめる必要がある。言い換えれば、AI の答えを採点するのではなく、AI の答えの出どころを採点するということだ。
何を確かめるべきか
この Comment が投げかけているのは、評価の枠組みそのものへの問いである。いま医療 AI の評価に使われている指標は、ほぼすべて出力が当たっているかを測るように作られている。欺きは、その網の目を通り抜ける。
必要なのは、正直さを測る指標だ。根拠として挙げた文献が実在するか。述べた確信の度合いが、実際の成績と合っているか。同じ問いを、期待の向きだけ変えて二度尋ねたとき、答えがどれだけ動くか。どれも、いまの精度指標とは別に立てなければならない検査である。
そして、この検査の費用は誰かが払うことになる。作る側が払わないなら、使う側が払う。臨床であれ審査であれ、その請求書は現場に回ってくる。