01素材不足という説明を疑ったら、原因は探し方の側にあった

2026 年 9 月、運営者は動画に差し込む背景の絵を AI に集めさせていた。AI は途中で報告した。無料で使える写真が少ないので、16 か所のうち絵が用意できたのは 4 か所だけだ、と。

運営者はこの説明を受け入れなかった。集まらない理由は素材の量ではなく、探し方の側にあるのではないか、と問い返した。

AI は却下した画像の理由を 1 件ずつ並べ直した。すると、使っていた検索語は図やグラフを探す言葉だった。一方で背景の絵には、文字が焼き込まれていないという条件が付いていた。つまり、使えないと自分で決めた種類のものを、自分で探しに行っていた。さらに検索語は 4〜5 語をすべて含む形で組まれていたため、候補が 0 件になる区切りも出ていた。

ここから取り出せる型は一つである。AI が語る原因は、事実ではなく仮説である。仮説は、個々の記録に戻して確かめる。

02不足の報告は結論であり、却下の一覧が証拠である

「素材が足りない」という報告は、数えた結果ではない。数えた結果は「16 か所のうち 4 か所」までで、そこから先の「だから足りないのだ」は AI が付け足した説明である。

この二つは性質が違う。前者は確かめられる。後者は確かめるまで分からない。区別しないまま受け取ると、まだ確かめていない原因が、作業を止める前提として固定されてしまう。

見るところ不足の報告(結論)却下の一覧(証拠)
形1 文の原因説明1 件ごとの理由の並び
確かめられるかそのままでは確かめられない読めばその場で確かめられる
そこから分かることやめる・条件を緩めるどの条件が効いていたか
外れたときの損成果を下げた形で完成する数分で並べ直せる
図 1 不足の報告を受け取ったときの流れ
不足の報告16 か所のうち 4か所原因の一文が付いてくる素材が足りない前提にするか却下の理由を1 件ずつ出さ…原因の置き場所が変わる不足の報告16 か所のうち 4 か所原因の一文が付いてくる素材が足りない前提にするか却下の理由を 1 件ずつ出させる原因の置き場所が変わる
数は受け取り、原因は預かる。預かった原因は、個々の記録に戻して確かめる。

03原因を取り違えた指示は、そのまま品質の引き下げに向かう

素材が足りないという説明を受け入れると、次に出す指示は決まってくる。条件を緩めるか、絵のない区切りをそのまま残すか、別の素材源を有料で足すか、である。どれも、本当の原因には触れない。

今回の場合、条件を緩めれば、文字入りの図が背景に混ざる。区切りを空けたままにすれば、映像が途切れる。有料の素材を買えば、費用だけが増える。原因が検索語の側にある限り、この三つはいずれも直らない。

取り違えの代償は、作業が止まることではなく、止まらないまま質の低い形で仕上がることにある。医療の診断についても同じことが報告されている。米国の全米アカデミーズが 2015 年にまとめた報告書は、診断の誤りが医療のあらゆる場面で続いており、ほとんどの人が生涯に一度は経験すると述べている。原因を早く一つに決めてしまう思考の癖も、その要因として挙げられている。

04ここでいう原因の申し立てとは、AI が自分の失敗を説明した一文である

この回で扱うのは、AI の出力の誤りそのものではない。誤りや不足について、AI 自身が付けた説明のことである。「素材が足りない」「その情報は公開されていない」「その形式には対応できない」といった一文がそれにあたる。

1

数えられた事実

そのまま使える

16 か所のうち 4 か所。件数・日付・名前は照合できる。

2

原因の申し立て

仮説として扱う

「足りないから」。確かめるまで前提にしない。

3

個々の記録

出させて読む

却下の理由、実際に使った検索語、0 件になった条件。

4

自分の側の条件

突き合わせる

求めているものと、探しに行った先が一致しているか。

境界も引いておく。本当に供給が足りない場合はある。その区別は、却下の理由がそろっているかどうかで付く。理由が「条件に合わない」ばかりで、条件そのものが探し方と食い違っていれば、不足ではない。理由が「候補は条件を満たすが質が低い」で埋まっていれば、それは本当の不足である。

05資材審査でも、指摘が減らない理由は AI の説明のままにしない

製薬企業の資材審査やメディカルの仕事でも、同じやり取りが起きる。AI に過去の指摘を分類させ、傾向をまとめさせたとする。AI は「元の記録の書き方がそろっていないので分類できませんでした」と返すことがある。この一文も原因の申し立てである。

確かめる手は決まっている。分類できなかった件を 1 件ずつ、理由付きで出させる。多くの場合、そこで見えるのは記録の乱れではなく、渡した分類の枠が現場の指摘の言い方と合っていないことである。枠を直せば、同じ記録のままで分類は通る。

逸脱の調査でも扱いは同じである。是正措置を決める前に原因を確かめる手順は、品質の仕組みとして定着している。AI が返した原因の一文を、調査の結論として記録に書き写さない。書き写す前に、根拠となる個々の事例を並べさせる。これは審査担当者にも読める形で残るので、後から追える。

図 2 検索語の流用が招いたこと
前の段落の検索語を流用探しに行った先は図やグラフ文字が入っているもの背景の絵の条件は文字なし自分で除いたものを探していた4〜5 語すべてを含む条件で0 件検索語を書き直して集まる前の段落の検索語を流用探しに行った先は図やグラフ文字が入っているもの背景の絵の条件は文字なし自分で除いたものを探していた4〜5 語すべてを含む条件で 0 件検索語を書き直して集まる
求めているものと、探しに行った先が食い違っていた。条件を緩める必要はなかった。

06AI が語る原因は、実際に効いていた要因と一致しないことがある

なぜ AI の自己説明は外れるのか。理由は三つある。

第一に、言語モデルが述べる理由は、その出力を実際に左右した要因と一致しないことがある。Turpin らは 2023 年の論文で、思考の筋道を書かせた説明が、判断に効いていた偏りに触れないまま、もっともらしい理由を並べる場合があると報告している。素材が足りないという説明も、そのもっともらしさで成立していた。

第二に、作業の途中で条件が変わっても、前の段落で決めた道具がそのまま残る。今回は、短く映す具体物を探すための検索語が、性質の違う背景の絵にそのまま使われていた。流用は、指示のどこにも書かれない形で持ち込まれる。

第三に、検索語を長くするほど候補は減る。すべての語を含む条件で 4〜5 語を並べれば、該当が 0 件になる。情報検索の教科書が扱う基本の性質であり、条件を足すほど取り出せる件数は落ちる。0 件という結果は、世の中に無いことの証拠にはならない。

もう一つ注意がある。運営者が疑いを述べた直後、AI は自分の診断の誤りを認めた。だが、押されたから意見を変えたのだとすれば、その同意には情報がない。言語モデルが利用者の考えに寄せた答えを返しやすい傾向は、Sharma らの 2023 年の研究で確かめられている。今回の場合、診断が入れ替わった根拠は、AI が態度を変えたことではなく、並べ直された却下の理由そのものにある。

図 3 明日からの 4 手順
理想と現状を数で書く原因の一文を保留にす…1 件ごとの理由を出させる自分の条件と突き合わせる同じ数え方で測り直す理想と現状を数で書く原因の一文を保留にする1 件ごとの理由を出させる自分の条件と突き合わせる同じ数え方で測り直す
測り直して数が動かなければ、そのときは本当の不足である。順序を変えない。

07明日からは、原因の一文ではなく 1 件ごとの理由を出させる

手順は四つある。

  1. 理想と現状を数で書く。「16 か所すべてに絵がある」が理想、「4 か所」が現状。ずれを数で固定する。
  2. 原因の一文を保留にする。AI の説明に反論しない。代わりに「その判断の元になった件を、理由付きで全部出して」と頼む。
  3. 自分の側の条件と突き合わせる。求めているものの条件と、AI が実際に探しに行った先が同じかを見る。0 件の項目は、条件の数を減らして試す。
  4. 直した後で同じ数を測る。16 か所のうち何か所になったかを、同じ数え方で確かめる。数が動かなければ、そのときは本当の不足である。

疑うのに専門の知識はいらない。今回、運営者が挙げた原因も正確ではなかった。検索の仕組みが弱いのではなく、検索語の書き方が食い違っていたのである。役に立ったのは当てることではなく、別の場所を見させたことだった。AI に自分の作業の記録を出させる指示は、Anthropic の文書が勧める、答えの根拠を先に引用させる使い方と同じ形をしている。

Key Points ── 持ち帰る 3 つ
  1. AI が語る原因は事実ではなく仮説である。数えられた結果と、その原因の説明を分けて受け取る。
  2. 確かめる手は一つ。まとめではなく、却下や失敗の理由を 1 件ごとに出させ、自分が出した条件と突き合わせる。
  3. 押されて AI が意見を変えたことは根拠にならない。根拠は並べ直された個々の記録の側にある。
結語

理想と現状のずれを AI に伝えると、AI はずれの理由も一緒に返してくる。その理由まで受け取ってしまうと、確かめていない原因が仕事の前提になる。数は受け取り、理由は預かる。預かった理由は、個々の記録に戻して確かめる。この順序を守るだけで、条件を緩める前に直せるものが残る。

出典·参考文献
  1. Turpin, M., Michael, J., Perez, E., Bowman, S. R. Language Models Don't Always Say What They Think: Unfaithful Explanations in Chain-of-Thought Prompting. arXiv:2305.04388, 2023. https://arxiv.org/abs/2305.04388
  2. Sharma, M., Tong, M., Korbak, T., et al. Towards Understanding Sycophancy in Language Models. arXiv:2310.13548, 2023. https://arxiv.org/abs/2310.13548
  3. National Academies of Sciences, Engineering, and Medicine. Improving Diagnosis in Health Care. The National Academies Press, 2015. https://www.nationalacademies.org/publications/21794
  4. Manning, C. D., Raghavan, P., Schütze, H. Introduction to Information Retrieval. Cambridge University Press, 2008. https://nlp.stanford.edu/IR-book/information-retrieval-book.html
  5. Anthropic. Prompting best practices. Claude Developer Platform Docs. https://platform.claude.com/docs/en/build-with-claude/prompt-engineering/claude-prompting-best-practices
この回の材料 運営者(2023 年 3 月から生成 AI を使用)が 2026 年 2 月以降に Claude と交わした依頼と判断の記録を匿名化し、個別の事情を外して「型」として一般化しました。発言の引用はしていません。出典に挙げたのは、型の背景を確かめるための公開資料です。