01元の依頼文を貼り直すと、AI は依頼の項目ごとに成果物を照らし合わせた
2026 年 9 月の記録を見る。運営者はその少し前に、記事の自動配信の仕組みを AI に作らせていた。依頼の中身はこうである。朝と夕方に出る AI のニュースから一日 2 本、人生の問いを扱う記事を 1 本、合わせて 3 本を日本語と英語で書き、毎朝 6 時に公開する。
仕組みができた後、運営者は同じ依頼文をもう一度そのまま貼った。そのうえで、記事の題材に AI が含まれているのかを、この依頼に照らして尋ねた。
AI はまず内訳を示した。3 本のうち 2 本は AI のニュースを起点にし、残る 1 本は人生の問いの一覧から選ぶ。どれも日英で書くので、一日に 6 つの原稿ができる。
続けて AI は、聞かれていない点を一つ報告した。原稿を書き始める時刻を午前 3 時に置いていたが、その日のニュースがそろうのは午前 6 時半だった。午前 3 時には、当日のニュースはまだ無い。依頼にあった「朝と夕方のニュース」は、実際には前日の分に頼る作りになっていた。AI はこの時刻の組み方を直した。
聞いたのは AI の話題の有無だけだった。それでも元の依頼文が手元にあったので、AI は依頼の各項目と仕組みを突き合わせ、別の項目のずれを見つけた。使う人がすべきことは一つである。完成の報告を受けたら元の依頼文を貼り、項目ごとに満たしているかを答えさせる。
02照合の基準が、AI の要約から元の依頼文に戻る
作業の後に「できましたか」と聞くと、AI は自分が理解した依頼に照らして答える。その理解は、作業の途中で AI が組み立てた要約である。元の依頼文の一語一語ではない。
元の依頼文を貼り直すと、照合の基準が変わる。AI は自分の要約ではなく、書かれた依頼に照らして答えることになる。「朝と夕方」「毎朝 6 時」「日英」のような条件が、一つずつ判定の対象になる。
返ってくるのは、合否の一言ではない。依頼のどの項目を、仕組みのどこで満たしているかという対応の一覧である。対応の取れない項目が、そのまま直すべき箇所の一覧になる。
03動いていることと、指示どおりであることは、別々に確かめる
時刻の穴は、動作の確認では見つからない。午前 3 時に起案が始まり、6 時に記事が公開される。エラーは出ない。毎朝、記事は並ぶ。外から見れば、仕組みは正常に動いている。
ずれているのは、記事の材料が一日古いという点だけである。依頼はその日の朝と夕方のニュースを求めていた。仕組みは前日のニュースで書いていた。この差は、依頼文と照らさない限り表に出ない。
ソフトウェアの品質管理では、この二つを分けて呼ぶ。作ったものが仕様どおりかを確かめるのが検証、使う人の必要を満たすかを確かめるのが妥当性確認である。米国の医療機器の規則も、この二つを別々に定義している。
前の回では、AI の完了報告を、確かめた部分と未確認の部分に分けさせた。今回はその先を扱う。確かめた部分が、そもそも依頼の求めたものと一致しているかを問う。
04指示どおりかを問うとは、依頼の項目と成果物を一つずつ結ぶことである
ここでいう「指示どおりかを問う」とは、元の依頼文を項目に分け、それぞれが成果物のどこで満たされているかを示させることを指す。ソフトウェアの分野では、要求がどこから来て、どこで作られ、どう確かめられたかを前後どちらにもたどれることを、要求の追跡可能性と呼ぶ。
| 確かめ方 | 何を基準にするか | 見つかるもの | 見つからないもの |
|---|---|---|---|
| 動かしてみる | エラーが出ないか | 停止・異常終了 | 動くが依頼と違う箇所 |
| 完了報告を分けさせる(前回) | AI が実際に確かめたか | 確かめていない部分 | 確かめた部分の中にある、依頼とのずれ |
| 元の依頼文と照合させる(今回) | 依頼の各項目 | 満たしていない項目、別の意味に取られた項目 | 依頼文に書かなかった必要 |
境界もはっきりさせておく。この照合が見つけるのは、依頼文と成果物の間のずれである。依頼文そのものに書き忘れた条件は、照合しても出てこない。それは、使う人が成果物を自分の目的に照らして見る作業で見つける。別の確かめ方である。
もう一つの境界は、基準になる依頼文が残っていることである。依頼を口頭や断片で何度も変えると、どれが元の依頼かが決まらない。照合は、基準となる一つの文があるときに働く。
05資材の作成と審査では、ブリーフと依頼書がそのまま照合の基準になる
製薬企業の資材づくりにも、元の依頼文にあたる文書がある。マーケティングが書く資材のブリーフ、メディカルへの作成依頼、審査に出すときの依頼書である。どれも、対象の読者、伝える内容、使う根拠、使ってよい表現の範囲を書いている。
AI に資材の下書きを作らせたとき、原稿だけを読むと、文章の出来に目が向く。ブリーフを貼り直して項目ごとに照合させると、別のずれが見える。たとえば、医療関係者向けのはずが一般向けの言い回しになっている。指定した試験ではない出典の数値が使われている。こうしたずれは、文章が読みやすいほど見落としやすい。
| 元の依頼にあたる文書 | 照合させる項目 | 照合で拾えるずれ |
|---|---|---|
| 資材のブリーフ | 対象の読者・伝える内容・使う根拠 | 読者に合わない言い回し、指定外の出典 |
| 審査の依頼書 | 審査の範囲・特に見てほしい点 | 頼んだ観点のうち触れていないもの |
| 社内の手順書 | 必ず通す工程・記録の様式 | 抜けた工程、様式の違い |
資材審査の担当者にとっての利点は、指摘の根拠が依頼文に戻ることである。「この表現が気になる」ではなく、「ブリーフの第 3 項と合わない」と言える。指摘を受けた側も、何を直せば依頼どおりになるかが分かる。
AI 自身に照合させるのは、最初の見直しとしてである。その表を読み、最終の判断をするのは審査の担当者である。
06長い作業の中で、元の依頼文は AI の手元から遠ざかる
作った本人の AI が、なぜ依頼から外れるのか。一つ目の理由は作業の長さである。仕組みを作る間、AI はファイルを読み、命令を実行し、結果を受け取る。そのすべてが AI の入力に積み重なり、最初の依頼文はその先頭近くに埋もれていく。
Anthropic の Claude Code の手引きは、入力の容量が埋まるにつれて性能が下がり、前に受けた指示を忘れたり誤りが増えたりすると書いている。2023 年の研究は、長い入力の中で必要な情報が中ほどにあると、冒頭や末尾にあるときより言語モデルの成績が大きく下がることを示した。
二つ目の理由は条件の数である。今回の依頼には、本数、題材、言語、公開時刻、ニュースの時間帯と、いくつもの条件が一つの文に詰まっていた。言語モデルが指示をどれだけ守るかを測る研究では、字数や含める語のように機械で判定できる条件を 25 種類用意し、約 500 の指示で評価している。条件を一つずつ判定できる形にすることが、守れたかを測る前提になっている。
三つ目は、動くことが完了の合図になりやすいことである。同じ手引きは、確かめる手段がないと AI は「できたように見える」ところで止まる、と書いている。エラーを出さないずれは、この合図をすり抜ける。
元の依頼文を貼り直すと、依頼は入力の末尾に戻る。言語モデルが最も使いやすい位置である。条件は一つずつ判定の対象になり、動いたかどうかとは別の基準ができる。三つの理由に、一度に手が届く。
07完成の報告を受けたら、元の依頼文を貼り、項目ごとの対応を表で返させる
手順は四つある。
- 依頼文を残しておく。最初に出した依頼を、そのままの文で保存する。後から言い足した条件も、同じ場所に書き足す。
- 完成の報告を受けたら、依頼文を貼り直す。要約しない。書いたとおりの文を渡す。
- 項目ごとの対応を表で返させる。「この依頼を項目に分け、それぞれを成果物のどこで満たしているか、満たしていない項目はどれかを表にして」と頼む。
- 満たしていない項目だけを直させる。直した後、同じ表をもう一度作らせる。
気になる項目を一つ添えて聞くと、照合が始まりやすい。運営者の問いも、AI の話題が入っているかという一点だった。一点を聞いただけでも、元の依頼文が手元にあれば、AI はほかの項目まで見直した。
照合を、作業をした AI とは別の目に任せる方法もある。Anthropic の手引きは、作業の後に新しい文脈の下位エージェントを立て、計画書と照らして、すべての要求が実装されているか、範囲の外が変わっていないかを確かめさせる例を示している。作った側の思い込みを、照合から外せる。
- 完成の報告を受けたら、元の依頼文をそのまま貼り直し、項目ごとに満たしているかを答えさせる。照合の基準が AI の要約から書かれた依頼に戻る。
- 動いていることと指示どおりであることは別である。エラーを出さないずれは、依頼文と照らしたときにだけ見つかる。
- 長い作業の中で、元の依頼は AI の入力の奥に埋もれる。貼り直すと依頼が末尾に戻り、条件が一つずつ判定の対象になる。
AI に仕事を任せたとき、最後に確かめるべきなのは、仕組みが動くかどうかだけではない。最初に頼んだことを、最初に書いた言葉のとおりに満たしているかである。その基準は使う人の手元にある依頼文であり、AI の記憶ではない。依頼文を残し、完成のたびに貼り直す。それだけで、外からは見えないずれが表に出る。
- Anthropic. Best practices for Claude Code. Claude Code Docs. https://code.claude.com/docs/en/best-practices
- Liu, N. F., Lin, K., Hewitt, J., et al. Lost in the Middle: How Language Models Use Long Contexts. arXiv:2307.03172, 2023. https://arxiv.org/abs/2307.03172
- Zhou, J., Lu, T., Mishra, S., et al. Instruction-Following Evaluation for Large Language Models. arXiv:2311.07911, 2023. https://arxiv.org/abs/2311.07911
- Wikipedia. Verification and validation. https://en.wikipedia.org/wiki/Verification_and_validation
- Wikipedia. Requirements traceability. https://en.wikipedia.org/wiki/Requirements_traceability