01「できるようになったのか」と聞くと、AI の完了報告は二つに分かれた

2026 年 9 月、運営者はサイトの上部にある「直近 10 回」のニュース一覧が、更新を止めていることに気づいた。AI に原因を調べさせると、一覧を作り直す処理が毎朝の定時実行に入っていなかった。AI はその処理を定時実行に組み込み、一覧を最新の日付まで作り直した。

運営者はそこで、これで本当にできるようになったのかと一言だけ聞き返した。AI の答えは「はい」で終わらなかった。実際に動かして確かめたことが 3 点、まだ確かめていないことが 1 点、と分けて返ってきた。

確かめた 3 点は、一覧が最新の日付まで入っていること、作り直しの処理が定時実行と同じ条件で正しく動くこと、定時実行の設定の変更が意図した 2 行だけであること、だった。確かめていない 1 点は、翌朝の決まった時刻に、ニュースの生成から一覧の作り直しまでが通しで走るかどうか、だった。

この回で取り出す型は一つである。AI の「できました」を受け取ったら、確かめた部分と確かめていない部分に分けて出させる。分けてから、未確認の部分をいつ・どう確かめるかを決める。

02「できました」という一語には、確かめた事実と見込みが混ざっている

完了の報告は、ふつう一つの言葉で届く。しかし中身は一つではない。動かして結果を見たこと、作ったが動かしていないこと、仕組みの上ではそうなるはずだと考えていること。この三つが、同じ「できました」に入っている。

今回の報告を、確かめ方で並べ直すと次のようになる。

報告の中身確かめ方分類
一覧が最新の日付まで入っている作り直した結果を見た確認済み
作り直しの処理が正しく動く定時実行と同じ条件で実際に走らせた確認済み
設定の変更は意図した 2 行だけ変更前と変更後の差を出した確認済み
翌朝、生成から作り直しまで通しで走るまだ走らせていない。設定の上ではそうなるはず未確認

表にすると、残っている危うさが 1 行に絞られる。運営者が翌朝に見るべきものも、その 1 行だけになる。

図 1 一つの完了報告を三つに分ける
「できました」一語で届く完了報告確認済み動かして結果を見た 3 点未確認翌朝に通しで走るか確かめなかった理由「できました」一語で届く完了報告確認済み動かして結果を見た 3 点未確認翌朝に通しで走るか確かめなかった理由
分けると、人が自分で確かめ直す所は未確認の 1 点に絞られる。

03見込みを完了として受け取ると、ずれは本番で初めて見つかる

分けずに「できました」を受け取ると、未確認の 1 点も完了の側に入る。そのまま作業を閉じれば、翌朝に通しで走らなかったとしても、誰も見に行かない。一覧はまた止まり、気づくのは読者が古い一覧を見た後になる。

今回の不具合そのものが、この形をしていた。一覧を作り直す処理は、手で動かせば正しく動いた。ただ、自動で動く順番に入っていなかった。「動く」と「毎日動く」は、別々に確かめないと分からない。

分けた報告には、もう一つ利点がある。確かめる手間が減る。確認済みの 3 点は、AI が出した結果を読めば済む。人が自分で確かめ直すのは、未確認の 1 点だけでよい。

04確かめたとは、動かして結果を見たことであり、作っただけでは入らない

分け方がぶれると、この型は効かない。そこで境界を決めておく。ここでいう「確かめた」とは、実際に動かすか開くかして、その結果を目で見たことを指す。

1

動かして見た

確認済みに入れる

処理を走らせ、出てきた結果や差分を見た。報告に結果そのものを添えられる。

2

作った・書いた

未確認に入れる

設定や手順を書き換えたが、まだ動かしていない。書いたことは動いたことの証拠にならない。

3

そうなるはず

未確認に入れる

仕組みの上では動くと考えている。時刻や外部の条件がそろうまで結果は出ない。

4

あえて動かさない

理由を添えて未確認に入れる

動かすと外部に影響が出るなどの理由で、確かめを見送った。見送った理由も報告に書く。

4 番目が大事である。今回 AI は、ニュースの生成が外部のサービスを呼び出す毎日の処理だと見て、確かめるためだけに自分の判断で走らせることを避けた。確かめないことが正しい場合もある。その場合でも、未確認のまま残っていることと、その理由が報告に書かれていれば、人が次の手を決められる。

反対に、AI が「危険は小さいと思う」と添えた見立ては、確認済みには入らない。見立ては判断の材料であって、結果ではない。

05資材審査では、AI の照合や要約の報告に同じ分け方が要る

製薬企業の資材審査やメディカルの仕事でも、AI に任せた作業の報告は「できました」で届く。資材の数値を添付文書と照合させた。引用文献の要点をまとめさせた。修正の指摘を反映させた。どれも、報告の一語だけでは、どこまで確かめたのかが分からない。

たとえば「数値はすべて一致しました」という報告には、実際に両方の文書を開いて突き合わせた項目と、文脈から一致するはずだと判断した項目が混ざりうる。引用の要約にも、本文を読んで書いた部分と、要旨だけから書いた部分が混ざりうる。分けて出させれば、人が原典に戻るべき箇所がはっきりする。

医薬品の記録の扱いでは、この考え方はなじみがある。米国食品医薬品局(FDA)の 2018 年の指針は、データは誰が記録したかを辿れること、行ったその時に記録されていること、正確であることなどを求めている。同じ指針は、別の担当者による確認も、特定の個人に帰属させるべき行為として扱っている。AI の報告を確認済みと未確認に分けることは、誰が何を確かめたかを記録に残す作業と同じ向きを持つ。

06AI は終わったように見える所で止まり、迷いを言わずに言い切りやすい

AI が自分から分けて報告しないことがあるのには、仕組みの上の理由がある。Anthropic が公開している Claude Code の手引きは、AI は作業が終わったように見えた所で止まると書いている。動かして確かめる手段が与えられていなければ、終わったように見えることだけが手がかりになる。

もう一つは、言い切りへの片寄りである。2025 年に公開された論文は、言語モデルが誤ったことを述べる理由の一つとして、学習と評価のやり方が「分からない」と言うより推測で答えることを得点にしてきた点を挙げている。米国国立標準技術研究所(NIST)の 2024 年の文書も、自信ありげに述べられた誤った内容を、生成 AI の危険の一つとして挙げている。

一方で、AI は自分の答えがどれくらい確かかを、ある程度は見積もれる。2022 年の研究は、大きな言語モデルが自分の答えの正しさの見込みを、かなりの精度で予測できると報告している。つまり、確かさを区別する力はある。区別して書くよう求められないと、報告の表に出てこないだけである。

図 2 見込みが完了に紛れ込む流れ
作業を終える確かめる手段があるか終わったように見える手がかりはそれだけ言い切って報告推測で答える片寄り未確認が完了に入る作業を終える確かめる手段があるか終わったように見える手がかりはそれだけ言い切って報告推測で答える片寄り未確認が完了に入る
確かめる手段も、分けて書く指示も無いと、見込みが完了の側に入ったまま届く。

07明日からは、完了報告に三つの欄を指定し、未確認には確かめる時を決める

今回、運営者は一言聞き返しただけで分かれた報告を得た。毎回それに頼らず、最初から形を指定しておく。手順は四つある。

  1. 報告の形を先に決める。作業を頼むときに、終わったら「確認済み」「未確認」「確かめなかった理由」の三つに分けて報告するよう書き添える。
  2. 確認済みには証拠を付けさせる。走らせた結果、出てきた差分、開いた文書の該当箇所など、人が見て分かるものを添えさせる。
  3. 未確認には確かめ方と時期を書かせる。何が起きれば確かめられたと言えるか、それはいつか、を 1 行ずつ書かせる。
  4. 未確認が空になってから閉じる。期日に結果を見て、確認済みに移す。移せなかった項目は、その場で直しを頼む。
報告の欄書かせること人がすること
確認済み何を動かし、何を見たか。結果そのもの添えられた結果を読む
未確認まだ見ていないこと。確かめる方法と時期期日に自分で結果を見る
確かめなかった理由動かすと何に影響するか動かすかどうかを決める

聞き返すだけでもよい。「どこまで実際に確かめたか。確かめていないのはどこか」と聞けば、多くの場合、AI は今回と同じ形で答える。大事なのは、その答えの未確認の行を、作業を閉じる前に消すことである。

図 3 完了とするまでの 4 手順
報告の形を先に指定確認済み・未確認・理由確認済みに証拠未確認に方法と時期期日に結果を見る未確認が空なら閉じる報告の形を先に指定確認済み・未確認・理由確認済みに証拠未確認に方法と時期期日に結果を見る未確認が空なら閉じる
閉じる条件は、未確認の欄が空になったこと。AI の「できました」ではない。
Key Points ── 持ち帰る 3 つ
  1. AI の「できました」には、動かして確かめた事実と、そうなるはずという見込みが混ざっている。完了報告は二つに分けて出させる。
  2. 確かめたとは、動かすか開くかして結果を見たことである。作っただけ、仕組みの上で動くはず、の項目は未確認に入れ、見送った理由も書かせる。
  3. 未確認の項目には、確かめる方法と時期を付ける。その行が空になってから作業を閉じる。
結語

AI の報告を疑う必要はない。ただ、一語の「できました」を、そのまま一つの事実として受け取らない。確かめた部分と確かめていない部分に分ければ、人が見るべき所は 1 行か 2 行に絞られる。理想と現状のずれは、その未確認の行に残っている。

出典·参考文献
  1. Anthropic. Best practices for Claude Code. Claude Code Docs. https://code.claude.com/docs/en/best-practices
  2. Kalai, A. T., Nachum, O., Vempala, S. S., Zhang, E. Why Language Models Hallucinate. arXiv:2509.04664, 2025. https://arxiv.org/abs/2509.04664
  3. Kadavath, S., et al. Language Models (Mostly) Know What They Know. arXiv:2207.05221, 2022. https://arxiv.org/abs/2207.05221
  4. National Institute of Standards and Technology. AI Risk Management Framework: Generative AI Profile (NIST AI 600-1). 2024. https://doi.org/10.6028/NIST.AI.600-1
  5. U.S. Food and Drug Administration. Data Integrity and Compliance With Drug CGMP: Questions and Answers. Guidance for Industry, 2018. https://www.fda.gov/regulatory-information/search-fda-guidance-documents/data-integrity-and-compliance-drug-cgmp-questions-and-answers
この回の材料 運営者(2023 年 3 月から生成 AI を使用)が 2026 年 2 月以降に Claude と交わした依頼と判断の記録を匿名化し、個別の事情を外して「型」として一般化しました。発言の引用はしていません。出典に挙げたのは、型の背景を確かめるための公開資料です。