2026年9月23日、AnthropicとOpenEvidenceが、低・中所得の約100か国の医師に、臨床判断支援のAIを無料で提供すると発表した。出典を示すAIが無料で世界に配られるとき、その答えの正しさは誰が確かめるのか。出典を並べる設計は確かめる作業を助けるだけで、正しさを引き受ける役は、答えを読む医師と、記録を求める各国の制度に残る。

01無料で広く配るほど、確かめる負担は受け取る側に移る

今回の発表で確かめられる事実は四つある。配る相手が低・中所得の約100か国の医師であること。費用がかからないこと。答えに出典が添えられること。現地の医療事情に合わせた調整が入ること。

四つとも、受け取る側が手元で費やす手間を減らす方向に働く。減らないものが一つだけ残る。目の前の患者にその答えを使うかどうかを決める作業である。

配る相手

低・中所得の約100か国の医師に、無料で提供される。

中身

査読を経た研究と治療指針を引いて医師の質問に答える製品の、現地向けの版である。

役割の分担

裏側の技術をAnthropicが担い、現地の医療事情への調整をOpenEvidenceが担う。

読む側が明日から変えられることは、一つに絞れる。出典の付いた答えを採ったとき、どの出典に当たり、どれに当たらなかったかを書き残す。それだけで、後から誤りをたどる道が残る。

02OpenEvidenceは査読論文と診療指針から答えを作る

無料で配られる物が何なのかを決めないまま、責任の話はできない。OpenEvidenceは、医師が投げた質問に、査読を経た医学研究と治療指針を引いて答える製品である。答えの文の脇に、もとになった論文が並ぶ。

米国の臨床家は、2026年8月の一か月だけで、この製品を4,200万回使った。引かれる文献は、医学誌の側との取り決めを通して入っている。一般の検索から拾い集めたものとは、経路が違う。

今回の無料版は、Anthropicの技術を裏側に置き、現地の医療事情に合わせて調整される。調整が具体に何を変えるのかは、発表に書かれていない。

図 1 質問が答えになるまでの道すじ
医師の質問査読論文と指針AIが要約する出典つきの答え採るか採らないか医師の質問査読論文と指針AIが要約する出典つきの答え採るか採らないか
止まる場所は最後の一箇所しかない。出典が付いているかどうかは、この一箇所の重さを変えない。

発表に書かれている範囲では、質問が答えになるまでのあいだに、人が止まる段はない。人の手が入るのは最後の一箇所、出てきた答えを採るか採らないかを決めるところだけである。

03文献も専門医も届かない場所ほど、答えを突き合わせる相手がいない

答えのもとになる文献に、そもそも手が届かない場所がある。無料版が入るのは、ウガンダ、アンゴラ、スーダン、ハイチ、モンゴルといった国々である。医学雑誌の購読も、専門医への相談も、卒業後の学び直しも、届き方が薄い。

薄いのは情報だけではない。医薬情報を突き合わせる相手の数が少ない。日本の医療機関であれば、添付文書と学会の指針と同僚の経験を横に並べて、一つの答えを疑える。並べる物が一つしかない場所では、疑う作業そのものが立ち上がらない。

この違いは、能力の差ではない。同じ医師が、同じ答えを、同じように読む。違うのは、読んだあとに手を伸ばせる先が何本あるかである。手を伸ばせる先が一本しかなければ、医師に残るのは、その答えを採るか、何も採らないかである。突き合わせたうえで採るという道が、そこでは残らない。

見るところ文献も専門医も届く場所どちらも届きにくい場所
答えを突き合わせる先同僚と手元の文献AIの答えしかないことがある
誤りに気づく速さ別の情報源で早く気づく気づかないまま続くことがある
記録の残り方診療記録と学会報告に残る残す仕組みがまだ整っていない

表の三行目が、この先で効いてくる。誤りが起きたかどうかを外から測るには、誰かがそれを書き留めていなければならない。

04出典が並ぶほど、読み手は確かめたつもりになる

同僚にも文献にも当たれない場所では、答えに添えられた出典だけが手がかりになる。その手がかりは、どれくらい強いのか。

大規模言語モデルは、形の整った、存在しない文献を作ることがある。著者名も誌名も年も番号もそろっていて、実際に当たってみるまで見分けがつかない。医学教育の分野からの報告は、この問題をもう一段先へ進めた。読み手は、出典が付いているという事実そのものを、信用の印として受け取る。

ここに逆向きの力が生まれる。出典が一件だけなら、医師はその一件を開く。十件並べば、一件ずつ開く手間も十倍になる。数が増えるほど、一件ずつ当たろうとする動機はむしろ下がっていく。

作られやすさは主題によっても動く。精神医療の領域で引用の正しさを測った実験では、疾患ごとに正しさの割合が違った。正しさの割合は、最も低かった疾患で59%、最も高かった疾患で64%だった。主題によって割合は動き、しかもどの疾患でも六割前後にとどまった。外から一律に「言語モデルの引用は何割正しい」とは言えない。

図 2 出典が付いた答えの、その先の分かれ方
出典つきの答え実在する引用存在しない文献当たるか当たらぬか出典つきの答え実在する引用存在しない文献当たるか当たらぬか
三つの枝のうち、読み手が選べるのは三本目だけである。一本目と二本目は外から見分けがつかない。

誤った答えが必ず返る、という話ではない。患者の側から投げられた医療の質問に、安全でない答えが返った例が報告されている。報告されているのはその事実までで、それ以上は確かめられていない。

05WHOは40を超える勧告で、基準を作る役を各国政府に置いた

出典の存在そのものが信用の印として読まれるなら、一件ずつ当たる作業を個人の心がけに任せておくのは弱い。この作業を個人の外側に置いた文書が、すでにある。

WHOは2024年1月、大規模マルチモーダルモデルについての指針を出した。四十を超える勧告が並び、開発する側、提供する側、導入する側のそれぞれに割り当てられている。

そのなかで、開発と導入の基準を定める第一の責任は、各国政府に置かれた。原則として挙がっているのは、透明性、説明可能性、そして責任が誰にあるのかを明らかにすることである。

基準を決める役

開発と導入の基準を定める第一の責任は、各国政府にあるとされた。

示すことを求められる中身

透明性と説明可能性、そして責任が誰にあるかを明らかにすることが原則に挙げられた。

勧告の数

四十を超える勧告が置かれ、開発・提供・導入のそれぞれの段に割り当てられている。

基準を作る役が政府にあるということは、無料で配る側の善意が、受け取る国の監督の代わりにはならないということでもある。

06無料・出典付き・現地調整という三つの条件が、確認の設計を変える

各国政府が基準を定めるとしても、その基準が整うまでのあいだにも、この製品は使われる。その分をどう扱うか。三つに分けると輪郭が出る。

① 費用がかからないこと

使われる回数が増え、確かめられないまま採られる割合が変わらなければ、確かめられないまま診療に入る答えの総量も一緒に増える。米国だけで、2026年8月の一か月に4,200万回使われている。この数は無料版の見込み利用数ではない。ただし、費用の壁が無い場所で回数がどこまで伸びるかの目安にはなる。

② 答えに出典が添えられること

確かめた気持ちが、確かめる作業の代わりになる。引用は作られることがあり、しかも読み手は引用の存在を信用の印として読む。二つが重なると、出典欄は確認を促すどころか、確認を省く理由になる。

③ 現地の事情に合わせて調整されること

調整した部分の正しさを誰が見るのかが空く。WHOは基準を定める役を各国政府に置いたが、手を入れるのは配る側である。決める人と手を入れる人が分かれている。

三つは、一本の方針文書ではまとめて片付かない。使用回数の増加には、採否を書き残す様式が効く。出典が読み飛ばされることには、何件まで開くのかを先に決めておくことが効く。現地調整には、受け取る国の側に立つ監督が効く。効く手がそれぞれ違う。

07確かめた記録が残る国から、AIの誤りの範囲が分かってくる

三つの宿題のうちどれが片付いたのかを、外から見る手立てが今はない。手立ては記録の形でしか作れない。

これから公表される数字は、どの国で何回使われたかだろう。回数は測りやすい。測りにくいほうに、知りたいことがある。医師が答えを読んで、それを採らなかった場面である。

医師が採らなかった判断とその理由が記録に残れば、答えが現場の判断とどこで食い違ったのかが見え、AIの誤りがどこに出るのかに近づける。残らなければ、この無料提供が診療を良くしたのかどうかは、いつまでも確かめられない。

図 3 確かめた記録が次の答えを直す回り方
答えを受け取る出典に当たる採否を書き残す誤りを集める指針を直す答えを受け取る出典に当たる採否を書き残す誤りを集める指針を直す
三番目が抜けると輪は閉じない。採らなかった答えを書き残すことが、この回り方の要になる。

最初に置くべき物は、使用量の集計ではない。採否を一行書き残す欄である。

Key Points ── 持ち帰る 3 つ
  1. OpenEvidenceは米国だけで2026年8月の一か月に4,200万回使われている。無料版が約100か国に入れば、突き合わせる相手のいないまま使われる答えが増える。
  2. 大規模言語モデルは形の整った存在しない文献を作ることがあり、出典が付いていること自体を信用の印にすると、一件ずつ当たる動機はかえって下がる。
  3. WHOは基準を定める第一の責任を各国政府に置いており、無料で配る側の善意は、受け取る国の記録と監督の仕組みを代わりに果たさない。
結語

答えの正しさを引き受けるのは、出典を並べる仕組みではない。それを読んで採否を決める医師と、採らなかった判断まで記録に求める各国の制度である。

無料で広く配ること自体を、私は疑っていない。文献にも専門医にも手が届かない場所に、査読を経た研究を引いた答えが届くのは、それだけで一つの前進である。ただし届いた先で、その答えが正しかったかどうかを診療の外から言える人は、いまのところいない。後から言えるようにするには、医師が書き残した記録が要る。

採らなかった一件を書き残すことは、採った一件を書き残すより手間がかかる。手間の分だけ、後から見えるものが増える。

出典·参考文献
  1. Reuters. Exclusive: Anthropic, OpenEvidence partner to bring medical AI worldwide. 2026年9月23日.(発表の事実、提供先、無料であること、裏側の技術と現地調整の役割分担)
  2. The Next Web. Anthropic and OpenEvidence to offer free medical AI to doctors in about 100 countries. 2026年9月23日.(約100か国という範囲と、医師に無料で提供されるという条件)
  3. JAMA Network. OpenEvidence and the JAMA Network sign strategic content agreement. 2025年1月14日.(答えのもとになる文献が、査読を経た医学誌との取り決めを通して入っていること)
  4. World Health Organization. Ethics and governance of artificial intelligence for health: large multi-modal models. WHO guidance, 2024年1月18日.(四十を超える勧告。基準を定める第一の責任が各国政府にあること)
  5. arXiv. Large language models provide unsafe answers to patient-posed medical questions. 2025年7月25日.(医療の質問に対して安全でない答えが返りうること)
  6. JMIR Medical Education. Citation Accuracy Challenges Posed by Large Language Models. 2025年4月24日.(作られた引用が残る問題と、出典の存在が信用の印として読まれること)
  7. Journal of Medical Internet Research. Accuracy of Large Language Models When Answering Clinical Research Questions: Systematic Review and Network Meta-Analysis. 2025年.(臨床の問いへの答えの正確さが、まとめて測られている段階にあること)
  8. PubMed. Influence of Topic Familiarity and Prompt Specificity on Citation Fabrication in Mental Health Research Using Large Language Models. 2025年11月6日.(引用の作られ方が主題によって変わり、一律に見積もれないこと)