2026年9月23日、AnthropicとOpenEvidenceが、低・中所得の約100か国の医師に、臨床判断支援のAIを無料で提供すると発表した。出典を示すAIが無料で世界に配られるとき、その答えの正しさは誰が確かめるのか。出典を並べる設計は確かめる作業を助けるだけで、正しさを引き受ける役は、答えを読む医師と、記録を求める各国の制度に残る。
01無料で広く配るほど、確かめる負担は受け取る側に移る
今回の発表で確かめられる事実は四つある。配る相手が低・中所得の約100か国の医師であること。費用がかからないこと。答えに出典が添えられること。現地の医療事情に合わせた調整が入ること。
四つとも、受け取る側が手元で費やす手間を減らす方向に働く。減らないものが一つだけ残る。目の前の患者にその答えを使うかどうかを決める作業である。
配る相手
低・中所得の約100か国の医師に、無料で提供される。
中身
査読を経た研究と治療指針を引いて医師の質問に答える製品の、現地向けの版である。
役割の分担
裏側の技術をAnthropicが担い、現地の医療事情への調整をOpenEvidenceが担う。
読む側が明日から変えられることは、一つに絞れる。出典の付いた答えを採ったとき、どの出典に当たり、どれに当たらなかったかを書き残す。それだけで、後から誤りをたどる道が残る。
02OpenEvidenceは査読論文と診療指針から答えを作る
無料で配られる物が何なのかを決めないまま、責任の話はできない。OpenEvidenceは、医師が投げた質問に、査読を経た医学研究と治療指針を引いて答える製品である。答えの文の脇に、もとになった論文が並ぶ。
米国の臨床家は、2026年8月の一か月だけで、この製品を4,200万回使った。引かれる文献は、医学誌の側との取り決めを通して入っている。一般の検索から拾い集めたものとは、経路が違う。
今回の無料版は、Anthropicの技術を裏側に置き、現地の医療事情に合わせて調整される。調整が具体に何を変えるのかは、発表に書かれていない。
発表に書かれている範囲では、質問が答えになるまでのあいだに、人が止まる段はない。人の手が入るのは最後の一箇所、出てきた答えを採るか採らないかを決めるところだけである。
03文献も専門医も届かない場所ほど、答えを突き合わせる相手がいない
答えのもとになる文献に、そもそも手が届かない場所がある。無料版が入るのは、ウガンダ、アンゴラ、スーダン、ハイチ、モンゴルといった国々である。医学雑誌の購読も、専門医への相談も、卒業後の学び直しも、届き方が薄い。
薄いのは情報だけではない。医薬情報を突き合わせる相手の数が少ない。日本の医療機関であれば、添付文書と学会の指針と同僚の経験を横に並べて、一つの答えを疑える。並べる物が一つしかない場所では、疑う作業そのものが立ち上がらない。
この違いは、能力の差ではない。同じ医師が、同じ答えを、同じように読む。違うのは、読んだあとに手を伸ばせる先が何本あるかである。手を伸ばせる先が一本しかなければ、医師に残るのは、その答えを採るか、何も採らないかである。突き合わせたうえで採るという道が、そこでは残らない。
| 見るところ | 文献も専門医も届く場所 | どちらも届きにくい場所 |
|---|---|---|
| 答えを突き合わせる先 | 同僚と手元の文献 | AIの答えしかないことがある |
| 誤りに気づく速さ | 別の情報源で早く気づく | 気づかないまま続くことがある |
| 記録の残り方 | 診療記録と学会報告に残る | 残す仕組みがまだ整っていない |
表の三行目が、この先で効いてくる。誤りが起きたかどうかを外から測るには、誰かがそれを書き留めていなければならない。
04出典が並ぶほど、読み手は確かめたつもりになる
同僚にも文献にも当たれない場所では、答えに添えられた出典だけが手がかりになる。その手がかりは、どれくらい強いのか。
大規模言語モデルは、形の整った、存在しない文献を作ることがある。著者名も誌名も年も番号もそろっていて、実際に当たってみるまで見分けがつかない。医学教育の分野からの報告は、この問題をもう一段先へ進めた。読み手は、出典が付いているという事実そのものを、信用の印として受け取る。
ここに逆向きの力が生まれる。出典が一件だけなら、医師はその一件を開く。十件並べば、一件ずつ開く手間も十倍になる。数が増えるほど、一件ずつ当たろうとする動機はむしろ下がっていく。
作られやすさは主題によっても動く。精神医療の領域で引用の正しさを測った実験では、疾患ごとに正しさの割合が違った。正しさの割合は、最も低かった疾患で59%、最も高かった疾患で64%だった。主題によって割合は動き、しかもどの疾患でも六割前後にとどまった。外から一律に「言語モデルの引用は何割正しい」とは言えない。
誤った答えが必ず返る、という話ではない。患者の側から投げられた医療の質問に、安全でない答えが返った例が報告されている。報告されているのはその事実までで、それ以上は確かめられていない。
05WHOは40を超える勧告で、基準を作る役を各国政府に置いた
出典の存在そのものが信用の印として読まれるなら、一件ずつ当たる作業を個人の心がけに任せておくのは弱い。この作業を個人の外側に置いた文書が、すでにある。
WHOは2024年1月、大規模マルチモーダルモデルについての指針を出した。四十を超える勧告が並び、開発する側、提供する側、導入する側のそれぞれに割り当てられている。
そのなかで、開発と導入の基準を定める第一の責任は、各国政府に置かれた。原則として挙がっているのは、透明性、説明可能性、そして責任が誰にあるのかを明らかにすることである。
基準を決める役
開発と導入の基準を定める第一の責任は、各国政府にあるとされた。
示すことを求められる中身
透明性と説明可能性、そして責任が誰にあるかを明らかにすることが原則に挙げられた。
勧告の数
四十を超える勧告が置かれ、開発・提供・導入のそれぞれの段に割り当てられている。
基準を作る役が政府にあるということは、無料で配る側の善意が、受け取る国の監督の代わりにはならないということでもある。
06無料・出典付き・現地調整という三つの条件が、確認の設計を変える
各国政府が基準を定めるとしても、その基準が整うまでのあいだにも、この製品は使われる。その分をどう扱うか。三つに分けると輪郭が出る。
① 費用がかからないこと
使われる回数が増え、確かめられないまま採られる割合が変わらなければ、確かめられないまま診療に入る答えの総量も一緒に増える。米国だけで、2026年8月の一か月に4,200万回使われている。この数は無料版の見込み利用数ではない。ただし、費用の壁が無い場所で回数がどこまで伸びるかの目安にはなる。
② 答えに出典が添えられること
確かめた気持ちが、確かめる作業の代わりになる。引用は作られることがあり、しかも読み手は引用の存在を信用の印として読む。二つが重なると、出典欄は確認を促すどころか、確認を省く理由になる。
③ 現地の事情に合わせて調整されること
調整した部分の正しさを誰が見るのかが空く。WHOは基準を定める役を各国政府に置いたが、手を入れるのは配る側である。決める人と手を入れる人が分かれている。
三つは、一本の方針文書ではまとめて片付かない。使用回数の増加には、採否を書き残す様式が効く。出典が読み飛ばされることには、何件まで開くのかを先に決めておくことが効く。現地調整には、受け取る国の側に立つ監督が効く。効く手がそれぞれ違う。
07確かめた記録が残る国から、AIの誤りの範囲が分かってくる
三つの宿題のうちどれが片付いたのかを、外から見る手立てが今はない。手立ては記録の形でしか作れない。
これから公表される数字は、どの国で何回使われたかだろう。回数は測りやすい。測りにくいほうに、知りたいことがある。医師が答えを読んで、それを採らなかった場面である。
医師が採らなかった判断とその理由が記録に残れば、答えが現場の判断とどこで食い違ったのかが見え、AIの誤りがどこに出るのかに近づける。残らなければ、この無料提供が診療を良くしたのかどうかは、いつまでも確かめられない。
最初に置くべき物は、使用量の集計ではない。採否を一行書き残す欄である。
- OpenEvidenceは米国だけで2026年8月の一か月に4,200万回使われている。無料版が約100か国に入れば、突き合わせる相手のいないまま使われる答えが増える。
- 大規模言語モデルは形の整った存在しない文献を作ることがあり、出典が付いていること自体を信用の印にすると、一件ずつ当たる動機はかえって下がる。
- WHOは基準を定める第一の責任を各国政府に置いており、無料で配る側の善意は、受け取る国の記録と監督の仕組みを代わりに果たさない。
答えの正しさを引き受けるのは、出典を並べる仕組みではない。それを読んで採否を決める医師と、採らなかった判断まで記録に求める各国の制度である。
無料で広く配ること自体を、私は疑っていない。文献にも専門医にも手が届かない場所に、査読を経た研究を引いた答えが届くのは、それだけで一つの前進である。ただし届いた先で、その答えが正しかったかどうかを診療の外から言える人は、いまのところいない。後から言えるようにするには、医師が書き残した記録が要る。
採らなかった一件を書き残すことは、採った一件を書き残すより手間がかかる。手間の分だけ、後から見えるものが増える。
- Reuters. Exclusive: Anthropic, OpenEvidence partner to bring medical AI worldwide. 2026年9月23日.(発表の事実、提供先、無料であること、裏側の技術と現地調整の役割分担)
- The Next Web. Anthropic and OpenEvidence to offer free medical AI to doctors in about 100 countries. 2026年9月23日.(約100か国という範囲と、医師に無料で提供されるという条件)
- JAMA Network. OpenEvidence and the JAMA Network sign strategic content agreement. 2025年1月14日.(答えのもとになる文献が、査読を経た医学誌との取り決めを通して入っていること)
- World Health Organization. Ethics and governance of artificial intelligence for health: large multi-modal models. WHO guidance, 2024年1月18日.(四十を超える勧告。基準を定める第一の責任が各国政府にあること)
- arXiv. Large language models provide unsafe answers to patient-posed medical questions. 2025年7月25日.(医療の質問に対して安全でない答えが返りうること)
- JMIR Medical Education. Citation Accuracy Challenges Posed by Large Language Models. 2025年4月24日.(作られた引用が残る問題と、出典の存在が信用の印として読まれること)
- Journal of Medical Internet Research. Accuracy of Large Language Models When Answering Clinical Research Questions: Systematic Review and Network Meta-Analysis. 2025年.(臨床の問いへの答えの正確さが、まとめて測られている段階にあること)
- PubMed. Influence of Topic Familiarity and Prompt Specificity on Citation Fabrication in Mental Health Research Using Large Language Models. 2025年11月6日.(引用の作られ方が主題によって変わり、一律に見積もれないこと)
