AIの信頼を測る物差し

AIの導入と投資は、医療、金融、研究の現場で先へ進んでいます。病院にはすでにAI機器が入っていますが、Earth.comによれば、ほとんどが適切にテストされないまま使われています。研究では、片頭痛を発症前に予測する精度が91%と報じられるなど、数字は積み上がっています。一方で、AIの査読者が同じ科学を言い換えただけの原稿に別の判定を付けることがあるという指摘も、プレプリントから出ています。この半日で見えてきたのは、普及の速さよりも、出力が正しいかどうかを確かめる物差しがどこにあるのかという点でした。以下の各節では、投資、情報戦、創作の場面を順に見ながら、その物差しの有無を確かめていきます。
医療AIはすでに病院に入っています。ただし、Earth.comは、ほとんどのデバイスが適切にテストされないまま使われていると伝えています。一方、研究の側では予測AIの報告が続いています。MedicalNewsTodayは、AIが片頭痛を発症前に予測できるかを扱い、研究によると精度は91%だったと報じました。Bioengineer.orgは、AIが脳スキャンと臨床データを組み合わせて脳卒中の回復結果を予測した研究を紹介しています。病院に入る機器の検証が薄い一方で、論文では精度の数字が積み上がっています。
予測の対象は脳の病気にとどまりません。Journal of Electronics Electromedical Engineering and Medical Informatics には、脳腫瘍の生存予測を説明可能にしたProtoSurv-Xが掲載されました。npj Precision Oncologyには、肝細胞がんのVETCと早期再発を予測する自動マルチモーダルの枠組みMAVENが載っています。UCLAはAIをアルツハイマー病と認知症のテストにかける取り組みを伝え、Live Scienceは新しいAI「音声時計」が声から老化のスピードを示す可能性を報じました。疾患も入力データも違いますが、どれも「将来を当てる」という同じ方向の成果です。
読むときは、数字の大きさと、その数字がどこで確かめられたかを分けて見る必要があります。91%という精度は、その研究の条件の中での結果です。病院の現場でも同じ精度が出ることまでは、Earth.comの報告が示す状況では保証されません。研究が増えているという事実は、個々の機器が現場でテストされたことの代わりにはなりません。





