生成AIの活用で、同僚からの評価が下がる?
Peer perceptions of clinicians using generative AI in medical decision-making – npj Digital Medicine
ジョンズ・ホプキンス大学の研究チームによる、「同僚の医師が診断の際にAIを活用していたら、その医師をどう評価するか」というテーマの研究になります。
シンプルで分かりやすいテーマですが、色々と考えさせられる内容でした。
研究デザイン
対象となったのは、同大学に所属する276名です。内訳は以下のようになっています。
- 医師:178名
- レジデント、フェロー:28名
- APP(下記)が60名
- Physician Assistants (PA):医師の監督下で医療行為を行うアシスタント
- Nurse Practitioners (NP):一定の診断や処方の権利を持つ看護師
- その他:10名
参加者に提示されたのは、ある糖尿病患者の治療方針を決定する医師のシナリオでした。シナリオ自体は、糖尿病のコントロールにおける標準的な薬剤の変更に関する判断であり、客観的に見て妥当なものです。
しかし、その意思決定のプロセスにおいて、以下の3つのパターンのうち、いずれか1つだけが各参加者に提示されました。
- Control(対照群): 生成AIを使わずに判断する。
- GenAI-primary(一次利用群): 生成AIを「主な意思決定ツール」として使用する。
- GenAI-verify(確認利用群): 生成AIを自分の判断の「確認ツール」としてのみ使用する。
その後、シナリオ内の医師の「臨床スキル」「全体的な能力」「医療の質」などが評価されました。
結果
全ての結果を簡潔にまとめると、生成AIを使った医師は、使わなかった医師に比べて、あらゆる項目で低い評価を受けました。

出典:Yang, H., Dai, T., Mathioudakis, N. et al. “Peer perceptions of clinicians using generative AI in medical decision-making”. npj Digit. Med. 8, 530 (2025).

出典:Yang, H., Dai, T., Mathioudakis, N. et al. “Peer perceptions of clinicians using generative AI in medical decision-making”. npj Digit. Med. 8, 530 (2025).
1. 臨床スキル
これは、「医学的知識や判断力がどれくらい優れているか」を7点満点で評価したものです。
- AIを使わなかった医師(Control):平均 5.93点
- AIを意思決定に使った医師(GenAI-primary):平均 3.79点
- AIを自分の判断の確認に使った医師(GenAI-verify):平均 4.99点
3群全体の比較:F(2, 273) = 45.45, p < 0.001
Control 対 GenAI-primary:Controlの方が高得点(F = 90.30, p < 0.001)
GenAI-verify 対 GenAI-primary:Verifyの方が高得点(p < 0.001)
つまり、
- 3つのグループの結果がバラついたのは偶然とは言えず、生成AIを使わない医師が明らかに高評価であった。
- 生成AIに意思決定してもらうよりは、自身の判断の確認に使うのみにとどめた方が高得点だったものの、それでも生成AIを使わない医師よりは低い評価となった。
と言う結果になりました。
2. 全体的な能力
「この医師は高い能力を有しているか?」という総合評価においても、同様の傾向が見られました。
- AIを使わなかった医師(Control):平均 5.99点
- AIを意思決定に使った医師(GenAI-primary):平均 3.71点
- AIを自分の判断の確認に使った医師(GenAI-verify):平均 4.94点
3群全体の差:F(2, 273) = 49.60, p < 0.001
Control 対 GenAI-primary:Controlが有意に高い(p < 0.001)
GenAI-verifyの評価は、GenAI-primaryよりも有意に高い(p < 0.001)
先ほどの結論と同様で、生成AIを使わない医師が明らかに高評価でした。
3. 医療の質
- AIを使わなかった医師(Control):平均4.48点
- AIを意思決定に使った医師(GenAI-primary):平均3.08点
- AIを自分の判断の確認に使った医師(GenAI-verify):平均3.72点
3群全体の差:F(2, 273) = 34.38, p < 0.001
Control 対 GenAI-primary:Controlが有意に高い(p < 0.001)
GenAI-verifyの評価は、GenAI-primaryよりも有意に高い(p < 0.001)
これも先ほどの結論と同様で、生成AIを使わない医師が明らかに高評価でした。
参加者は、生成AI自体を否定しているわけではない
「生成AIは臨床評価の正確性を向上させるのに役立つか」という質問に対しては、多くの臨床医が肯定的な回答をしており、特に「医療機関向けにカスタマイズされたAI」であれば、その有用性を高く評価しています(7点満点中 平均4.96点)。
つまり、生成AI自体は役立つツールと認識しながらも、それを使う人間の評価は低くしているということになります。
論文では、この現象を「Advice-taking theory(アドバイス受容理論)」と「Attribution theory(帰属理論)」で説明しています。
- Advice-taking theory
専門家が外部(他人やツール)に助言を求めると、周囲はそれを「自信の欠如」や「能力不足」とみなす傾向があることが知られています。[1]
「自分で答えを出せるなら、わざわざ聞く必要はないはずだ」という理屈です。 - Attribution theory
医師が生成AIを使って正しい診断をした場合、成功の要因が「医師の実力」なのか「生成AIのおかげ」なのかが曖昧になります。すると、評価者は医師の実力を「割り引いて」評価してしまい、「生成AIがすごかったのであって、この先生がすごいわけではない」とみなされるのです。[2]
生成AIの登場で、人間にとってAIがより身近になったと考えられます。
しかしそんな現代においても、このような心理が根強く残っていることが今回の研究で示唆されました。
注意点
- 今回は糖尿病のコントロールという場面を想定しましたが、希少疾患の診断や救急対応などのケースでは、また異なる結果が得られる可能性があります。
- 患者さんの視点、つまり「生成AIを使って診断する医師」を患者さんがどう思うかは、この研究では触れられていません。
- 参加者は、ジョンズ・ホプキンス所属のスタッフに限られています。違う医療機関や違う国の場合、結果が変わってくる可能性があります。
私の考えは
まず、私の立ち位置を明確にしておきましょう。
- 私は日本の調剤薬局で勤務する薬剤師で、毎日生成AIに触れています。
- 普段からnote等で、生成AIの活用例、AIに関するニュースや論文、AIリテラシーの啓発に関する記事を投稿しています。
- 私はAI(主に生成AI)を業務内外で活用することを推奨しています。しかし、業務へのAIの導入自体が目的になるべきではないと考えており、AIの導入を前提とした業務フローの設計には否定的です。
- 本当にAIが必要かどうか、AIが介入しても問題ないのか等を検証してから、導入すべきだと考えています。
それを踏まえてここからはお読みいただきたいのですが、生成AIを今回の研究のような用途で活用していたとしても、その出力(回答)の内容をきちんと確認しているのであれば、私は能力が低いとは考えません。
別の記事でも書いたことがありますが、生成AIはどのような専門的な内容であっても、質問すれば(その正確さは別として)回答を生成してくれます。
今回の研究は糖尿病に関するテーマでしたが、もちろん医薬品に関する質問であっても、立派な回答を生成してもらえます。
しかし、その内容が正しいかどうかは誰が判断するのでしょうか。言うまでもなく、医薬品の専門的な知識を持っている人間が判断しなければなりません。
「ホーデノショーニー(イロコイ連邦)の文化におけるワンプムベルトの重要性」について知識のない私が、このトピックに関する回答を確認しようとしても、正確性の判断ができないのと同じです。
話がそれましたが、要するに、生成AIを適切に活用している(回答の内容を、きちんと精査して利用している)ということは、
- 回答を精査できるレベルの専門知識や経験を有している
- 正確な情報を収集する能力(添付文書・IF・学術論文などを探索する能力)を有している
と考えられるので、「スキル不足」「能力が低い」とは言えないと思うのです。
(もちろん、生成AIの回答を無条件で鵜呑みにしている場合は話が変わってきますが)
以上の私の考えをまとめると、調剤薬局において薬剤師が生成AIの回答を「きちんと精査した上で」活用していた場合、その薬剤師には「生成AIの専門的な回答を自身の能力で精査できるだけの知識・能力がある」と言えるのではないでしょうか。
しかし、患者さんがどう思うかは…
調剤薬局に来られる患者さんの中には、AIの活用を歓迎する方もいれば、そうでない方もいるでしょう。
ただ、よく考えてみると、服薬指導の場面ですぐに質問に回答できない時、患者さんにお時間をいただいて調べることがあると思います。そしてその回答の根拠になるのは、おそらく客観的に見て信頼のおける資料であり、回答の際は必要に応じてその情報源を提示することができるはずです。
生成AIに質問をした場合も同じかもしれません。情報源を聞かれて「生成AIが…」とだけ言うと、確かに信頼関係が崩れるかもしれませんが、そうではなく「生成AIが提示した回答の根拠となった情報源」を把握した上で回答を精査し、問題ないと判断した回答の内容を患者さんに伝えれば良いのではないでしょうか。
この方法であれば、もし情報源の提示を求められたら、自信を持って「回答の根拠となった情報源」を提示することも可能です。
そういった観点から、普段から信頼のおける情報源を確保しておき、それらの情報源からのみ回答を得るRAGを活用したシステム(NotebookLM等)を活用したり、情報元を提示してくれるWeb検索機能を活用するのが有効かもしれません。
ただし、後日投稿予定の記事で触れますが、Web検索機能には一定のリスクも伴いますので、注意が必要です。
あと、何度も同じようなことを書いているので恐縮ですが、単一の薬剤に関する副作用などの「間違いが許されない、よくある質問」であれば、あえて生成AIを活用せず、自分で直接確認した方が確実で早いと思います。
生成AIを使う前に、本当にそのタスクに生成AIが必要かどうか、生成AIが介入しても問題ないのかを検討するようにしましょう。
参考文献
[1] Kämmer, J. E., Choshen-Hillel, S., Müller-Trede, J., Black, S. L. & Weibler, J. (2023). A systematic review of empirical studies on advice-based decisions in behavioral and organizational research. Decision, 10, 107-137.
[2] Weiner, B. (1985). An attributional theory of achievement motivation and emotion. Psychological Review, 92, 548-573.
