最も多い箱は「その他」 ― 研修医が四つの言語モデルを標準の参照先と突き合わせる(2025年10月)
家庭医療・内科・精神科の研修医が実際の診療の中で OpenEvidence を使い、その結論が臨床的に妥当かを評価するとともに、他の三つの大規模言語モデルの出力と比較する研究である。登録上の介入は「その他」とされている。
試験の概要(一次情報)
- 進行状況実施中(募集終了)
- 対象疾患AI (Artificial Intelligence)、Large Language Model、Generative Artificial Intelligence
- 介入/手法OTHER: AI clinical reference tool
- スポンサーCambridge Health Alliance
- 目標症例数20 例
- 期間2025-10-01 〜 2026-09-30
要点
- OpenEvidence は査読を経た医学研究のデータを集約・統合し、生成的な人工知能で利用者の問いに応答するオンラインの道具である。
- 多くの臨床家が使っている一方、出力が正確か、臨床上の意思決定を適切に導くかについて公表されたデータはほとんど無いとされる。
- 家庭医療・内科・精神科の研修医が診療の過程で用いたときに、臨床的に妥当な判断につながるかを明らかにする。
- あわせて OpenAI の ChatGPT、Anthropic の Claude、Google の Gemini と出力を比較する。
- 安全上のリスクを抑えるため研修医は標準的な参照の道具も併用し、目標登録者数は20人である。
1最も多い箱が、最も何も言っていない
ここまで見た四つの箱は、それぞれ意味を持っていた。観察・診断検査・機器・行動的介入。この記事で見るのは、登録上いちばん多く選ばれている箱であり、同時に分類としてほとんど情報を持たない箱である。「その他」。
四件に一件が「その他」である。 何をするAIなのかは、この欄からは分からない。
2何を確かめようとしているのか
試験問題ではなく、実際の診療で出た問いを使うという設計が要点である。登録は、実世界の臨床の場で性能を検証した研究はほとんどなく、比較したものはさらに少ないと述べている。
3観察研究でありながら介入が登録されている
この登録は種別が観察研究でありながら、介入の欄に「臨床の参照ツール」が記載されている。研修医が道具を使うという行為はあるが、患者への介入ではない。 そのねじれが、「その他」という箱に落ち着く理由の一つと読める。
目標登録者数は20人。ここでの被験者は患者ではなく研修医である。次の記事では、AIが手技として登録された例を見る。
なぜ重要か
登録上いちばん多く選ばれている介入の箱は「その他」で、四件に一件を占める。その欄からは何をするAIなのかが分からないため、分類として持つ情報は最も少ない。臨床家が道具を使うという行為はあっても患者への介入ではない、という位置づけの研究がここに集まりやすく、実世界の診療で言語モデルを検証する試みもその一つにあたる。
よくある質問(FAQ)
なぜ試験問題ではなく実際の診療の問いを使うのですか?
被験者は患者ですか?
なぜ介入が「その他」なのですか?
出典(一次情報)
出典:ClinicalTrials.gov(米国NIH/NLM・パブリックドメイン)。本サイトは医療助言を行いません。最新・正確な内容は公式をご確認ください。本サイトは NIH/NLM に推奨・認定されたものではありません。
- ClinicalTrials.gov(試験登録・原文)
- 登録番号: NCT07199231