医療AI臨床試験:トルコ語の救急外来記録で大規模言語モデル2種の診断一致度を測る ― 専門医3人の盲検合議を基準に600例(NCT07632859)
匿名化されたトルコ語の救急外来の問診記録600例を対象に、2つの大規模言語モデル(GPT-4.1、Claude Sonnet 4.6)が付けた診断が、盲検化された救急科専門医3人の多数決とどれだけ一致するかをICD-10の章レベルで測る後ろ向きの観察研究。2026年8月に完了として記録されている。
試験の概要(一次情報)
- 進行状況完了
- 対象疾患Emergency Medicine、Diagnostic Errors、Artificial Intelligence (AI) in Diagnosis
- スポンサーMarmara University Pendik Training and Research Hospital
- 目標症例数600 例
- 期間2026-05-01 〜 2026-08-07
要点
- 基準は、救急科の認定専門医3人が互いに盲検の状態でICD-10に独立分類した多数決。章レベルで多数一致が得られない症例は補充せず除外する。
- 両モデルは記録ごとに1回だけ、固定した単一のプロンプト・temperature 0・状態を持たないAPI呼び出しで問い合わせる。検索補強・外部ツール・拡張推論モードは用いない。
- 主要評価項目は、第1位の診断が基準とICD-10章レベルで一致した割合(Wilsonの95%信頼区間つき)。
- 症例終了時に入力されたICD-10コードは比較対象ではなく、記録実務の描写として同じ基準に照らすのみで、優越性・非劣性の検定は行わない。
- 解析計画は精度の計算前に確定・凍結され、報告はSTARD-AI 2025に従う。対象は匿名化されたトルコ語の記録600例。
- 専門医3人の盲検合議を正解とし、単一プロンプト・temperature 0・解析計画の凍結まで条件を固定している。
1何を「正解」とするかを先に決めておく
大規模言語モデルの診断能力を測る研究で最も難しいのは、何を正解とするかである。この研究が基準に据えたのは、救急科の認定専門医3人が互いに盲検の状態で独立に付けたICD-10コードの多数決だ。担当医が症例終了時に入力したコードも、その後の臨床経過も、専門医には伏せられている。さらに、専門医のあいだで章レベルの多数一致が得られなかった症例は、補充せずに除外する。正解が揺れる症例を無理に採点対象にしない、という判断である。
2再現できる形で測るための固定条件
測り方の条件も細かく固定されている。記録ごとに1回だけ、固定した単一のプロンプトで、temperature 0の状態を持たないAPI呼び出し。検索による補強も、外部ツールも、拡張推論モードも使わない。そして解析計画は、精度の計算を始める前に確定・凍結されている。生成モデルは同じ入力でも出力が揺れ、プロンプトや設定を変えれば数字も動く。
条件を書き残して凍結することは、その揺れを後から都合よく使わないための歯止めにあたる。報告はSTARD-AI 2025という診断精度研究の報告指針に従うとされている。
3観察研究が全体の44%を占める
注意深いのは、症例終了時に入力されたICD-10コードの扱いだ。記録はこれを比較対象ではないと明示し、現在の記録実務を描写するものとして同じ基準に照らすだけで、優越性や非劣性の検定は行わないとしている。2026年8月28日時点で当サイトが保持する医療AI臨床試験750件のうち、観察研究は333件で全体の44%を占める。
介入研究が417件(56%)であることを踏まえると、AIを使って何かを変える試験と、AIそのものを測る試験が、ほぼ拮抗している構図が見える。なお、結果の数値はこのレジストリの記録には含まれていない。
4揺れないように条件を固定する
生成モデルは同じ入力でも出力が揺れ、プロンプトや設定を変えれば数字も動きます。この研究は、その揺れを後から都合よく使わないための条件を先に固定しています。
- 1正解を先に決める救急科の認定専門医3人が互いに盲検で独立に付けたICD-10コードの多数決
- 2揺れる症例は除外する章レベルの多数一致が得られなかった症例は補充せずに除外する
- 3測り方を固定する記録ごとに1回だけ、固定した単一のプロンプト、temperature 0、外部ツールなし
- 4解析計画を凍結する精度の計算を始める前に確定・凍結する
報告はSTARD-AI 2025という診断精度研究の報告指針に従うとされています。症例終了時に入力されたICD-10コードは比較対象ではないと明示され、現在の記録実務を描写するものとして同じ基準に照らすだけで、優越性や非劣性の検定は行わないとされています。
なぜ重要か
大規模言語モデルの臨床評価では、プロンプト・温度・推論モードといった条件次第で数字が動く。条件を固定して書き残し、解析計画を計算前に凍結し、報告指針に従うという手順は、AIの性能主張をどう検証可能にするかという問いへの具体的な回答になっている。英語以外の言語で測っている点も、評価の偏りを考えるうえで意味を持つ。
よくある質問(FAQ)
なぜ専門医3人の多数決を基準にするのですか?
解析計画を凍結するとはどういう意味ですか?
どちらのモデルが優れていると示されたのですか?
出典(一次情報)
出典:ClinicalTrials.gov(米国NIH/NLM・パブリックドメイン)。本サイトは医療助言を行いません。最新・正確な内容は公式をご確認ください。本サイトは NIH/NLM に推奨・認定されたものではありません。
- ClinicalTrials.gov(試験登録・原文)
- 登録番号: NCT07632859