TL;DR: 実カルテは公開できずラベルも不完全という臨床AIベンチマークの根本問題を、完全合成データで解決した研究です。フロンティアモデルでもトップ医師の性能には届きませんでした。
タイトル: Synthetic Hospital: An Open, Verifiable, Physician-Validated Longitudinal EHR Benchmark
URL:
ポイント
🏥 医学教育教材から1,268人・5,602受診分の完全合成カルテを構築し、個人情報ゼロで公開可能に
🔗 診断・所見・時間関係をICD-10-CM/SNOMED CT/LOINCへ決定的に紐づけ、ラベルは知識グラフから機械的に導出
👨⚕️ 医師によるリアリズム検証で、実カルテとの識別精度はほぼチャンスレベルの53%
📊 10モデルを5タスクで評価。患者診断の最高スコアはKimi 2.5-thinkingの重症度加重F1 0.732で医師平均と同水準
⚠️ トップ医師(0.89)には未到達。要約タスクではどのモデルも所見の約半分を見落とし
🔁 生成モデルを変えても性能変化は0.05以下、臨床状態そのものを測るベンチマークであることを確認
臨床LLMの実力を偽りなく測れる基盤が整った意義は大きいと感じます。
#
医療AI# #
LLMベンチマーク#