Evaluating Large Language Models on Rare Disease Diagnosis: A Case Study using House M.D

发布时间:2026/7/21 9:00:44
Evaluating Large Language Models on Rare Disease Diagnosis: A Case Study using House M.D 一、文章主要内容总结该研究聚焦大型语言模型(LLMs)在罕见病诊断中的表现,核心围绕“基于《豪斯医生》(House M.D.)构建的叙事医学案例数据集”展开评估与分析,具体内容如下:研究背景:LLMs在多领域展现出强大能力,但在基于叙事性医学案例的罕见病诊断方面研究不足;现有医学数据集存在隐私限制、缺乏叙事驱动的诊断结构、规模有限等问题,而《豪斯医生》作为经医学教育验证的剧集,其叙事化病例可弥补这一缺口。数据集构建:从《豪斯医生》8季176集的公开维基内容中提取症状-诊断配对,经网页爬取、标准化病例转换、质量过滤三步流程,最终形成176个覆盖多医学专科、需多步推理的复杂病例数据集,且该数据集公开可获取。研究方法:选取4款主流LLMs(GPT-4o Mini、GPT-5 Mini、Gemini 2.5 Flash、Gemini 2.5 Pro),采用结构化提示词设计模拟临床场景,通过模糊字符串匹配(相似度阈值0.8)评估模型从症状到诊断的预测准确性。核心结果:模型准确率差异显著,范围为16.48%(GPT-4o Mini)至38.64%(Gemini 2.5 Pro),新一代模型较早期模型性能提升2.3倍;病例难度随剧集季数波动(第一季准确率56.52%,第五季20.83%),模型对常见疾病诊断表现更佳,对罕见病、多系统自身免疫病等复杂病例仍面临巨大挑战;研究意义/