拓冰建站拓冰建站
首页 / 资讯中心 / 正文

Clinical-R1: Empowering Large Language Models for Faithful and Comprehensive Reasoning with Clini...

文章总结与翻译一、主要内容本文聚焦医疗领域大语言模型(LLMs)的推理优化问题,针对现有强化学习后训练方法(如GRPO)仅优化答案正确性、与医疗领域对推理的真实性、全面性要求脱节的痛点,提出了临床目标相对策略优化(CRPO)框架,并基于该框架训练了专注于非影像临床推理的轻量级模型Clinical-R1-3B(30亿参数)。核心背景:医疗等高风险领域对LLM推理的要求是多维的,不仅需要答案准确,还需推理过程可验证、符合临床认知逻辑(如双加工思维),而现有RL方法(如PPO、GRPO)或依赖人类标注,或仅追求单一正确性目标,无法满足临床需求。方法设计:CRPO是GRPO的多目标扩展,通过规则化、可验证的奖励函数,联合优化准确性、真实性、全面性三大目标,无需人类标注。设计临床推理奖励机制,要求模型用dx(假设驱动推理,含直觉过程System 1和分析过程System 2)和conclusion(结论合成)标签分离推理与结论,且结论需引用dx中的分析元素,强化推理连贯性。奖励函数包含三部分:准确性奖励(答案正确性)、临床推理奖励(格式合规性+跨引用)、一致性奖励(有效 tokens 占比,避免偏离主题)。
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门