研究者提出临床推理评估量规,尚无实测检验
把医学教育评估与临床LLM基准整合成统一评分框架,但信度效度未测,先看后续实证。
三位研究者于9月29日在arXiv发布一份量规提案,用于给大模型回答临床病例时的推理过程打分。
量规把医学教育里的评估框架(如OSCE、SCT)与MedR-Bench、HealthBench等临床基准、以及通用推理评估研究整合到一起,对自由文本回答做多维评分,并单独标记病例特定的安全关键错误。
作者明确说明:该量规尚未做评分者间信度、构念效度或临床效用检验,也不替代现有基准的任务指标,目前只是让评估决策显式化、可审查。能否被实际采用,看后续实证结果。