临床推理评分量规整合多框架,信度效度未测
读者现在可以用一份统一量规给大模型回答临床病例时的推理过程打分:它把医学教育评估框架(如OSCE、SCT)与MedR-Bench、HealthBench等临床基准、以及通用推理评估研究整合到一起,对自由文本回答做多维评分,并单独标记病例特定的安全关键错误。
此前医学教育评估与临床LLM基准各自为政,评估决策分散、不透明,难以审查。
三位研究者于9月29日在arXiv发布该量规提案。作者明确说明:量规尚未做评分者间信度、构念效度或临床效用检验,也不替代现有基准的任务指标,目前只是让评估决策显式化、可审查;能否被实际采用,看后续实证结果,尚无第三方复现。
信息源:arxiv.org