资讯1 分钟阅读·
手术视频问答基准自报14256问答对与14.61%提升
SurgRAW作者自报SurgCoTBench含14256问答对,检索增强多智能体推理超受监督模型14.61%,尚无独立验证。
重要性局部证据E2 未复现
手术视频AI领域现在有了一个覆盖五类手术任务的问答基准SurgCoTBench,作者自报含14256个问答对,检索增强多智能体推理准确率超受监督模型14.61%。
此前该领域缺少统一的手术视频问答评测基准,难以比较不同方法在五类手术任务上的表现。
Chang Han Low等人自报上述基准与14.61%的准确率提升,于9月16日更新arXiv v3,条目标注IEEE RA-L 2026期刊引用;代码已在GitHub开放,数据集已发布。
尚无独立验证。
参考来源: