近域负样本让诈骗检测分类器Macro-F1从满分跌至0.65–0.68
TeleAntiFraud 2.0每月冻结一套900通中文电话(600通欺诈、300通近域非欺诈)的音频评测集,读者可据此检验诈骗检测分类器在近域负样本上的真实表现。此前在无关或普通负样本上,分类器Macro-F1可达满分,掩盖了对共享上下文同源样本的失效。
作者自报,受控文本实验中三个分类器换成近域同源负样本后Macro-F1降至0.65–0.68;全量音频与ASR+LLM评测还发现类别先验捷径、预测坍缩与快照敏感性。结果为作者自报。
边界:结果为作者自报,尚无第三方复现;由Huiyuan Liu、Zhiming Ma等十四名作者于9月16日提交arXiv预印本(17日更新v2,编号2609.18748)。
信息源:arxiv.org