预印本自报:TeleAntiFraud 2.0上,近域负样本使诈骗检测分类器Macro-F1从满分降至0.65–0.68
普通负样本上的满分可能只是负样本太容易;该基准按月更新,独立复现是下一步值得盯的信号。
原始事件 2026-09-16
资料核对时间:2026/09/18 14:00
这是一篇历史文章。正文中的预测、价格和后续节点均属于当时的时间范围。
Huiyuan Liu、Zhiming Ma等十四名作者9月16日在arXiv提交预印本(17日更新v2),提出TeleAntiFraud 2.0:每月冻结一套900通中文电话音频评测集,其中600通欺诈、300通近域非欺诈。作者自报、未经独立复现:受控文本实验中三个分类器在无关或普通负样本上Macro-F1满分,换成共享上下文的近域同源负样本后降至0.65–0.68;全量音频与ASR+LLM评测还发现类别先验捷径、预测坍缩与快照敏感性。落差出自同一批分类器在两类负样本上的受控对比,而近域同源负样本正是这套基准特意收录的难点。