预印本自报:TeleAntiFraud 2.0上,近域负样本使诈骗检测分类器Macro-F1从满分降至0.65–0.68
普通负样本上的满分可能只是负样本太容易;该基准按月更新,独立复现是下一步值得盯的信号。
原始事件 2026-09-16
Sources checked:09/18/2026, 14:00 · Original article in Chinese
This is an archived article. Forecasts, prices and upcoming events refer to its original time period.
Huiyuan Liu、Zhiming Ma等十四名作者9月16日在arXiv提交预印本(17日更新v2),提出TeleAntiFraud 2.0:每月冻结一套900通中文电话音频评测集,其中600通欺诈、300通近域非欺诈。作者自报、未经独立复现:受控文本实验中三个分类器在无关或普通负样本上Macro-F1满分,换成共享上下文的近域同源负样本后降至0.65–0.68;全量音频与ASR+LLM评测还发现类别先验捷径、预测坍缩与快照敏感性。落差出自同一批分类器在两类负样本上的受控对比,而近域同源负样本正是这套基准特意收录的难点。