待验证

等待被验证的判断

29 · 复核窗口:自核验日起 90 天。

可整段引用的摘要

DisconfirmAI 追踪到 29 条自报口径的判断。截至 2026-09-19,无一获得独立复现。每条都带复核日期与推翻它所需的证据;到期回填结果,修订记录公开保留。

判断自报数字原始材料复核日期状态
前OpenAI研究者创办的TypeSafe发布非LLM模型Jev,输出校准概率而非文本自测 · 未经独立验证techcrunch.com2026-12-17待复核
单作者预印本自报:Fathom按查询自适应读取K缓存位数,百万token解码步较136位稀疏扫描快1.67倍自报 · 未经独立验证1.67倍arxiv.org2026-12-17待复核
预印本自报:SmolVLA转ONNX延迟减半但Spatial成功率跌至41%,语言宽度24可恢复至75%自报41% / 75%arxiv.org2026-12-17待复核
预印本自报:M2Tok多头多码本动作分词降低重建损失、提升VLA成功率自报arxiv.org2026-12-17待复核
预印本自报:UTTO以不确定性引导测试时优化,提升深度-only开放词汇3D分割自报 · 未经独立验证arxiv.org2026-12-17待复核
预印本自报:TeleAntiFraud 2.0上,近域负样本使诈骗检测分类器Macro-F1从满分降至0.65–0.68自报arxiv.org2026-12-17待复核
WoundAIssist远程伤口护理论文标注ACM期刊发表,可用性结论系作者自报自报arxiv.org2026-12-17待复核
预印本自报:CSWAM将RoboTwin 2.0 Clean-to-Randomized成功率从10.16%提至45.18%,仍未过半自报 · 自测10.16% / 45.18%arxiv.org2026-12-17待复核
预印本自报:LCS单遍引导称VLM驾驶推理延迟较两遍CFG降约50%,数字待独立复现自报 · 待独立复现50%arxiv.org2026-12-17待复核
预印本自报:FRAUDSkill冻结权重、只在外部优化技能,TeleAntiFraud上Macro-F1报73.50%自报 · 未经独立验证73.50%arxiv.org2026-12-17待复核
预印本自报:四款医用深度传感器对比,Zivid 2M+ 60全项最优,ZED 2i体模垫底自报 · 第一方arxiv.org2026-12-17待复核
预印本自报:RECAL称在DARPA E3入侵检测数据集上将平均误报率较最低FPR基线降低4至105倍自报105倍arxiv.org2026-12-17待复核
预印本自报:单作者以统计力学解释双下降,称增参等效增强权重正则化自报arxiv.org2026-12-17待复核
预印本自报:VT-MUSE统一视触觉时序表征,仿真基准领先所评最强基线11个百分点自报 · 未经独立验证11个百分点arxiv.org2026-12-17待复核
预印本自报:VLA适配成本可先诊断后分配,xArm-7上0.04%参数匹配全量微调自报0.04%arxiv.org2026-12-17待复核
预印本自报:以生成接触音的响度塑造力曲线,Franka机器人零样本完成擦拭、削皮自报 · 未经独立验证arxiv.org2026-12-17待复核
Anthropic自报:Claude已主导公司26%的AI研发,3月不足1%自报 · 第一方26% / 1%businessinsider.com2026-12-17待复核
EfficientTDMPC预印本自报样本效率新最优,未经独立复现自报arxiv.org2026-12-17待复核
DeepMind研究所发文:可见思维链是安全优势,OpenAI系统卡已报告可监测性下降厂商自述the-decoder.com2026-12-17待复核
苹果发表DSAS:引导强度不固定,按输入和层动态计算自报 · 尚无独立验证machinelearning.apple.com2026-12-17待复核
Anthropic首次披露研发自动化指标:“AI主导”占26%,打分的也是Claude尚无独立验证26%the-decoder.com2026-12-17待复核
三人团队在OpenAI漏洞赏金计划下用Claude Opus 5接管员工账号,OpenAI称已修复第一方techcrunch.com2026-12-17待复核
42位英国皇家学会数学院士联名警告AI存在性风险,敦促学会提醒政府与媒体未经独立验证the-decoder.com2026-12-17待复核
OpenAI推出法律AI产品Astra for Law,自测基准200题通过率54%自测 · 第一方54%the-decoder.com2026-12-17待复核
Napster与GEMS Education签约,在迪拜开展AI教师数字人概念验证未经独立验证wired.com2026-12-17待复核
AWS发布SageMaker HyperPod Inference Gateway,TTFT最多降98%出自自家基准未经独立验证 · 第一方98%aws.amazon.com2026-12-17待复核
预印本自报:自进化智能体技能池过临界规模后污染难回滚,VaG门控在Terminal-Bench 2达72% pass@1自报 · 自测72%arxiv.org2026-12-17待复核
MoRE预印本自报:相邻层组共享专家池,三规模同等预算下困惑度低于标准MoE自报 · 未经独立验证arxiv.org2026-12-17待复核
G2G预印本:冻结基座仅训约32M参数做跨组位姿估计,自报四数据集两项任务SOTA自报arxiv.org2026-12-17待复核

返回总览