Open claims

Judgments waiting to be verified

29 · Review window: 90 days from verification.

Summary you can quote

DisconfirmAI is tracking 29 self-reported claims. As of 2026-09-19, none has been independently reproduced. Each carries a review date and the evidence that would overturn it; results are written back when the date arrives, and revisions stay public.

ClaimReported figureOriginal materialReview dateStatus
前OpenAI研究者创办的TypeSafe发布非LLM模型Jev,输出校准概率而非文本自测 · 未经独立验证techcrunch.com2026-12-17Pending
单作者预印本自报:Fathom按查询自适应读取K缓存位数,百万token解码步较136位稀疏扫描快1.67倍自报 · 未经独立验证1.67倍arxiv.org2026-12-17Pending
预印本自报:SmolVLA转ONNX延迟减半但Spatial成功率跌至41%,语言宽度24可恢复至75%自报41% / 75%arxiv.org2026-12-17Pending
预印本自报:M2Tok多头多码本动作分词降低重建损失、提升VLA成功率自报arxiv.org2026-12-17Pending
预印本自报:UTTO以不确定性引导测试时优化,提升深度-only开放词汇3D分割自报 · 未经独立验证arxiv.org2026-12-17Pending
预印本自报:TeleAntiFraud 2.0上,近域负样本使诈骗检测分类器Macro-F1从满分降至0.65–0.68自报arxiv.org2026-12-17Pending
WoundAIssist远程伤口护理论文标注ACM期刊发表,可用性结论系作者自报自报arxiv.org2026-12-17Pending
预印本自报:CSWAM将RoboTwin 2.0 Clean-to-Randomized成功率从10.16%提至45.18%,仍未过半自报 · 自测10.16% / 45.18%arxiv.org2026-12-17Pending
预印本自报:LCS单遍引导称VLM驾驶推理延迟较两遍CFG降约50%,数字待独立复现自报 · 待独立复现50%arxiv.org2026-12-17Pending
预印本自报:FRAUDSkill冻结权重、只在外部优化技能,TeleAntiFraud上Macro-F1报73.50%自报 · 未经独立验证73.50%arxiv.org2026-12-17Pending
预印本自报:四款医用深度传感器对比,Zivid 2M+ 60全项最优,ZED 2i体模垫底自报 · 第一方arxiv.org2026-12-17Pending
预印本自报:RECAL称在DARPA E3入侵检测数据集上将平均误报率较最低FPR基线降低4至105倍自报105倍arxiv.org2026-12-17Pending
预印本自报:单作者以统计力学解释双下降,称增参等效增强权重正则化自报arxiv.org2026-12-17Pending
预印本自报:VT-MUSE统一视触觉时序表征,仿真基准领先所评最强基线11个百分点自报 · 未经独立验证11个百分点arxiv.org2026-12-17Pending
预印本自报:VLA适配成本可先诊断后分配,xArm-7上0.04%参数匹配全量微调自报0.04%arxiv.org2026-12-17Pending
预印本自报:以生成接触音的响度塑造力曲线,Franka机器人零样本完成擦拭、削皮自报 · 未经独立验证arxiv.org2026-12-17Pending
Anthropic自报:Claude已主导公司26%的AI研发,3月不足1%自报 · 第一方26% / 1%businessinsider.com2026-12-17Pending
EfficientTDMPC预印本自报样本效率新最优,未经独立复现自报arxiv.org2026-12-17Pending
DeepMind研究所发文:可见思维链是安全优势,OpenAI系统卡已报告可监测性下降厂商自述the-decoder.com2026-12-17Pending
苹果发表DSAS:引导强度不固定,按输入和层动态计算自报 · 尚无独立验证machinelearning.apple.com2026-12-17Pending
Anthropic首次披露研发自动化指标:“AI主导”占26%,打分的也是Claude尚无独立验证26%the-decoder.com2026-12-17Pending
三人团队在OpenAI漏洞赏金计划下用Claude Opus 5接管员工账号,OpenAI称已修复第一方techcrunch.com2026-12-17Pending
42位英国皇家学会数学院士联名警告AI存在性风险,敦促学会提醒政府与媒体未经独立验证the-decoder.com2026-12-17Pending
OpenAI推出法律AI产品Astra for Law,自测基准200题通过率54%自测 · 第一方54%the-decoder.com2026-12-17Pending
Napster与GEMS Education签约,在迪拜开展AI教师数字人概念验证未经独立验证wired.com2026-12-17Pending
AWS发布SageMaker HyperPod Inference Gateway,TTFT最多降98%出自自家基准未经独立验证 · 第一方98%aws.amazon.com2026-12-17Pending
预印本自报:自进化智能体技能池过临界规模后污染难回滚,VaG门控在Terminal-Bench 2达72% pass@1自报 · 自测72%arxiv.org2026-12-17Pending
MoRE预印本自报:相邻层组共享专家池,三规模同等预算下困惑度低于标准MoE自报 · 未经独立验证arxiv.org2026-12-17Pending
G2G预印本:冻结基座仅训约32M参数做跨组位姿估计,自报四数据集两项任务SOTA自报arxiv.org2026-12-17Pending

Claims appear in their original language (zh) and are not rewritten before independent verification. English summaries are added by the site desk, one at a time.

Back to overview

Judgments waiting to be verified | DisconfirmAI