| 前OpenAI研究者创办的TypeSafe发布非LLM模型Jev,输出校准概率而非文本自测 · 未经独立验证 | — | techcrunch.com | 2026-12-17 | 待复核 |
| 单作者预印本自报:Fathom按查询自适应读取K缓存位数,百万token解码步较136位稀疏扫描快1.67倍自报 · 未经独立验证 | 1.67倍 | arxiv.org | 2026-12-17 | 待复核 |
| 预印本自报:SmolVLA转ONNX延迟减半但Spatial成功率跌至41%,语言宽度24可恢复至75%自报 | 41% / 75% | arxiv.org | 2026-12-17 | 待复核 |
| 预印本自报:M2Tok多头多码本动作分词降低重建损失、提升VLA成功率自报 | — | arxiv.org | 2026-12-17 | 待复核 |
| 预印本自报:UTTO以不确定性引导测试时优化,提升深度-only开放词汇3D分割自报 · 未经独立验证 | — | arxiv.org | 2026-12-17 | 待复核 |
| 预印本自报:TeleAntiFraud 2.0上,近域负样本使诈骗检测分类器Macro-F1从满分降至0.65–0.68自报 | — | arxiv.org | 2026-12-17 | 待复核 |
| WoundAIssist远程伤口护理论文标注ACM期刊发表,可用性结论系作者自报自报 | — | arxiv.org | 2026-12-17 | 待复核 |
| 预印本自报:CSWAM将RoboTwin 2.0 Clean-to-Randomized成功率从10.16%提至45.18%,仍未过半自报 · 自测 | 10.16% / 45.18% | arxiv.org | 2026-12-17 | 待复核 |
| 预印本自报:LCS单遍引导称VLM驾驶推理延迟较两遍CFG降约50%,数字待独立复现自报 · 待独立复现 | 50% | arxiv.org | 2026-12-17 | 待复核 |
| 预印本自报:FRAUDSkill冻结权重、只在外部优化技能,TeleAntiFraud上Macro-F1报73.50%自报 · 未经独立验证 | 73.50% | arxiv.org | 2026-12-17 | 待复核 |
| 预印本自报:四款医用深度传感器对比,Zivid 2M+ 60全项最优,ZED 2i体模垫底自报 · 第一方 | — | arxiv.org | 2026-12-17 | 待复核 |
| 预印本自报:RECAL称在DARPA E3入侵检测数据集上将平均误报率较最低FPR基线降低4至105倍自报 | 105倍 | arxiv.org | 2026-12-17 | 待复核 |
| 预印本自报:单作者以统计力学解释双下降,称增参等效增强权重正则化自报 | — | arxiv.org | 2026-12-17 | 待复核 |
| 预印本自报:VT-MUSE统一视触觉时序表征,仿真基准领先所评最强基线11个百分点自报 · 未经独立验证 | 11个百分点 | arxiv.org | 2026-12-17 | 待复核 |
| 预印本自报:VLA适配成本可先诊断后分配,xArm-7上0.04%参数匹配全量微调自报 | 0.04% | arxiv.org | 2026-12-17 | 待复核 |
| 预印本自报:以生成接触音的响度塑造力曲线,Franka机器人零样本完成擦拭、削皮自报 · 未经独立验证 | — | arxiv.org | 2026-12-17 | 待复核 |
| Anthropic自报:Claude已主导公司26%的AI研发,3月不足1%自报 · 第一方 | 26% / 1% | businessinsider.com | 2026-12-17 | 待复核 |
| EfficientTDMPC预印本自报样本效率新最优,未经独立复现自报 | — | arxiv.org | 2026-12-17 | 待复核 |
| DeepMind研究所发文:可见思维链是安全优势,OpenAI系统卡已报告可监测性下降厂商自述 | — | the-decoder.com | 2026-12-17 | 待复核 |
| 苹果发表DSAS:引导强度不固定,按输入和层动态计算自报 · 尚无独立验证 | — | machinelearning.apple.com | 2026-12-17 | 待复核 |
| Anthropic首次披露研发自动化指标:“AI主导”占26%,打分的也是Claude尚无独立验证 | 26% | the-decoder.com | 2026-12-17 | 待复核 |
| 三人团队在OpenAI漏洞赏金计划下用Claude Opus 5接管员工账号,OpenAI称已修复第一方 | — | techcrunch.com | 2026-12-17 | 待复核 |
| 42位英国皇家学会数学院士联名警告AI存在性风险,敦促学会提醒政府与媒体未经独立验证 | — | the-decoder.com | 2026-12-17 | 待复核 |
| OpenAI推出法律AI产品Astra for Law,自测基准200题通过率54%自测 · 第一方 | 54% | the-decoder.com | 2026-12-17 | 待复核 |
| Napster与GEMS Education签约,在迪拜开展AI教师数字人概念验证未经独立验证 | — | wired.com | 2026-12-17 | 待复核 |
| AWS发布SageMaker HyperPod Inference Gateway,TTFT最多降98%出自自家基准未经独立验证 · 第一方 | 98% | aws.amazon.com | 2026-12-17 | 待复核 |
| 预印本自报:自进化智能体技能池过临界规模后污染难回滚,VaG门控在Terminal-Bench 2达72% pass@1自报 · 自测 | 72% | arxiv.org | 2026-12-17 | 待复核 |
| MoRE预印本自报:相邻层组共享专家池,三规模同等预算下困惑度低于标准MoE自报 · 未经独立验证 | — | arxiv.org | 2026-12-17 | 待复核 |
| G2G预印本:冻结基座仅训约32M参数做跨组位姿估计,自报四数据集两项任务SOTA自报 | — | arxiv.org | 2026-12-17 | 待复核 |