阅读研究雷达投资体系
登录 / 注册
登录 / 注册
阅读研究雷达投资体系
历史阅读归档 →

阅读

2026-09-2456 条

CoAx以0.941 AUC定位备份头,仍待第三方复现

快讯
2026-09-23 12:00

做电路分析或安全评估的读者现在多了一个可用的思路:条件共消融(CoAx)能在消融主组件后,按消融效应的增长幅度排序,找出被激活的备份组件,作者自报在GPT-2 IOI电路上以0.941 ROC-AUC恢复已知备份头。

此前要恢复被主组件掩盖的备份头,只能依赖完整状态归因,最强基线在GPT-2-small的IOI电路上只有0.815 ROC-AUC,且无法直接补全不完整电路。

作者自报的测量是:CoAx在该IOI电路上以0.941 ROC-AUC恢复已知备份头,把选出的头补入不完整电路后,不完整度从0.75降到0.21;作者还称该方法在6个架构家族的8个非GPT-2模型上均优于匹配的随机补全。

所有数字均为作者第一方评测,备份头恢复主要在已知答案的IOI设定上验证,尚无他人复现;预印本arXiv 2607.01940(v3,2026年9月23日)。

信息源:arxiv.org

研究

VERPO词元级信用分配避免GRPO训练崩溃

快讯
2026-09-22 12:00

VERPO把教师指导拆到词元级做信用分配,可以避免GRPO按整句估计优势导致的优化崩溃,并在五个科学推理与工具使用任务上取得最高多任务平均分。

此前GRPO按整句打分估计优势,作者称这种整句粒度会引发优化崩溃。

作者自报小模型提升更明显;这是作者第一方评测,无独立复现。

方法细节含Fisher移动成本控制器与FEC投影,v4版9月23日更新,是否成立待第三方验证。

信息源:arxiv.org

研究

苹果probe guidance免额外前向传播引导扩散语言模型

快讯
2026-09-23 08:00

读者现在可以了解一种不增加推理成本就能引导扩散语言模型的方法:苹果机器学习研究团队提出的probe guidance,用现有扩散模型冻结的内部状态构造引导信号,省去autoguidance所需的额外推理前向传播,并称应用于1.7B扩散语言模型时在多项选择题基准上持续提升。

此前autoguidance需要额外的前向传播,且一直缺乏对其原理的解释。

团队自报,该方法在连续扩散语言模型的无条件生成上创下新SOTA。这些成绩均为第一方基准。

该方法还给出一个机制发现:autoguidance中的弱模型必须来自训练的低熵区域。若成立,这对扩散语言模型研究比单个基准数字更有参考价值。以上结果尚未经独立复现,出自2026-09-23提交的论文。

信息源:machinelearning.apple.com

研究

Radical Numerics自报基因组模型能延续适配体优化轨迹

快讯
2026-09-23 21:27

Radical Numerics CEO Eric Nguyen在9月23日Latent Space节目简介中自述:其基因组语言模型在适配体实验中,只展示低分RNA序列后,能复现部分被留出的高分样本。

据该期节目简介,实验将表现最好的适配体留出,仅向模型展示较低分数的序列并逐步抬升,模型随后自行延续了这一轨迹。Nguyen称之为“用DNA思考”的链式推理。

这是公司第一方口径,实验的数据集规模、评分方法与完整结果均未随简介公开,不能当作独立验证的性能。可关注其是否发布可核对的论文或基准。

信息源:latent.space

研究

Ringg自报语音智能体月接700万通电话,成本降九成为厂商口径

快讯
2026-09-23 20:00

OpenAI于9月23日发布客户案例,称印度语音客服平台Ringg的智能体每月处理超过700万通接通电话,最高65%的常规请求无需人工介入。

案例称,Ringg将部分实时工作负载从GPT-4.1迁移到GPT-5.6后,模型成本约下降90%;保险平台Policybazaar接入的来电中67%由智能体处理,平均响应时间从8–12分钟降至60秒以内。

以上解决率、成本降幅与4.8的CSAT均为Ringg与OpenAI自报,无独立验证,且65%为上限口径,典型表现可能更低。

信息源:openai.com

研究

猫箱操盘手离职创业,押注AI泛创作娱乐

快讯
2026-09-24 07:00

猫箱前负责人梁琛奇已于2025年夏离开字节跳动,创立AI娱乐公司「动念引线」。

据《晚点聊》182期节目简介,他此前在字节7年,2023年起在AI产品部门Flow带团队做出猫箱,新公司押注泛创作表达混合轻游戏的体验,并自行训练模型。

他的判断是:当人不再需要为生计工作,泛创作会成为普及、高频的娱乐活动。目前AI娱乐方向尚无公认的爆款产品,公司也未披露融资与用户数据,以上均为其本人陈述。

信息源:podcast.latepost.com

研究

数据不出设备也能联合训练模型,但只在模拟里验证过

实质变化
核验于 2026-10-03 18:32

长期信息 · 《Communication-Efficient Learning of Deep Networks from Decentralized Data》(2016)

有些数据散在大量手机上,隐私不允许集中到服务器。FedAvg 这篇论文的做法是:每台手机用自己的数据在本地训练几轮,只把模型改动发上去取平均,不传原始数据,通信来回次数比集中训练少十倍到一百倍。这类做法统称联邦学习。

今天厂商宣传"数据不上传也能改进模型"时,跑的仍是这套本地训练加平均的底子,后来的改进都在它上面修补。听到这类宣传,先问效果是模拟测的还是真实手机上测的,原论文自己只做到模拟。

如果设备会掉线、数据会变,或有人故意提交坏更新,这些它都没处理。如果问题是这类训练会不会泄露隐私、真实设备上效果如何,它只在模拟里验证过,别拿它下结论。

《Communication-Efficient Learning of Deep Networks from Decentralized Data》(2016)|下次复查 2027-09-20

信息源:arxiv.org

研究

2026-09-2366 条

两大前沿模型同日降价,智能单价进入下行通道

实质变化
2026-09-23 17:00

Anthropic与OpenAI在9月22日相隔约90分钟各发一批新模型,且同时大幅降价:前沿智能的单价正在快速下探。

Anthropic的Claude Opus 5.5定价为每百万token输入4美元、输出20美元,缓存读取0.20美元,官方称典型负载下比Opus 5便宜40%,缓存读取便宜60%。OpenAI的GPT-6 Sol定价比GPT-5.6降50%至2/10美元,Luna降至0.10/0.50美元。

性能领先的说法全部来自厂商自报基准:Anthropic自己承认在这个能力水平上基准分差已不太能反映实际差距,OpenAI引用的AutomationBench等对比也由各家自行口径。读者可把降价当作已核实事实,把性能排名当作待验证主张。

信息源:therundown.ai

研究

Opus 5.5降价四成成默认模型,高用量档却省不了钱

实质变化
2026-09-23 14:41

Anthropic发布Opus 5.5并设为默认模型,标价降两成,但高用量任务的实际成本几乎没降。

9月22日上线,官方称多数任务达到Fable 5.1水平、运行成本比Opus 5低40%,输入/输出价从每百万token 5/25美元降至4/20美元,并即时成为Claude Code与应用的默认模型。

但Artificial Analysis测算:max档下token用量增加会推高每任务成本约80%,叠加降价与缓存优惠后为5.98美元,与Opus 5的5.86美元基本持平。省40%的说法只在默认档成立。

性能数字均为厂商及合作方口径,模型更小的传闻未经证实;选型时应按自己的任务档位实测成本。

信息源:latent.space

研究

Anthropic发布Opus 5.5,缓存读取价格降六成

实质变化
2026-09-23 06:58

Anthropic于9月22日发布Claude Opus 5.5,输入价格降至每百万token 4美元,输出20美元,缓存读取降60%至20美分;高速服务模式为8美元和40美元。

模型已在Claude开发者平台及AWS、谷歌云、Azure上线,Sonnet 5.5和Haiku 5.5将在未来数周推出。同日OpenAI也以半价发布GPT-6 Sol和Luna,旗舰价格战同一天在两家展开。

文中基准成绩如Terminal-Bench 4.0的66.4%均为Anthropic自报口径,第三方验证尚未出现;对跑长会话代理的团队,缓存降价是当下最确定的成本变化。

信息源:siliconangle.com

研究

Anthropic新旗舰降价两成发布,性能口径仍是自测

实质变化
2026-09-23 00:30

Anthropic于9月22日发布Opus 5.5,输出token价格从上一代的每百万25美元降到20美元,降幅两成。

公司称这是其测试过的最强模型,在多项基准上超过自家更大的Fable模型。这些跑分全部是厂商自测口径,METR等外部机构只做发布前安全评估,尚无独立性能验证。

该模型称与Mythos在生物和网络安全能力上相当,因此沿用Fable同款使用限制。Sonnet 5.5和Haiku 5.5将在未来数周发布,降价是否延续到中端型号更值得买家关注。

信息源:techcrunch.com

研究

OpenAI新Sol和Luna降价一半上市,可靠性仍是自测口径

实质变化
2026-09-23 02:00

OpenAI于9月22日发布GPT-6 Sol和Luna,API定价为5.6系列同档模型的一半,公司称降价来自缓存和推理改进。

Sol面向编码等复杂任务,Luna面向总结、信息抽取等高频文书任务,已上线ChatGPT Work、Codex和API,Luna还将覆盖免费和Go用户。

可靠性说法需打折:所谓错误率减半出自OpenAI基于用户标记对话的内部评估,并非第三方测试。发布前90分钟Anthropic刚推出Opus 5.5,两家比价节奏明显。

信息源:techcrunch.com

研究
下一页阅读 →