阅读研究雷达投资体系
登录 / 注册
登录 / 注册
阅读研究雷达投资体系
历史阅读归档 →

阅读

2026-10-0258 条

彭博称Anthropic拟11月9日当周启动IPO,时点未定

实质变化
2026-10-02 07:43

彭博10月1日援引匿名信源报道称,Anthropic计划在11月9日当周启动IPO正式路演,赶在感恩节前挂牌;SiliconANGLE转述时说明,公司内部对时间表仍在讨论、可能变动。

据路透看到的招股书,Anthropic 2025财年收入46亿美元、同比增长逾12倍,经营亏损超80亿美元,净亏损超420亿美元,并计划未来数年投入5180亿美元建设AI基础设施。

招股书还用数页篇幅警示AI对人类的“生存风险”,提及模型出现自我保护、隐瞒信息等行为。若上市推迟,可能波及其他AI股票。

信息源:siliconangle.com

研究

ServiceNow发布流水线,按模型短板自动生成智能体训练数据

专题 · 自动训练数据生成快讯
2026-10-02 12:01

ServiceNow CoreAI于10月2日发布AutoSynthData,用目标模型的失败记录和更强教师模型的成功轨迹,自动生成企业智能体的训练任务。

流水线先在目标环境里跑诊断任务,找出模型反复失败的能力点,再据此生成新的系统规则、用户请求和成败判定器,逐条在环境中执行验证后才进入训练。随着模型改进,任务难度跟着缺口移动。

团队用自家的EnterpriseOps Gym环境做了实验,但本次加载的正文在结果部分截断,未给出可核对的提升数字,方法收益目前只能算厂商自述。

信息源:huggingface.co

研究

Greylock领投Parallax,押注3D打印数据中心燃气轮机

专题 · Parallax燃气轮机快讯
2026-10-01 23:30

Greylock于10月1日宣布联合领投创企Parallax的A轮融资,跟投方包括Founders Fund、Lux、General Catalyst等,融资金额未披露。

Parallax的首款产品是一台10MW燃气轮机,专为数据中心设计,用3D打印控制供应链。其出发点是燃气轮机订单已排到2030年以后,而数据中心等不起。

文中提到的美国100GW电力缺口等数字,出自领投方对创始人的转述,公告本身没有给出独立依据。下一步看这家公司能否实际交付机组。

信息源:greylock.com

研究

自蒸馏新方法让电脑操作智能体训练效果小幅提升

专题 · 智能体自我改进快讯
2026-10-01 12:00

ComputerSD把智能体执行操作后的实时反馈转成训练信号,作者称在OSWorld-Verified基准上超过只用结果奖励的训练方法。

具体数字:在Qwen3-VL-8B-Thinking骨干上高1.9个百分点,在专用的EvoCUA-8B上高4.1个百分点,均为论文作者自测。

提升幅度不大,基准也由作者自己运行,方法能否在真实使用中带来同等收益,需等独立复现。

信息源:arxiv.org

研究

无思维链基准存在关键位置混淆,推理深度被高估

快讯
2026-10-02 22:39

把提示中的初始状态移到末尾后,GPT-6.1 Sol的无思维链推理深度中位数下降16%。

Neel Nanda发布的no-cot-bench基准曾显示疑似循环变压器的Astra解题几率约为Fable 5.1的8.6倍。两位研究者指出混淆:初始状态通常在提示开头,模型可以边读边算,基准因此同时测到串行深度和跨token分配计算两种能力。

他们把6个串行状态追踪任务改成初始状态在末尾的版本,并加入无关问题对照排除解析难度干扰。12个任务的深度损失中位数为16%,范围9%至45%。作者只测了GPT-6.1 Sol一个模型,称缺算力未复测其他模型。

信息源:lesswrong.com

研究

5万条智能体错误数据发布,修正建议通过率升至51.1%

专题 · 智能体错误数据集快讯
2026-10-01 12:00

现在可以免重放复用智能体失败轨迹:Agent Error Dataset含50,228条错误诊断对,修正建议在作者自测中把回放验证通过率从18.4%提到51.1%。

此前失败诊断需重放原始任务,成本高且难以复用;该数据集保留原始轨迹与执行元数据,可免重放做再诊断。

Kunlun Zhu等六位作者于9月30日在arXiv发布该数据集,数据来自9,961个任务、33个环境、23个策略模型;作者自测3,062组回放配对得出上述通过率,微调Qwen3-8B后与教师标签的逐步一致率从47.2%升至63.6%。

回放对比仅覆盖支持重放的环境,结果为作者自报,尚无第三方复现。

信息源:arxiv.org

研究

智能体免奖励信号自我改进,4美元追平最高分

专题 · 智能体自我改进快讯
2026-09-30 12:00

你现在可以让智能体不用奖励信号、只靠过往自我改进的记录来提升成功率:SelfSearch在全部六个模型与基准组合上都实现了提升,用DeepSeek V4 Flash时仅花4.03美元搜索成本就得到解出82.0%任务的harness。

此前改进智能体通常要反复跑下游评测,开销大。SelfSearch让智能体读取此前修改尝试的推理、工具动作和结果,作为改进依据,省去这部分开销。

作者自测数字包括:Terminal-Bench 2.1上单个智能体最高提升11.2个百分点;SWE-bench Multilingual上成功率提高5.0个百分点、执行成本降38.5%。4.03美元得到的harness追平公开九套比较中的最高分Codex。

摘要未说明82.0%这一对比沿用了公开九套harness比较的原有设定,还是作者自建的评测流程;论文由Jungwoo Yang、Injin Kong、Yohan Jo于9月29日提交arXiv,属作者自测,待复现。

信息源:arxiv.org

研究

技能图自进化一轮将检索奖励从52.4%提至59.4%

专题 · SE-GoS技能图自进化快讯
2026-10-02 12:00

仅从执行轨迹维护技能检索图,一轮自进化就能把智能体技能库的检索奖励从52.4%提到59.4%,且不改模型、不改检索算法,也不需要另一个模型来判断技能相关性。

此前做法是全库加载或向量检索等固定索引方式,无法从执行记录里自动调整图的连接和节点描述。

SE-GoS作者自测显示,在SkillsBench上,一轮进化把平均奖励从52.4%提到59.4%,高于全库加载、向量检索等基线;在从未见过的held-out分片上从52.9%升到58.3%,token开销约为全库加载的三分之二。重复进化不再有增益,摘要未解释原因。

结果为作者自报,尚未见独立复现;方法由Dawei Fu等五位作者提出,10月1日更新在arXiv。

信息源:arxiv.org

研究

现成角色向量抑制谄媚达专门方法68%至98%

专题 · 人格向量抑制谄媚快讯
2026-10-02 12:00

现成的怀疑者、裁判等角色向量,无需谄媚数据训练,抑制谄媚效果可达专门方法的68%至98%。

此前抑制谄媚需专门用谄媚数据构建CAA向量;人格向量是从模型内部激活中提取的方向,沿它调整输出即可增减某种行为倾向。

Kelkar等六人测量:在Gemma 2 27B上,角色向量平均达到CAA抑制谄媚效果的68%,Qwen 3 32B上为98%;16条事实判断题中,被调整后的Qwen仍全部答对。基准为哲学立场题集,系数按任务单独调过。

结果均为作者自测,外推到生产模型待验证;预印本9月30日更新至第四版,获ICML 2026一个研讨会 spotlight,尚无独立复现。

信息源:arxiv.org

研究

按置信度解码让掩码扩散模型走捷径,加法错误率放大一个数量级

专题 · 掩码扩散置信度捷径快讯
2026-10-02 12:00

掩码扩散模型按置信度选生成顺序会走「置信度捷径」,忽略长程依赖,作者自测称相关训练目标能把加法错误率推高一个数量级。

此前人们认为掩码扩散模型(MDM)可按任意顺序逐步还原文本,理论上能沿逻辑依赖展开中间步骤;但作者Dueun Kim与Albert No称,实际解码只优先输出高置信度词元,在多位加法中会先算高位数字而不追踪进位链。

作者自测的受控预训练显示,置信度引导的顺序常选次优序列;与置信度对齐的训练目标会把加法错误率推高一个数量级。实验代码已开源,结论限于作者自己的设置,效果待独立复现。

信息源:arxiv.org

研究

延迟压缩记忆法CoEM,长文推理F1自测提升逾10分

专题 · CoEM延迟压缩记忆快讯
2026-09-30 12:00

读者现在可以了解CoEM这种长上下文记忆管理方法:先原样暂存可能有用的原文片段,等后续内容确认其相关性,再决定写入压缩记忆或丢弃,避免过早压缩丢掉关键细节,作者自测F1提升10分以上。

以往的做法是尽早压缩记忆,可能在证据相关性尚未明朗时就丢弃关键细节,造成长文推理信息损失。

作者用强化学习训练这套决定策略,并加一个冻结校验器,只接受有原文支撑的记忆事实。在6400份文档的长输入上,作者自测其在Qwen3.5-9B上比最强记忆基线高10.4至11.4个F1点。

实验只覆盖Qwen3.5-9B一个模型和6400文档这一种输入长度,其他模型和更短或更长的上下文表现未知,效果尚无独立复现;代码已在GitHub开源,可据此验证。

信息源:arxiv.org

研究

自蒸馏训练在5%视觉token下挽回13.7个百分点

快讯
2026-09-29 12:00

一种自蒸馏训练法可将极端视觉压缩的损失大幅挽回:Qwen3.5-4B在仅保留5%视觉token时,9个基准的平均保留性能从68.6%升至82.3%,同时KV缓存用量降85.2%、预填充计算量降85.4%。

此前压缩后的多模态模型在如此低的token预算下损失严重,缺少能在压缩同时恢复性能的训练手段。

该方法名为LT-OPD,让压缩后的模型用自己生成的轨迹学习,由同一模型的完整视觉token版本当老师,并逐步降低训练中的token预算;作者自测称在Qwen3.5-9B、GLM-4.6V-9B和LLaVA-OV-1.5-4B上也有一致提升。

全部结果为作者自测,基准由作者自选,效果待独立复现;方法9月26日以预印本形式提交arXiv。

信息源:arxiv.org

研究
下一页阅读 →