阅读研究雷达投资体系
登录 / 注册
登录 / 注册
阅读研究雷达投资体系
历史阅读归档 →

阅读

2026-10-0258 条

Lambda再借10亿美元,GPU债务首获投资级评级

实质变化
2026-10-02 07:08

Lambda于10月1日宣布完成10.08亿美元投资级高级担保延迟提取定期贷款,固定利率6.78%,这是该公司第二笔机构信贷融资。

贷款获穆迪Baa1与Morningstar DBRS A(低)评级,面向保险公司和固定收益投资者发售,且获超额认购。资金用于三个已签约客户部署的GPU基础设施,还款依赖两家投资级客户的合同现金流,2033年5月30日到期、全额摊还。

延迟提取结构意味着资金按集群投运节点分批到位,而非一次性到账。这是Lambda约18个月内开辟的第三个信贷市场,此前8月27日刚完成一笔银团贷款。评级针对的是以服务器和合同现金流担保的这笔贷款,不代表Lambda公司整体信用,三个客户部署的细节也未公开。

信息源:lambda.ai

研究

第三方测试称骁龙X2 Elite多项目胜英特尔新芯

快讯
核验于 2026-10-02 10:42

测试机构Signal65于10月1日发布报告,称高通18核骁龙X2 Elite(X2E-88-100)在CPU、AI和多数续航项目领先英特尔酷睿Ultra X7 358H。

Geekbench 7多核骁龙系统得分24,016,英特尔系统18,360,领先31%;UL Procyon AI视觉测试得分4,360对2,302。本地视频续航16.1小时对14.4小时。

办公续航一项由英特尔以17.4小时反超骁龙的14.3小时。三台测试机分别来自联想和戴尔,操作系统版本也不一致,报告未说明测试由谁委托。

信息源:signal65.com

研究

彭博称Anthropic拟11月9日当周启动IPO,时点未定

实质变化
2026-10-02 07:43

彭博10月1日援引匿名信源报道称,Anthropic计划在11月9日当周启动IPO正式路演,赶在感恩节前挂牌;SiliconANGLE转述时说明,公司内部对时间表仍在讨论、可能变动。

据路透看到的招股书,Anthropic 2025财年收入46亿美元、同比增长逾12倍,经营亏损超80亿美元,净亏损超420亿美元,并计划未来数年投入5180亿美元建设AI基础设施。

招股书还用数页篇幅警示AI对人类的“生存风险”,提及模型出现自我保护、隐瞒信息等行为。若上市推迟,可能波及其他AI股票。

信息源:siliconangle.com

研究

ServiceNow发布流水线,按模型短板自动生成智能体训练数据

专题 · 自动训练数据生成快讯
2026-10-02 12:01

ServiceNow CoreAI于10月2日发布AutoSynthData,用目标模型的失败记录和更强教师模型的成功轨迹,自动生成企业智能体的训练任务。

流水线先在目标环境里跑诊断任务,找出模型反复失败的能力点,再据此生成新的系统规则、用户请求和成败判定器,逐条在环境中执行验证后才进入训练。随着模型改进,任务难度跟着缺口移动。

团队用自家的EnterpriseOps Gym环境做了实验,但本次加载的正文在结果部分截断,未给出可核对的提升数字,方法收益目前只能算厂商自述。

信息源:huggingface.co

研究

Greylock领投Parallax,押注3D打印数据中心燃气轮机

专题 · Parallax燃气轮机快讯
2026-10-01 23:30

Greylock于10月1日宣布联合领投创企Parallax的A轮融资,跟投方包括Founders Fund、Lux、General Catalyst等,融资金额未披露。

Parallax的首款产品是一台10MW燃气轮机,专为数据中心设计,用3D打印控制供应链。其出发点是燃气轮机订单已排到2030年以后,而数据中心等不起。

文中提到的美国100GW电力缺口等数字,出自领投方对创始人的转述,公告本身没有给出独立依据。下一步看这家公司能否实际交付机组。

信息源:greylock.com

研究

自蒸馏新方法让电脑操作智能体训练效果小幅提升

专题 · 智能体自我改进快讯
2026-10-01 12:00

ComputerSD把智能体执行操作后的实时反馈转成训练信号,作者称在OSWorld-Verified基准上超过只用结果奖励的训练方法。

具体数字:在Qwen3-VL-8B-Thinking骨干上高1.9个百分点,在专用的EvoCUA-8B上高4.1个百分点,均为论文作者自测。

提升幅度不大,基准也由作者自己运行,方法能否在真实使用中带来同等收益,需等独立复现。

信息源:arxiv.org

研究

无思维链基准存在关键位置混淆,推理深度被高估

快讯
2026-10-02 22:39

把提示中的初始状态移到末尾后,GPT-6.1 Sol的无思维链推理深度中位数下降16%。

Neel Nanda发布的no-cot-bench基准曾显示疑似循环变压器的Astra解题几率约为Fable 5.1的8.6倍。两位研究者指出混淆:初始状态通常在提示开头,模型可以边读边算,基准因此同时测到串行深度和跨token分配计算两种能力。

他们把6个串行状态追踪任务改成初始状态在末尾的版本,并加入无关问题对照排除解析难度干扰。12个任务的深度损失中位数为16%,范围9%至45%。作者只测了GPT-6.1 Sol一个模型,称缺算力未复测其他模型。

信息源:lesswrong.com

研究

5万条智能体错误数据发布,修正建议通过率升至51.1%

专题 · 智能体错误数据集快讯
2026-10-01 12:00

现在可以免重放复用智能体失败轨迹:Agent Error Dataset含50,228条错误诊断对,修正建议在作者自测中把回放验证通过率从18.4%提到51.1%。

此前失败诊断需重放原始任务,成本高且难以复用;该数据集保留原始轨迹与执行元数据,可免重放做再诊断。

Kunlun Zhu等六位作者于9月30日在arXiv发布该数据集,数据来自9,961个任务、33个环境、23个策略模型;作者自测3,062组回放配对得出上述通过率,微调Qwen3-8B后与教师标签的逐步一致率从47.2%升至63.6%。

回放对比仅覆盖支持重放的环境,结果为作者自报,尚无第三方复现。

信息源:arxiv.org

研究

智能体免奖励信号自我改进,4美元追平最高分

专题 · 智能体自我改进快讯
2026-09-30 12:00

你现在可以让智能体不用奖励信号、只靠过往自我改进的记录来提升成功率:SelfSearch在全部六个模型与基准组合上都实现了提升,用DeepSeek V4 Flash时仅花4.03美元搜索成本就得到解出82.0%任务的harness。

此前改进智能体通常要反复跑下游评测,开销大。SelfSearch让智能体读取此前修改尝试的推理、工具动作和结果,作为改进依据,省去这部分开销。

作者自测数字包括:Terminal-Bench 2.1上单个智能体最高提升11.2个百分点;SWE-bench Multilingual上成功率提高5.0个百分点、执行成本降38.5%。4.03美元得到的harness追平公开九套比较中的最高分Codex。

摘要未说明82.0%这一对比沿用了公开九套harness比较的原有设定,还是作者自建的评测流程;论文由Jungwoo Yang、Injin Kong、Yohan Jo于9月29日提交arXiv,属作者自测,待复现。

信息源:arxiv.org

研究

技能图自进化一轮将检索奖励从52.4%提至59.4%

专题 · SE-GoS技能图自进化快讯
2026-10-02 12:00

仅从执行轨迹维护技能检索图,一轮自进化就能把智能体技能库的检索奖励从52.4%提到59.4%,且不改模型、不改检索算法,也不需要另一个模型来判断技能相关性。

此前做法是全库加载或向量检索等固定索引方式,无法从执行记录里自动调整图的连接和节点描述。

SE-GoS作者自测显示,在SkillsBench上,一轮进化把平均奖励从52.4%提到59.4%,高于全库加载、向量检索等基线;在从未见过的held-out分片上从52.9%升到58.3%,token开销约为全库加载的三分之二。重复进化不再有增益,摘要未解释原因。

结果为作者自报,尚未见独立复现;方法由Dawei Fu等五位作者提出,10月1日更新在arXiv。

信息源:arxiv.org

研究

现成角色向量抑制谄媚达专门方法68%至98%

专题 · 人格向量抑制谄媚快讯
2026-10-02 12:00

现成的怀疑者、裁判等角色向量,无需谄媚数据训练,抑制谄媚效果可达专门方法的68%至98%。

此前抑制谄媚需专门用谄媚数据构建CAA向量;人格向量是从模型内部激活中提取的方向,沿它调整输出即可增减某种行为倾向。

Kelkar等六人测量:在Gemma 2 27B上,角色向量平均达到CAA抑制谄媚效果的68%,Qwen 3 32B上为98%;16条事实判断题中,被调整后的Qwen仍全部答对。基准为哲学立场题集,系数按任务单独调过。

结果均为作者自测,外推到生产模型待验证;预印本9月30日更新至第四版,获ICML 2026一个研讨会 spotlight,尚无独立复现。

信息源:arxiv.org

研究

按置信度解码让掩码扩散模型走捷径,加法错误率放大一个数量级

专题 · 掩码扩散置信度捷径快讯
2026-10-02 12:00

掩码扩散模型按置信度选生成顺序会走「置信度捷径」,忽略长程依赖,作者自测称相关训练目标能把加法错误率推高一个数量级。

此前人们认为掩码扩散模型(MDM)可按任意顺序逐步还原文本,理论上能沿逻辑依赖展开中间步骤;但作者Dueun Kim与Albert No称,实际解码只优先输出高置信度词元,在多位加法中会先算高位数字而不追踪进位链。

作者自测的受控预训练显示,置信度引导的顺序常选次优序列;与置信度对齐的训练目标会把加法错误率推高一个数量级。实验代码已开源,结论限于作者自己的设置,效果待独立复现。

信息源:arxiv.org

研究
下一页阅读 →