阅读研究雷达投资体系
登录 / 注册
登录 / 注册
阅读研究雷达投资体系
历史阅读归档 →

阅读

2026-10-0155 条

宝马宣布精简两成管理层,称AI将提速决策

专题 · 宝马重组实质变化
2026-10-01 08:06

宝马9月30日公布重组计划,到2027年年中削减五分之一的部门及相应管理岗位,德国约8000个岗位受影响。

据路透社报道,新任CEO内德利科维奇称AI将成为提高组织效率和加快决策速度的重要手段,并强调“这不是一项降本计划”。

背景是宝马三年多来第三次因中国市场疲弱发出盈利预警,最新核心汽车业务利润率仅2.3%,而2028年目标为3%-5%,过去一年股价跌逾三分之一。

信息源:ithome.com

研究

Meta智能助手22天下载破500万,登顶靠自家广告助推

专题 · Meta助手Muse快讯
2026-10-01 07:45

据Sensor Tower数据,Meta的智能体AI助手Muse上线22天,美国下载量在9月30日突破500万次,登顶App Store免费榜并连续12天居首。

这一速度明显快于ChatGPT的56天、Grok的103天和Claude的492天。Sensor Tower统计,美国市场22天内破500万下载的应用仅23款,非游戏类此前只有Disney+、HBO Max和Threads三款。

增长有明显的买量成分:Meta自9月16日起加大投放,当日下载量环比增长73%,过去两周Muse占Meta自有广告展示量最高50%,Facebook与WhatsApp份额相应下降。500万为Sensor Tower分析师Kara Lee的预测值,其原始报告未随文公开。

信息源:ithome.com

研究

实体索引保留对话原文,改进智能体长期记忆

专题 · EnSIMem实体记忆快讯
2026-09-24 12:00

智能体长期记忆可以不再依赖有损摘要:EnSIMem按「实体—实体类型—属性:值」建立索引,每条保留原始对话轮次和时间信息,代码已在GitHub开源。

现有记忆系统常把交互压成通用摘要,或检索匿名的文本块,导致智能体难以确认正确的实体、属性和证据。EnSIMem在离线阶段把交互整理成主题连贯的片段,在线阶段按请求分解证据需求,再查索引取证据。

Xuanyu Meng等六位研究者自报该系统取得较高准确率且上下文紧凑;配套仓库显示实验在LoCoMo和LongMemEval两个长期对话记忆基准上运行,并附消融脚本,但摘要未给出对比方法和具体数字。预印本于9月23日提交,效果需看论文正文与第三方复现。

信息源:arxiv.org

研究

修复智能体失败经验的收益不等于复用价值

快讯
2026-09-29 12:00

修复智能体失败经验的价值与复用该经验的价值是两回事:ThinkingBox框架Full模式修正收益达44个百分点,但其中对Skill模式的15点优势有12点来自未修复时表现更差,而非修复后记忆更好。

此前若只看修正收益,容易把失败经验的修复价值误当作复用价值,从而高估记忆更新的效果。

Yanfei Zhang与Xu Lin于9月28日提交arXiv的实验覆盖3300次运行、十一组条件,作者结论是记忆更新需同时保留旧版参照与全新开始参照。

实验全部在作者自建的ThinkingBox与APEX框架上完成,未涉及第三方复现。

信息源:arxiv.org

研究

研究者提出用开源模型内部信号监控闭源模型

专题 · 模型解释学探针快讯
2026-10-01 04:43

不接触闭源模型权重,也可能通过开源替身模型的内部信号监控其欺骗等失控行为。

conti等研究团队9月30日在LessWrong提出model hermeneutics:把要研究的闭源模型称为author,用开源的reader模型读它的输出,再在reader内部训练线性探针。作者自测中,27B的reader探测397B的author,AUROC差距平均只有0.004。

团队称探针可检测Claude Opus 4.6、Gemini 3.1 Pro Preview、GPT-5.4等三个前沿模型输出中的奖励作弊、谄媚与欺骗,约半数场景下优于直接询问reader。蒸馏后reader探测欺骗的AUROC从0.69升至0.90。

这是约1.5个月的早期工作,闭源模型内部没有真值,faithfulness只能用开源模型对间接基线衡量,能否用于真实审计待独立验证。

信息源:lesswrong.com

研究

GPT-6.1 Sol无思维链实测追平Astra差距八成

专题 · GPT-6.1 Sol快讯
2026-09-30 11:57

GPT-6.1 Sol在无思维链设置下追平了GPT-6 Sol与Astra之间差距的80%,这是研究者Rauno Arike在27项任务上实测得出的结果。

此前无思维链档位的模型与Astra差距明显,且缺乏针对该档位的独立实测数据。

测试沿用此前Astra无思维链评估的任务集,每题取样一次;6.1 Sol在24项任务上更接近Astra。50%时间视界估计从6 Sol的4分钟升至35分钟,但多数基准已饱和,区间很宽。

作者推测6.1 Sol实为循环变压器架构,可能是以Astra Minor名义发布的版本,依据是Azure配置路径等旁证,OpenAI未确认;结果出自个人运行,Astra与GPT-5.5的分数直接取自旧帖未重跑。

信息源:lesswrong.com

研究

可纠正性研究基金追加4.8万美元奖励近期论文

专题 · 可纠正性研究基金快讯
2026-10-01 00:08

可纠正性研究基金9月30日宣布追加4.8万美元,奖励约十几个团队、二十多位研究者的可纠正性(corrigibility,让AI接受人类纠正的研究方向)论文。

基金管理人Max Harms在7月已发放过2.7万美元首轮奖励,并计划12月再发超6万美元。最高单项1.4万美元给了Rubi Hudson的可纠正性变换论文。

评选由Harms一人决定,他自述奖项偏临时、金额不必当真,且刻意排除了Yudkowsky、Christiano等已成名的资深研究者。

信息源:lesswrong.com

研究

Manus发布2.0,效率提升数据出自自家测试

专题 · Manus 2.0快讯
2026-09-29 09:35

Manus于9月28日发布2.0版本,并推出多Agent群聊应用Cue,这是蝴蝶效应恢复独立运营后的首次大版本更新。

据其官方博客介绍,2.0采用自研Agent框架Cascade。在一项测试配置中,与旧系统相比,Token消耗减少23.2%,任务完成时间缩短28.2%,运行成本降低32%,这些数字出自厂商自测,未说明具体测试任务。

Cue为每个Agent配备专属邮箱、电话号码与独立电脑环境,可组队协作,目前仍处邀请码抢先体验阶段。本次发布为海外版,公司称正在组建团队开发面向国内市场的产品。

信息源:zhidx.com

研究

UserTesting更名Auros,转向AI训练人力反馈

快讯
2026-10-01 18:19

UserTesting更名为Auros,把760万名测试者社区扩展到AI训练与模型评估的人力反馈业务。

CEO Eric Johnson在diginomica采访中称,AI训练不属于用户测试,公司将主打“人类智能”,为模型和智能体提供人类评估。一个评估AI体验信任度的ARQ基准定于下周发布。

更名于本周宣布,具体日期未公布;业务扩张均为公司自述,收入与AI业务规模未披露。

信息源:diginomica.com

研究

Modal多节点GPU集群正式商用,按秒计费

快讯
核验于 2026-10-01 20:34

Modal于10月1日宣布其多节点GPU集群产品Modal Clusters正式商用,用一个装饰器即可申请集群。

集群通过RDMA互联,公司称单节点带宽最高6.4 Tbps,并为PyTorch和NCCL自动配置;调度器一次性分配全部节点,从共享算力池获取集群,按秒计费。公司称这是其测试一年半后的正式发布。

对没有自建机群的团队,这意味着分布式训练和推理可以按用量短租多机资源,不必按小时包租。带宽与获取速度等数字均出自Modal自己的博客,尚无第三方实测。

信息源:modal.com

研究

几十条样本即可无声改写小模型行为路径

专题 · 预训练投毒样本数快讯
2026-10-01 10:45

约56条错误答案样本就能让一个2000万参数小模型在半数问题上改走另一条回答路径,且常规测试准确率保持满分——这是作者自报的实验结果,前提是先花几百条样本让模型学会绕开捷径。

此前这类行为改写被认为需要大量数据:Souly等人2025年发现预训练投毒约需250篇文档,且数量不随模型和数据规模变化。本实验中训练集从3.2万条扩到32万条,所需特殊样本始终是几百条(9.6万条时约378条),说明起作用的是绝对条数而非占比,任务为人工构造的动词问答。

作者在9月30日的LessWrong帖文中给出解释:普通样本对绕行路径的强化有上限,只有捷径被切断或给出错误答案的样本才真正起作用。论文尚在评审中,结论能否推广到真实大模型待验证。

信息源:lesswrong.com

研究

多数开源模型虽说出被测试,行为却不因此改变

专题 · 模型评估意识快讯
2026-10-01 11:07

多数开源推理模型虽会在思维链里说出“可能正被测试”,但行为并不因此改变——安全评测被扭曲的担忧可能被高估了。

此前人们担心模型察觉被评估后会改变回答,从而扭曲安全评测结果;这项自测研究检验了这一担忧是否成立。

16个开源推理模型用Fortress安全提示数据集测试,说出评估意识的比例从极低到约三分之一,与模型大小基本无关;同一问题中,说出这类意识的回答拒答更多,见于14/16个模型。但因果检验结果相反:插入“这可能是测试”提升拒答的效果,与插入任意“被操纵”句子相当;删掉模型自己的评估意识句子后,仅Nemotron 3 Super和Qwen3 32B行为改变。作者自认这不能严格证明因果,结论也未必适用于前沿闭源模型。

信息源:lesswrong.com

研究
下一页阅读 →