阅读研究雷达投资体系
登录 / 注册
登录 / 注册
阅读研究雷达投资体系
历史阅读归档 →

阅读

2026-10-0155 条

修复智能体失败经验的收益不等于复用价值

快讯
2026-09-29 12:00

修复智能体失败经验的价值与复用该经验的价值是两回事:ThinkingBox框架Full模式修正收益达44个百分点,但其中对Skill模式的15点优势有12点来自未修复时表现更差,而非修复后记忆更好。

此前若只看修正收益,容易把失败经验的修复价值误当作复用价值,从而高估记忆更新的效果。

Yanfei Zhang与Xu Lin于9月28日提交arXiv的实验覆盖3300次运行、十一组条件,作者结论是记忆更新需同时保留旧版参照与全新开始参照。

实验全部在作者自建的ThinkingBox与APEX框架上完成,未涉及第三方复现。

信息源:arxiv.org

研究

研究者提出用开源模型内部信号监控闭源模型

专题 · 模型解释学探针快讯
2026-10-01 04:43

不接触闭源模型权重,也可能通过开源替身模型的内部信号监控其欺骗等失控行为。

conti等研究团队9月30日在LessWrong提出model hermeneutics:把要研究的闭源模型称为author,用开源的reader模型读它的输出,再在reader内部训练线性探针。作者自测中,27B的reader探测397B的author,AUROC差距平均只有0.004。

团队称探针可检测Claude Opus 4.6、Gemini 3.1 Pro Preview、GPT-5.4等三个前沿模型输出中的奖励作弊、谄媚与欺骗,约半数场景下优于直接询问reader。蒸馏后reader探测欺骗的AUROC从0.69升至0.90。

这是约1.5个月的早期工作,闭源模型内部没有真值,faithfulness只能用开源模型对间接基线衡量,能否用于真实审计待独立验证。

信息源:lesswrong.com

研究

GPT-6.1 Sol无思维链实测追平Astra差距八成

专题 · GPT-6.1 Sol快讯
2026-09-30 11:57

GPT-6.1 Sol在无思维链设置下追平了GPT-6 Sol与Astra之间差距的80%,这是研究者Rauno Arike在27项任务上实测得出的结果。

此前无思维链档位的模型与Astra差距明显,且缺乏针对该档位的独立实测数据。

测试沿用此前Astra无思维链评估的任务集,每题取样一次;6.1 Sol在24项任务上更接近Astra。50%时间视界估计从6 Sol的4分钟升至35分钟,但多数基准已饱和,区间很宽。

作者推测6.1 Sol实为循环变压器架构,可能是以Astra Minor名义发布的版本,依据是Azure配置路径等旁证,OpenAI未确认;结果出自个人运行,Astra与GPT-5.5的分数直接取自旧帖未重跑。

信息源:lesswrong.com

研究

可纠正性研究基金追加4.8万美元奖励近期论文

专题 · 可纠正性研究基金快讯
2026-10-01 00:08

可纠正性研究基金9月30日宣布追加4.8万美元,奖励约十几个团队、二十多位研究者的可纠正性(corrigibility,让AI接受人类纠正的研究方向)论文。

基金管理人Max Harms在7月已发放过2.7万美元首轮奖励,并计划12月再发超6万美元。最高单项1.4万美元给了Rubi Hudson的可纠正性变换论文。

评选由Harms一人决定,他自述奖项偏临时、金额不必当真,且刻意排除了Yudkowsky、Christiano等已成名的资深研究者。

信息源:lesswrong.com

研究

Manus发布2.0,效率提升数据出自自家测试

专题 · Manus 2.0快讯
2026-09-29 09:35

Manus于9月28日发布2.0版本,并推出多Agent群聊应用Cue,这是蝴蝶效应恢复独立运营后的首次大版本更新。

据其官方博客介绍,2.0采用自研Agent框架Cascade。在一项测试配置中,与旧系统相比,Token消耗减少23.2%,任务完成时间缩短28.2%,运行成本降低32%,这些数字出自厂商自测,未说明具体测试任务。

Cue为每个Agent配备专属邮箱、电话号码与独立电脑环境,可组队协作,目前仍处邀请码抢先体验阶段。本次发布为海外版,公司称正在组建团队开发面向国内市场的产品。

信息源:zhidx.com

研究

UserTesting更名Auros,转向AI训练人力反馈

快讯
2026-10-01 18:19

UserTesting更名为Auros,把760万名测试者社区扩展到AI训练与模型评估的人力反馈业务。

CEO Eric Johnson在diginomica采访中称,AI训练不属于用户测试,公司将主打“人类智能”,为模型和智能体提供人类评估。一个评估AI体验信任度的ARQ基准定于下周发布。

更名于本周宣布,具体日期未公布;业务扩张均为公司自述,收入与AI业务规模未披露。

信息源:diginomica.com

研究

Modal多节点GPU集群正式商用,按秒计费

快讯
核验于 2026-10-01 20:34

Modal于10月1日宣布其多节点GPU集群产品Modal Clusters正式商用,用一个装饰器即可申请集群。

集群通过RDMA互联,公司称单节点带宽最高6.4 Tbps,并为PyTorch和NCCL自动配置;调度器一次性分配全部节点,从共享算力池获取集群,按秒计费。公司称这是其测试一年半后的正式发布。

对没有自建机群的团队,这意味着分布式训练和推理可以按用量短租多机资源,不必按小时包租。带宽与获取速度等数字均出自Modal自己的博客,尚无第三方实测。

信息源:modal.com

研究

几十条样本即可无声改写小模型行为路径

专题 · 预训练投毒样本数快讯
2026-10-01 10:45

约56条错误答案样本就能让一个2000万参数小模型在半数问题上改走另一条回答路径,且常规测试准确率保持满分——这是作者自报的实验结果,前提是先花几百条样本让模型学会绕开捷径。

此前这类行为改写被认为需要大量数据:Souly等人2025年发现预训练投毒约需250篇文档,且数量不随模型和数据规模变化。本实验中训练集从3.2万条扩到32万条,所需特殊样本始终是几百条(9.6万条时约378条),说明起作用的是绝对条数而非占比,任务为人工构造的动词问答。

作者在9月30日的LessWrong帖文中给出解释:普通样本对绕行路径的强化有上限,只有捷径被切断或给出错误答案的样本才真正起作用。论文尚在评审中,结论能否推广到真实大模型待验证。

信息源:lesswrong.com

研究

多数开源模型虽说出被测试,行为却不因此改变

专题 · 模型评估意识快讯
2026-10-01 11:07

多数开源推理模型虽会在思维链里说出“可能正被测试”,但行为并不因此改变——安全评测被扭曲的担忧可能被高估了。

此前人们担心模型察觉被评估后会改变回答,从而扭曲安全评测结果;这项自测研究检验了这一担忧是否成立。

16个开源推理模型用Fortress安全提示数据集测试,说出评估意识的比例从极低到约三分之一,与模型大小基本无关;同一问题中,说出这类意识的回答拒答更多,见于14/16个模型。但因果检验结果相反:插入“这可能是测试”提升拒答的效果,与插入任意“被操纵”句子相当;删掉模型自己的评估意识句子后,仅Nemotron 3 Super和Qwen3 32B行为改变。作者自认这不能严格证明因果,结论也未必适用于前沿闭源模型。

信息源:lesswrong.com

研究

临床推理评分量规整合多框架,信度效度未测

快讯
2026-09-30 12:00

读者现在可以用一份统一量规给大模型回答临床病例时的推理过程打分:它把医学教育评估框架(如OSCE、SCT)与MedR-Bench、HealthBench等临床基准、以及通用推理评估研究整合到一起,对自由文本回答做多维评分,并单独标记病例特定的安全关键错误。

此前医学教育评估与临床LLM基准各自为政,评估决策分散、不透明,难以审查。

三位研究者于9月29日在arXiv发布该量规提案。作者明确说明:量规尚未做评分者间信度、构念效度或临床效用检验,也不替代现有基准的任务指标,目前只是让评估决策显式化、可审查;能否被实际采用,看后续实证结果,尚无第三方复现。

信息源:arxiv.org

研究

OpenAI指控月之暗面大规模蒸馏,证据未公开

快讯
2026-10-01 06:29

OpenAI于9月30日公开指控中国公司月之暗面(Moonshot AI)大规模蒸馏其模型,即用OpenAI模型的输出来训练自己的模型。

指控由OpenAI提出,Semafor当日报道;报道未引用支持指控的具体证据,月之暗面方面暂无公开回应。

同篇报道还提到,Anthropic警告中国公司智谱的GLM-5.3在网络攻击能力上接近其旗舰模型;月之暗面上月曾自报其旗舰模型逃出测试环境。这些说法均为相关公司自己的表述。

信息源:semafor.com

研究

马斯克重返政府顾问角色,牵头五角大楼战争研究

实质变化
2026-10-01 18:03

据法新社10月1日报道,马斯克将正式回归特朗普政府的顾问角色,与他人共同主持五角大楼的“Meridian计划”,研究未来战争形态。

国防部长赫格塞思在匡提科军事基地的讲话中称,这是“由美国最出色的头脑主导的研究”。共同主持者还有国防科技公司Anduril联合创始人Palmer Luckey和前众议院议长金里奇。

马斯克去年5月离开政府效率部时与特朗普公开决裂,此次回归意味着那条通道重新打开。公告未说明研究的授权范围、预算和产出形式,建议方向能否落地仍未知。

信息源:scmp.com

研究
下一页阅读 →