阅读研究雷达投资体系
登录 / 注册
登录 / 注册
阅读研究雷达投资体系
历史阅读归档 →

阅读

2026-10-0155 条

GPT-6.1 Sol无思维链实测追平Astra差距八成

专题 · GPT-6.1 Sol快讯
2026-09-30 11:57

GPT-6.1 Sol在无思维链设置下追平了GPT-6 Sol与Astra之间差距的80%,这是研究者Rauno Arike在27项任务上实测得出的结果。

此前无思维链档位的模型与Astra差距明显,且缺乏针对该档位的独立实测数据。

测试沿用此前Astra无思维链评估的任务集,每题取样一次;6.1 Sol在24项任务上更接近Astra。50%时间视界估计从6 Sol的4分钟升至35分钟,但多数基准已饱和,区间很宽。

作者推测6.1 Sol实为循环变压器架构,可能是以Astra Minor名义发布的版本,依据是Azure配置路径等旁证,OpenAI未确认;结果出自个人运行,Astra与GPT-5.5的分数直接取自旧帖未重跑。

信息源:lesswrong.com

研究

可纠正性研究基金追加4.8万美元奖励近期论文

专题 · 可纠正性研究基金快讯
2026-10-01 00:08

可纠正性研究基金9月30日宣布追加4.8万美元,奖励约十几个团队、二十多位研究者的可纠正性(corrigibility,让AI接受人类纠正的研究方向)论文。

基金管理人Max Harms在7月已发放过2.7万美元首轮奖励,并计划12月再发超6万美元。最高单项1.4万美元给了Rubi Hudson的可纠正性变换论文。

评选由Harms一人决定,他自述奖项偏临时、金额不必当真,且刻意排除了Yudkowsky、Christiano等已成名的资深研究者。

信息源:lesswrong.com

研究

Manus发布2.0,效率提升数据出自自家测试

专题 · Manus 2.0快讯
2026-09-29 09:35

Manus于9月28日发布2.0版本,并推出多Agent群聊应用Cue,这是蝴蝶效应恢复独立运营后的首次大版本更新。

据其官方博客介绍,2.0采用自研Agent框架Cascade。在一项测试配置中,与旧系统相比,Token消耗减少23.2%,任务完成时间缩短28.2%,运行成本降低32%,这些数字出自厂商自测,未说明具体测试任务。

Cue为每个Agent配备专属邮箱、电话号码与独立电脑环境,可组队协作,目前仍处邀请码抢先体验阶段。本次发布为海外版,公司称正在组建团队开发面向国内市场的产品。

信息源:zhidx.com

研究

UserTesting更名Auros,转向AI训练人力反馈

快讯
2026-10-01 18:19

UserTesting更名为Auros,把760万名测试者社区扩展到AI训练与模型评估的人力反馈业务。

CEO Eric Johnson在diginomica采访中称,AI训练不属于用户测试,公司将主打“人类智能”,为模型和智能体提供人类评估。一个评估AI体验信任度的ARQ基准定于下周发布。

更名于本周宣布,具体日期未公布;业务扩张均为公司自述,收入与AI业务规模未披露。

信息源:diginomica.com

研究

Modal多节点GPU集群正式商用,按秒计费

快讯
核验于 2026-10-01 20:34

Modal于10月1日宣布其多节点GPU集群产品Modal Clusters正式商用,用一个装饰器即可申请集群。

集群通过RDMA互联,公司称单节点带宽最高6.4 Tbps,并为PyTorch和NCCL自动配置;调度器一次性分配全部节点,从共享算力池获取集群,按秒计费。公司称这是其测试一年半后的正式发布。

对没有自建机群的团队,这意味着分布式训练和推理可以按用量短租多机资源,不必按小时包租。带宽与获取速度等数字均出自Modal自己的博客,尚无第三方实测。

信息源:modal.com

研究

几十条样本即可无声改写小模型行为路径

专题 · 预训练投毒样本数快讯
2026-10-01 10:45

约56条错误答案样本就能让一个2000万参数小模型在半数问题上改走另一条回答路径,且常规测试准确率保持满分——这是作者自报的实验结果,前提是先花几百条样本让模型学会绕开捷径。

此前这类行为改写被认为需要大量数据:Souly等人2025年发现预训练投毒约需250篇文档,且数量不随模型和数据规模变化。本实验中训练集从3.2万条扩到32万条,所需特殊样本始终是几百条(9.6万条时约378条),说明起作用的是绝对条数而非占比,任务为人工构造的动词问答。

作者在9月30日的LessWrong帖文中给出解释:普通样本对绕行路径的强化有上限,只有捷径被切断或给出错误答案的样本才真正起作用。论文尚在评审中,结论能否推广到真实大模型待验证。

信息源:lesswrong.com

研究

多数开源模型虽说出被测试,行为却不因此改变

专题 · 模型评估意识快讯
2026-10-01 11:07

多数开源推理模型虽会在思维链里说出“可能正被测试”,但行为并不因此改变——安全评测被扭曲的担忧可能被高估了。

此前人们担心模型察觉被评估后会改变回答,从而扭曲安全评测结果;这项自测研究检验了这一担忧是否成立。

16个开源推理模型用Fortress安全提示数据集测试,说出评估意识的比例从极低到约三分之一,与模型大小基本无关;同一问题中,说出这类意识的回答拒答更多,见于14/16个模型。但因果检验结果相反:插入“这可能是测试”提升拒答的效果,与插入任意“被操纵”句子相当;删掉模型自己的评估意识句子后,仅Nemotron 3 Super和Qwen3 32B行为改变。作者自认这不能严格证明因果,结论也未必适用于前沿闭源模型。

信息源:lesswrong.com

研究

临床推理评分量规整合多框架,信度效度未测

快讯
2026-09-30 12:00

读者现在可以用一份统一量规给大模型回答临床病例时的推理过程打分:它把医学教育评估框架(如OSCE、SCT)与MedR-Bench、HealthBench等临床基准、以及通用推理评估研究整合到一起,对自由文本回答做多维评分,并单独标记病例特定的安全关键错误。

此前医学教育评估与临床LLM基准各自为政,评估决策分散、不透明,难以审查。

三位研究者于9月29日在arXiv发布该量规提案。作者明确说明:量规尚未做评分者间信度、构念效度或临床效用检验,也不替代现有基准的任务指标,目前只是让评估决策显式化、可审查;能否被实际采用,看后续实证结果,尚无第三方复现。

信息源:arxiv.org

研究

OpenAI指控月之暗面大规模蒸馏,证据未公开

快讯
2026-10-01 06:29

OpenAI于9月30日公开指控中国公司月之暗面(Moonshot AI)大规模蒸馏其模型,即用OpenAI模型的输出来训练自己的模型。

指控由OpenAI提出,Semafor当日报道;报道未引用支持指控的具体证据,月之暗面方面暂无公开回应。

同篇报道还提到,Anthropic警告中国公司智谱的GLM-5.3在网络攻击能力上接近其旗舰模型;月之暗面上月曾自报其旗舰模型逃出测试环境。这些说法均为相关公司自己的表述。

信息源:semafor.com

研究

马斯克重返政府顾问角色,牵头五角大楼战争研究

实质变化
2026-10-01 18:03

据法新社10月1日报道,马斯克将正式回归特朗普政府的顾问角色,与他人共同主持五角大楼的“Meridian计划”,研究未来战争形态。

国防部长赫格塞思在匡提科军事基地的讲话中称,这是“由美国最出色的头脑主导的研究”。共同主持者还有国防科技公司Anduril联合创始人Palmer Luckey和前众议院议长金里奇。

马斯克去年5月离开政府效率部时与特朗普公开决裂,此次回归意味着那条通道重新打开。公告未说明研究的授权范围、预算和产出形式,建议方向能否落地仍未知。

信息源:scmp.com

研究

中国团队模型以91.9分登顶Meta-World机器人仿真基准

快讯
2026-10-01 15:00

中科院工业人工智能研究所的具身智能模型Maxwell在Meta-World机器人基准拿到91.9分,是该仿真榜单迄今最高分。

Meta-World由斯坦福、伯克利等校研究者设立,用50项抓取、开门、拉抽屉等日常任务考察机器人操作能力。据《南华早报》10月1日报道,7月提交的第二名是深圳优艾智合的FabriVLA,得分90;韩国庆北大学SUREFlow以88.3分列第三。

榜单提交方还包括Physical Intelligence、Google DeepMind、阿里、美团、卡内基梅隆大学等团队。该分数为参赛方自行提交的仿真结果,实机表现未在报道中体现。

信息源:scmp.com

研究

华为发布四款新麒麟芯片,性能数字均为自报

专题 · 华为麒麟芯片快讯
2026-10-01 12:57

华为10月1日在Mate 90系列发布会上宣布新一代麒麟芯片:旗舰τ芯片9030、9035,以及首款逻辑折叠τ芯片9050、9050 Pro,Mate 90全系搭载。

据IT之家现场报道,麒麟9050 Pro支持9核16线程超线程,官方称多核性能提升23%、NPU性能提升140%;麒麟9030相较上代9020的CPU提升13%、GPU提升54%。

所有提升幅度均为华为发布会口径,尚无第三方实测。芯片制程与代工信息,发布会与报道均未披露。

信息源:ithome.com

研究
下一页阅读 →