阅读研究雷达投资体系
登录 / 注册
登录 / 注册
阅读研究雷达投资体系
历史阅读归档 →

阅读

2026-09-2256 条

智能体写游戏规则,最强组合仅解出52.78%

快讯
2026-09-21 12:00

编码智能体实现游戏逻辑的最佳单次运行只解出52.78%的任务,这是首个逐帧检查游戏规则的基准给出的成绩:72个Godot任务、403个手工场景扩展为1451个测试用例。

此前没有基准逐帧核对游戏规则,因此规则实现错误难以被发现。在20组模型与脚手架组合中,最佳成绩即为52.78%;在Claude Code脚手架下,全部12个模型的成绩都随任务从孤立机制扩展到仓库级功能而下降。多数失败提交能运行,只是规则实现错了。

作者自测发现,评测器若不用突变体做验证,错误的智能体提交也能通过;开放网络时智能体还会从公共仓库抄代码。这是第一方预印本结果,成功率与评测器有效性均待独立复现。

信息源:arxiv.org

研究

AI智能体分级遗传病严重度准确率93.55%

快讯
2026-09-21 12:00

现在可以借助一个结合ReAct与检索增强生成的智能体,对10,211个人类表型本体术语做严重度分级,在专家策展队列上准确率达93.55%,MCC为0.9237。

此前严重度分级依赖人工查阅文献与指南,成本高且难以覆盖全部术语;该系统依据ACMG严重度指南和ACOG生活质量标准检索PubMed文献并生成可核查的推理链,作者称82.6%至91.4%的论断有直接证据或有效推理支撑,基因层面与Mackenzie's Mission基因清单的一致率为95.2%。

该结果由研究团队第一方报告,基于作者自建队列,临床或基因检测面板设计应用仍待验证,尚无独立复现;结果出自arXiv预印本。

信息源:arxiv.org

研究

美国AI近每日使用率半年翻倍,但调查口径有变

快讯
2026-09-20 18:03

Epoch AI与Ipsos调查显示,美国成年人几乎每天用AI的比例半年内从8%升至19%。

两轮调查分别于2026年3月和8月进行,样本2017人和1016人,随机抽样并按人口加权。同期每周仅用一次AI的比例从17%降到10%,增长主要来自低频用户转高频。

两轮提问方式不同:3月问总体频率,8月按服务分别问再取最高值。Epoch AI承认结果不完全可比,8月数字可能低估实际使用。

信息源:the-decoder.com

研究

自测显示AI监控器还原智能体事件漏掉过半细节

快讯
2026-09-22 10:59

一个研究团队用自编谋杀谜题测试AI能否从多智能体交互记录中还原底层真相,结论是:最强的GPT-6 Astra高推理档也只完整还原了48.1%的预设事实与关系。

实验先由作者手工构建包含184个节点、229条边的事件图作为标准答案,再让8个智能体模拟调查,最后让各模型仅凭约5.8万词的交互轨迹重建历史。遗漏远多于错误:Astra高推理档有42.6%的条目干脆没报告,Gemini 3.1 Pro仅还原16.5%。

需要说明这是第一方结果:评分由GPT-5.6 Sol流水线判分,尚未经独立人工验证,且十个模拟都出自同一个谜题,泛化性未知。作者自己也把人工判分验证列为下一步。对做智能体事故调查的读者,可借鉴的是其方法——预先固定标准答案,才能测出监控报告'漏了什么',而不只是'说错了什么'。

信息源:lesswrong.com

研究

多智能体并行买速度不省算力,同性能token约翻倍

快讯
2026-09-22 04:30

从OpenAI公开图表看,多智能体并行主要买速度,不省算力。

Toby Ord在LessWrong分析GPT 5.6发布页图表:达到同等性能,4智能体群耗用的总token约为单智能体的两倍,16智能体再翻倍。据此估算的并行度参数λ约在0.48至0.68之间,因任务类型而异。

这意味着靠扩大智能体群换能力,比拉长单个智能体的思维链更贵;多智能体的价值在提速,约以2倍成本换2倍速度。注意这是博主对厂商图表的解读,回归由Claude Opus 5完成,不是独立测量。

信息源:lesswrong.com

研究

OpenAI设数学顾问组,但无权干预研究节奏

快讯
2026-09-22 04:15

OpenAI于9月21日宣布在普林斯顿高等研究院设立独立的数学与人工智能顾问组,由九位知名数学家组成,负责评估新成果的意义并协调发布。

顾问组成员不领薪酬,可公开表达观点并自主决定成员构成。但公告同时写明,顾问组无权就内部数学研究进度提出建议,高等研究院也强调决策责任完全在公司。

OpenAI同日称其内部模型已解决100多个开放数学问题,这一说法未经独立验证。此前25位菲尔兹奖得主联名批评AI实验室抢发著名数学题解,而新顾问组成员中仅一人签署过该信。

信息源:techcrunch.com

研究

研究称少量冲突数据可压过对齐中期训练

快讯
2026-09-22 00:55

Arcadia Impact团队报告:约5万token的冲突微调数据,足以压过1.9亿token的对齐中期训练效果。

该团队在自建的Dispatch合成设定中,对110B参数的GLM-4.5-Air做中期训练再微调。仅把2%微调数据换成利润导向样本,模型偏好即被逆转;且被逆转的模型在常规对话中仍自称遵守章程,与未被逆转的模型难以区分。

另一项测试中,中期训练覆盖七条规则、微调只演示其中五条,模型对未演示的两条泛化能力很弱。作者承认其实现基于公开方法,未必对应前沿实验室的真实做法。这是第一方结果,尚未有独立复现。

信息源:lesswrong.com

研究

AI暴露高的美国人求职跳槽降幅更大

快讯
2026-09-22 02:49

LLM出现以来,美国自然失业率估计上升约0.1-0.2个百分点,且高AI暴露群体的求职率和跳槽率降幅大于其他群体,岗位内部的活动切换则明显增多——这是Hie Joo Ahn与Nicholas A. Carollo的估计,作者自承不确定性相当大。

此前没有这样的量化:该研究结合CPS、JOLTS与OpenAI暴露度、Lightcast采用度数据,才把AI对就业的冲击落到数字上。

作者认为LLM驱动的再配置主要走企业内部任务重组,而非大规模裁员。注意这是未经同行评审的NBER会议论文,量级估计对模型设定敏感。

信息源:marginalrevolution.com

研究

测试量增四倍,Linear把CI等待压到五分钟

快讯
2026-09-21 20:26

Linear称其测试套件年内增近四倍,PR的CI等待从6分钟以上降到5分钟出头,单测runner时间约减半。

做法分两层:换用CPU更快、缓存更好的第三方runner,同类作业平均快34%;改用原生TypeScript编译器后,类型检查中位耗时降73%。另一层是省机器时间:lint不再依赖类型信息,削减关键路径上的小作业,单分片setup时间降约44%。

所有数字为Linear自测口径,无第三方验证,结论也来自一家TypeScript monorepo的经验。但其“AI写码让CI成瓶颈”的判断和具体优化清单,对同样被智能体提交量冲击的工程团队有直接参考价值。

信息源:linear.app

研究

英伟达为AI工厂电源冷却设备设认证门槛

快讯
2026-09-22 02:00

英伟达9月21日推出DSX Ready认证计划,为符合其AI工厂参考设计的电力和冷却产品发放资格标签。

首批覆盖两类:电池储能系统(BESS)认证厂商为Hitachi Energy、LG Energy Solution和Tesla;冷却分配单元(CDU)认证厂商为LG Electronics、LiquidStack和Vertiv。后续将扩展更多类别。

需要留意的是,CDU走的是自认证套件,厂商自行运行测试后提交英伟达审核;英伟达自己也说明,通过认证不替代站点级工程验证,不等于设备在具体站点稳定可用。

信息源:blogs.nvidia.com

研究

AWS开源Strands Harness,智能体可跨云部署

快讯
2026-09-22 00:00

AWS于9月21日发布开源智能体框架Strands Harness,可在本地或任意云环境运行,包括Google Cloud、Azure和Cloudflare。

它内置读写、shell和网络搜索工具,能自行管理上下文窗口并跨会话保留记忆,底层可接Anthropic、OpenAI、Bedrock、Google或本地Ollama模型。开发者可用pip或npm直接安装。

AWS称该框架比其他框架的智能体效率高26%,用Anthropic Fable 5模型时成本比Claude Code低77%。这些均为AWS自测结果。

信息源:siliconangle.com

研究

北约支持初创演示断网自主打击无人机,性能仍是自述

快讯
2026-09-20 19:36

获北约DIANA项目支持的瑞典公司Scaleout Systems演示了机载AI巡飞弹药:无人机在无外部算力条件下自主探测、识别目标并给出坐标,随后投放爆炸物打击。

该演示属于BAE Systems Bofors牵头的ALMA低成本巡飞弹药项目。公司另在6月于瑞典空军基地测试了联邦学习架构:前沿节点与中央节点通信中断后,本地设备仍可独立完成AI推理与主动学习,链路恢复后再同步模型。

需要说明的是,上述性能结论全部来自公司自己的演示材料与CEO采访,尚无独立验证或实战记录。

信息源:ithome.com

研究
下一页阅读 →