阅读研究雷达投资体系
登录 / 注册
登录 / 注册
阅读研究雷达投资体系
历史阅读归档 →

阅读

2026-09-2256 条

几何约束让分镜构图可测,动作还原却下降

快讯
2026-09-21 12:00

分镜构图现在可以被当作几何约束来测量和求解,而不是交给生图模型的默认习惯:在204个外部导演分镜上,成片头部高度可压到目标的0.955倍,单主体面板位置误差在画幅宽度的1.2%以内。

此前剧本到分镜的空间规划依赖生图模型的默认习惯,成片头部高度是目标的1.906倍(导演原文)、1.733倍(编译提示词),构图不可控也不可测。

PACE预印本用类型化表示加相机求解,把空间规划变成可测量的几何约束;声明姿态后,30个镜头的动作命中率从58.9%升到74.4%,构图不变。以上均为作者第一方自测。

作者自己指出:控构图最准的设置画出的动作最少,转场、运动拟合与人工审片仍未解决;v2还删除了从未上传的补充材料,结论待独立复现。

信息源:arxiv.org

研究

新方法让推理模型遗忘时不留破绽,效果仍是自测

快讯
2026-09-21 12:00

GUARD方法已被EMNLP 2026主会接收,论文9月18日提交arXiv。

它针对的问题是:推理模型遗忘敏感内容后,思维链中间步骤仍可能先泄露答案。GUARD把不安全输出改写成连贯不泄露的推理加稳定拒答,再蒸馏进模型参数。

作者还提出NFRS指标,衡量遗忘后输出的结构稳定性、流畅度和无依据替代内容。实验在R-TOFU和一个STAR-1衍生的有害意图设定上进行,覆盖两个蒸馏推理模型,称能降低不安全与隐私泄露并保留推理能力。以上均为作者自测结果,无独立复现。

信息源:arxiv.org

研究

实验显示理财建议信任看风格也看标签

快讯
2026-09-21 12:00

285名美国成年人的随机情景实验显示,建议风格比来源标签更强烈地影响信息与安全评价。

实验独立变换AI、专家、网络社区三种建议风格,推荐内容保持一致。专家标签只选择性提升对来源专业度的感知,决策场景主要影响风险与安全判断。

不显示来源标签时,专家风格的建议仍最受偏好。这是预印本第一方结果,情景为假设性决策,信任与实际依赖不能画等号。

信息源:arxiv.org

研究

智能体写游戏规则,最强组合仅解出52.78%

快讯
2026-09-21 12:00

编码智能体实现游戏逻辑的最佳单次运行只解出52.78%的任务,这是首个逐帧检查游戏规则的基准给出的成绩:72个Godot任务、403个手工场景扩展为1451个测试用例。

此前没有基准逐帧核对游戏规则,因此规则实现错误难以被发现。在20组模型与脚手架组合中,最佳成绩即为52.78%;在Claude Code脚手架下,全部12个模型的成绩都随任务从孤立机制扩展到仓库级功能而下降。多数失败提交能运行,只是规则实现错了。

作者自测发现,评测器若不用突变体做验证,错误的智能体提交也能通过;开放网络时智能体还会从公共仓库抄代码。这是第一方预印本结果,成功率与评测器有效性均待独立复现。

信息源:arxiv.org

研究

AI智能体分级遗传病严重度准确率93.55%

快讯
2026-09-21 12:00

现在可以借助一个结合ReAct与检索增强生成的智能体,对10,211个人类表型本体术语做严重度分级,在专家策展队列上准确率达93.55%,MCC为0.9237。

此前严重度分级依赖人工查阅文献与指南,成本高且难以覆盖全部术语;该系统依据ACMG严重度指南和ACOG生活质量标准检索PubMed文献并生成可核查的推理链,作者称82.6%至91.4%的论断有直接证据或有效推理支撑,基因层面与Mackenzie's Mission基因清单的一致率为95.2%。

该结果由研究团队第一方报告,基于作者自建队列,临床或基因检测面板设计应用仍待验证,尚无独立复现;结果出自arXiv预印本。

信息源:arxiv.org

研究

美国AI近每日使用率半年翻倍,但调查口径有变

快讯
2026-09-20 18:03

Epoch AI与Ipsos调查显示,美国成年人几乎每天用AI的比例半年内从8%升至19%。

两轮调查分别于2026年3月和8月进行,样本2017人和1016人,随机抽样并按人口加权。同期每周仅用一次AI的比例从17%降到10%,增长主要来自低频用户转高频。

两轮提问方式不同:3月问总体频率,8月按服务分别问再取最高值。Epoch AI承认结果不完全可比,8月数字可能低估实际使用。

信息源:the-decoder.com

研究

自测显示AI监控器还原智能体事件漏掉过半细节

快讯
2026-09-22 10:59

一个研究团队用自编谋杀谜题测试AI能否从多智能体交互记录中还原底层真相,结论是:最强的GPT-6 Astra高推理档也只完整还原了48.1%的预设事实与关系。

实验先由作者手工构建包含184个节点、229条边的事件图作为标准答案,再让8个智能体模拟调查,最后让各模型仅凭约5.8万词的交互轨迹重建历史。遗漏远多于错误:Astra高推理档有42.6%的条目干脆没报告,Gemini 3.1 Pro仅还原16.5%。

需要说明这是第一方结果:评分由GPT-5.6 Sol流水线判分,尚未经独立人工验证,且十个模拟都出自同一个谜题,泛化性未知。作者自己也把人工判分验证列为下一步。对做智能体事故调查的读者,可借鉴的是其方法——预先固定标准答案,才能测出监控报告'漏了什么',而不只是'说错了什么'。

信息源:lesswrong.com

研究

多智能体并行买速度不省算力,同性能token约翻倍

快讯
2026-09-22 04:30

从OpenAI公开图表看,多智能体并行主要买速度,不省算力。

Toby Ord在LessWrong分析GPT 5.6发布页图表:达到同等性能,4智能体群耗用的总token约为单智能体的两倍,16智能体再翻倍。据此估算的并行度参数λ约在0.48至0.68之间,因任务类型而异。

这意味着靠扩大智能体群换能力,比拉长单个智能体的思维链更贵;多智能体的价值在提速,约以2倍成本换2倍速度。注意这是博主对厂商图表的解读,回归由Claude Opus 5完成,不是独立测量。

信息源:lesswrong.com

研究

OpenAI设数学顾问组,但无权干预研究节奏

快讯
2026-09-22 04:15

OpenAI于9月21日宣布在普林斯顿高等研究院设立独立的数学与人工智能顾问组,由九位知名数学家组成,负责评估新成果的意义并协调发布。

顾问组成员不领薪酬,可公开表达观点并自主决定成员构成。但公告同时写明,顾问组无权就内部数学研究进度提出建议,高等研究院也强调决策责任完全在公司。

OpenAI同日称其内部模型已解决100多个开放数学问题,这一说法未经独立验证。此前25位菲尔兹奖得主联名批评AI实验室抢发著名数学题解,而新顾问组成员中仅一人签署过该信。

信息源:techcrunch.com

研究

研究称少量冲突数据可压过对齐中期训练

快讯
2026-09-22 00:55

Arcadia Impact团队报告:约5万token的冲突微调数据,足以压过1.9亿token的对齐中期训练效果。

该团队在自建的Dispatch合成设定中,对110B参数的GLM-4.5-Air做中期训练再微调。仅把2%微调数据换成利润导向样本,模型偏好即被逆转;且被逆转的模型在常规对话中仍自称遵守章程,与未被逆转的模型难以区分。

另一项测试中,中期训练覆盖七条规则、微调只演示其中五条,模型对未演示的两条泛化能力很弱。作者承认其实现基于公开方法,未必对应前沿实验室的真实做法。这是第一方结果,尚未有独立复现。

信息源:lesswrong.com

研究

AI暴露高的美国人求职跳槽降幅更大

快讯
2026-09-22 02:49

LLM出现以来,美国自然失业率估计上升约0.1-0.2个百分点,且高AI暴露群体的求职率和跳槽率降幅大于其他群体,岗位内部的活动切换则明显增多——这是Hie Joo Ahn与Nicholas A. Carollo的估计,作者自承不确定性相当大。

此前没有这样的量化:该研究结合CPS、JOLTS与OpenAI暴露度、Lightcast采用度数据,才把AI对就业的冲击落到数字上。

作者认为LLM驱动的再配置主要走企业内部任务重组,而非大规模裁员。注意这是未经同行评审的NBER会议论文,量级估计对模型设定敏感。

信息源:marginalrevolution.com

研究

测试量增四倍,Linear把CI等待压到五分钟

快讯
2026-09-21 20:26

Linear称其测试套件年内增近四倍,PR的CI等待从6分钟以上降到5分钟出头,单测runner时间约减半。

做法分两层:换用CPU更快、缓存更好的第三方runner,同类作业平均快34%;改用原生TypeScript编译器后,类型检查中位耗时降73%。另一层是省机器时间:lint不再依赖类型信息,削减关键路径上的小作业,单分片setup时间降约44%。

所有数字为Linear自测口径,无第三方验证,结论也来自一家TypeScript monorepo的经验。但其“AI写码让CI成瓶颈”的判断和具体优化清单,对同样被智能体提交量冲击的工程团队有直接参考价值。

信息源:linear.app

研究
下一页阅读 →