阅读研究雷达投资体系
登录 / 注册
登录 / 注册
阅读研究雷达投资体系
历史阅读归档 →

阅读

2026-09-2456 条

双轨记忆自报登顶EverMemBench,尚无第三方复现

快讯
2026-09-23 12:00

多方对话记忆的归属难题有了新方法信号:SpeakerMem-R1自报在EverMind-AI公开EverMemBench榜单提交62.33%,为当前最高,并称可同时解决谁说了什么、跨成员跨时间状态重建两个瓶颈。做法是把说话人标注的逐字消息和派生状态分成双轨存储,查询时按实体、事件、时间合并证据。

此前方法在多方对话记忆上缺乏同时处理说话人归属与状态重建的方案,作者自报在GroupMemBench、SocialMemBench、EverMemBench上二元准确率分别仅47.9%、69.2%、61.9%。

作者自报的305题对照实验中,强化学习把SFT写入器的平均准确率从57.38%提到68.20%;榜单最高62.33%也是作者自己提交的成绩。

所有数字均为第一方评测、未经独立复现,GroupMemBench不足48%说明问题远未解决;该预印本材料标注日期为2026-09-22,宜作方法信号跟踪。

信息源:arxiv.org

研究

CoAx以0.941 AUC定位备份头,仍待第三方复现

快讯
2026-09-23 12:00

做电路分析或安全评估的读者现在多了一个可用的思路:条件共消融(CoAx)能在消融主组件后,按消融效应的增长幅度排序,找出被激活的备份组件,作者自报在GPT-2 IOI电路上以0.941 ROC-AUC恢复已知备份头。

此前要恢复被主组件掩盖的备份头,只能依赖完整状态归因,最强基线在GPT-2-small的IOI电路上只有0.815 ROC-AUC,且无法直接补全不完整电路。

作者自报的测量是:CoAx在该IOI电路上以0.941 ROC-AUC恢复已知备份头,把选出的头补入不完整电路后,不完整度从0.75降到0.21;作者还称该方法在6个架构家族的8个非GPT-2模型上均优于匹配的随机补全。

所有数字均为作者第一方评测,备份头恢复主要在已知答案的IOI设定上验证,尚无他人复现;预印本arXiv 2607.01940(v3,2026年9月23日)。

信息源:arxiv.org

研究

VERPO词元级信用分配避免GRPO训练崩溃

快讯
2026-09-22 12:00

VERPO把教师指导拆到词元级做信用分配,可以避免GRPO按整句估计优势导致的优化崩溃,并在五个科学推理与工具使用任务上取得最高多任务平均分。

此前GRPO按整句打分估计优势,作者称这种整句粒度会引发优化崩溃。

作者自报小模型提升更明显;这是作者第一方评测,无独立复现。

方法细节含Fisher移动成本控制器与FEC投影,v4版9月23日更新,是否成立待第三方验证。

信息源:arxiv.org

研究

苹果probe guidance免额外前向传播引导扩散语言模型

快讯
2026-09-23 08:00

读者现在可以了解一种不增加推理成本就能引导扩散语言模型的方法:苹果机器学习研究团队提出的probe guidance,用现有扩散模型冻结的内部状态构造引导信号,省去autoguidance所需的额外推理前向传播,并称应用于1.7B扩散语言模型时在多项选择题基准上持续提升。

此前autoguidance需要额外的前向传播,且一直缺乏对其原理的解释。

团队自报,该方法在连续扩散语言模型的无条件生成上创下新SOTA。这些成绩均为第一方基准。

该方法还给出一个机制发现:autoguidance中的弱模型必须来自训练的低熵区域。若成立,这对扩散语言模型研究比单个基准数字更有参考价值。以上结果尚未经独立复现,出自2026-09-23提交的论文。

信息源:machinelearning.apple.com

研究

Radical Numerics自报基因组模型能延续适配体优化轨迹

快讯
2026-09-23 21:27

Radical Numerics CEO Eric Nguyen在9月23日Latent Space节目简介中自述:其基因组语言模型在适配体实验中,只展示低分RNA序列后,能复现部分被留出的高分样本。

据该期节目简介,实验将表现最好的适配体留出,仅向模型展示较低分数的序列并逐步抬升,模型随后自行延续了这一轨迹。Nguyen称之为“用DNA思考”的链式推理。

这是公司第一方口径,实验的数据集规模、评分方法与完整结果均未随简介公开,不能当作独立验证的性能。可关注其是否发布可核对的论文或基准。

信息源:latent.space

研究

Ringg自报语音智能体月接700万通电话,成本降九成为厂商口径

快讯
2026-09-23 20:00

OpenAI于9月23日发布客户案例,称印度语音客服平台Ringg的智能体每月处理超过700万通接通电话,最高65%的常规请求无需人工介入。

案例称,Ringg将部分实时工作负载从GPT-4.1迁移到GPT-5.6后,模型成本约下降90%;保险平台Policybazaar接入的来电中67%由智能体处理,平均响应时间从8–12分钟降至60秒以内。

以上解决率、成本降幅与4.8的CSAT均为Ringg与OpenAI自报,无独立验证,且65%为上限口径,典型表现可能更低。

信息源:openai.com

研究

猫箱操盘手离职创业,押注AI泛创作娱乐

快讯
2026-09-24 07:00

猫箱前负责人梁琛奇已于2025年夏离开字节跳动,创立AI娱乐公司「动念引线」。

据《晚点聊》182期节目简介,他此前在字节7年,2023年起在AI产品部门Flow带团队做出猫箱,新公司押注泛创作表达混合轻游戏的体验,并自行训练模型。

他的判断是:当人不再需要为生计工作,泛创作会成为普及、高频的娱乐活动。目前AI娱乐方向尚无公认的爆款产品,公司也未披露融资与用户数据,以上均为其本人陈述。

信息源:podcast.latepost.com

研究

数据不出设备也能联合训练模型,但只在模拟里验证过

实质变化
核验于 2026-10-03 18:32

长期信息 · 《Communication-Efficient Learning of Deep Networks from Decentralized Data》(2016)

有些数据散在大量手机上,隐私不允许集中到服务器。FedAvg 这篇论文的做法是:每台手机用自己的数据在本地训练几轮,只把模型改动发上去取平均,不传原始数据,通信来回次数比集中训练少十倍到一百倍。这类做法统称联邦学习。

今天厂商宣传"数据不上传也能改进模型"时,跑的仍是这套本地训练加平均的底子,后来的改进都在它上面修补。听到这类宣传,先问效果是模拟测的还是真实手机上测的,原论文自己只做到模拟。

如果设备会掉线、数据会变,或有人故意提交坏更新,这些它都没处理。如果问题是这类训练会不会泄露隐私、真实设备上效果如何,它只在模拟里验证过,别拿它下结论。

《Communication-Efficient Learning of Deep Networks from Decentralized Data》(2016)|下次复查 2027-09-20

信息源:arxiv.org

研究

已读完当前范围的内容