阅读研究雷达投资体系
登录 / 注册
登录 / 注册
阅读研究雷达投资体系
历史阅读归档 →

阅读

2026-09-18119 条

RL训练LoRA改写策略对齐SFT数据分布,三骨干非下游退化均降低

快讯
核验于 2026-09-18 01:36

用强化学习训练轻量LoRA改写策略来改写SFT数据,可在任务一致性硬门下优化问答式分布对齐与语义多样性;作者自报,三个指令微调骨干的上下游增益与标准SFT大致相当,且所有评测设置中非下游基准退化均降低。

此前SFT数据改写缺乏这种形式化处理,改写质量与下游代价难以同时控制。

该结果为作者自报:三个指令微调骨干上,上下游增益与标准SFT大致相当,非下游基准退化在所有评测设置中均降低;跨域复用改写策略仅为初步证据。

边界:结果未经第三方复现;该工作为arXiv预印本2602.11220,2月11日首提,9月16日更新v2。来源:arXiv摘要页 ↗

信息源:arxiv.org

研究

德国保险经纪MRH Trowe自述:自助AI智能体首月覆盖约400名员工,每席月成本约14美元

快讯
核验于 2026-09-18 01:33

据AWS与MRH Trowe联合发布的客户案例,这家德国商业保险经纪在投产首月为约400名员工开通受管的自助AI智能体,采用开源Strands Agents、Amazon Bedrock AgentCore与LibreChat搭建,数据与模型留在法兰克福区域,经Microsoft Entra ID以员工本人身份访问。公司自述首月基础设施加token成本约每席14美元,并称通过调优与定时扩缩还有约40%降本空间;首个智能体把Teams会议转成结构化纪要,目标2026年底由业务专家维护10–15个智能体。上述数字为厂商与客户自报,未经独立核实。

来源:AWS机器学习博客——MRH Trowe客户案例(2026-09-17) ↗

信息源:aws.amazon.com

研究

EFF报告:全美警察在Flock车牌识别搜索中填写“LOL”“idk”等无意义理由

快讯
核验于 2026-09-18 01:29

电子前哨基金会(EFF)9月14日发布报告:依据公共记录获取的审计日志,全美多地警察在检索Flock自动车牌识别(ALPR)网络时填写“LOL”“LMAO”“idk”等理由;印第安纳州Goshen一名警官2025年5月7日一次横跨6474个ALPR网络、涉及82,413个摄像头数据的搜索,理由仅填“idk”,另有30多个机构逾6300次搜索填“TBD”。Flock于2025年底将理由字段改为下拉菜单,EFF称此类记录自2026年初起明显减少。该分析出自EFF一方,尚无独立核实。

来源:

  • EFF报告:The High Crime of "LMAO"(EFF原文) ↗
  • EFFector 38.16新闻信(EFF原文) ↗

信息源:eff.org

研究

共享选择性持久记忆令智能体任务完成率达96%,存全量历史反降至71%

快讯
核验于 2026-09-18 01:23

智能体LLM系统采用共享选择性持久记忆后,在三个企业部署场景任务完成率达96%,而无记忆为79%,持久化全部历史反降至71%——这是苹果机器学习研究团队9月16日发布的结果。

此前做法是持久化全部历史或完全不设记忆,前者反而拖累任务完成率,且会话级推理痕迹占用大量上下文。

该方法只保留任务规格、数据模式、工具配置与输出约束四类可复用上下文,丢弃会话级推理痕迹,并支持跨用户共享;团队自报摘要驱动的数据表示较原始数据注入降低约97倍token成本。以上均为厂商自报结果。

边界:结果限于三个企业部署场景,尚未见第三方复现;预印本7月10日提交arXiv(arXiv:2607.09493),9月15日更新至v2。

信息源:machinelearning.apple.com

研究

TypeSafe发布仅做决策的模型Jev,自报较现有LLM快20–200倍、便宜40–400倍

快讯
核验于 2026-09-18 01:15

TypeSafe于9月15日发布决策专用模型Jev并开放早期访问:不做自回归文本生成,只对预定义输出结构给出带校准概率的分类、路由与评分。创始人Diogo Almeida称其以新方法RLCD训练,自报较现有LLM在决策类任务上智能相当、快20–200倍、省40–400倍且输出token免费;实际生产效果待观察。

资料:TypeSafe公告 ↗、Diogo Almeida公告帖 ↗

信息源:latent.space

研究

单时刻稳态快照即可恢复粒子系统相互作用核,无需轨迹,作者自报稳定

快讯
核验于 2026-09-18 01:08

现在仅凭集体行为的单时刻稳态快照,就能识别相互作用粒子系统,无需任何轨迹观测。

以往识别这类系统依赖轨迹观测;Baoli Hao、Mauro Maggioni与Ming Zhong改以不同未观测初始条件下构型的经验分布做正则化,求解这一病态逆问题。

作者自报在多类稳态与准稳态代表性模型上稳定且准确地恢复出相互作用核。

边界:结果为作者自报,尚无第三方复现;该工作为arXiv预印本(arXiv:2609.12004),9月10日提交、16日更新v2。

信息源:arxiv.org

研究

DiffAdapterVLA将轨迹token注入驾驶VLM后层,自报NAVSIM低延迟闭环规划

快讯
2026-09-23 12:00

DiffAdapterVLA把显式轨迹token注入驾驶视觉语言模型后层,使轨迹状态与驾驶条件在骨干内逐深度共同演化,用轻量层级适配器递归细化轨迹,不再依赖独立规划器。此前驾驶VLM的轨迹生成与驾驶条件演化相互割裂,往往依赖独立规划器,增加延迟与复杂度。

作者自报,在NAVSIM基准上以少量可训练参数获得高质量、低延迟闭环规划。

边界:结果为作者自报,尚无第三方复现;该工作由Changxin Lu等八人团队完成,9月14日提交arXiv预印本(16日更新v2,arXiv:2609.15322)。

信息源:arxiv.org

研究

AI原生计费平台Creem完成500万欧元种子轮融资,累计融资达700万欧元

快讯
核验于 2026-09-18 01:00

据Tech.eu 9月17日报道,面向AI原生软件公司的计费与变现平台Creem完成500万欧元种子轮融资,由Inovo VC领投,老股东Practica Capital与Antler参投,天使投资人包括Bolt创始人Markus Villig等;本轮后累计融资达700万欧元,估值未披露。公司由Google与Adyen前员工Gabriel Ferraz和Alec Erasmus创立,平台覆盖计费、支付、税务合规、打款与收入管理,正开发Creem 2.0,设计上让人员与AI代理共同运营店铺计费与收入优化;新资金将在未来12至18个月用于扩展代理运营计费能力及法币与稳定币打款通道。代理配置计费为公司自述。

原始报道:Tech.eu — Creem secures €5M to build financial infrastructure for AI-native startups ↗

信息源:tech.eu

研究

手术视频问答基准自报14256问答对与14.61%提升

快讯
核验于 2026-09-18 00:59

手术视频AI领域现在有了一个覆盖五类手术任务的问答基准SurgCoTBench,作者自报含14256个问答对,检索增强多智能体推理准确率超受监督模型14.61%。

此前该领域缺少统一的手术视频问答评测基准,难以比较不同方法在五类手术任务上的表现。

Chang Han Low等人自报上述基准与14.61%的准确率提升,于9月16日更新arXiv v3,条目标注IEEE RA-L 2026期刊引用;代码已在GitHub开放,数据集已发布。

尚无独立验证。

参考来源:

  • arXiv摘要页(v3,2026-09-16修订) ↗
  • SurgRAW代码仓库(GitHub) ↗

信息源:arxiv.org

研究

The Decoder:GPT-6 Astra 18小时通关《宝可梦火红》,上代GPT-5.6 Sol需96小时

快讯
核验于 2026-09-18 00:54

据The Decoder 9月17日报道,操作者Clad3815的同一Pokemon FireRed项目中,OpenAI的GPT-6 Astra用18小时12分通关夺冠,GPT-5.6 Sol需96小时35分。Vals AI称其Minecraft运行经通用计算机操作141小时后终止。以上为运营方自跑结果,非独立验证。

来源:The Decoder原文 ↗、Clad3815的X帖 ↗、Vals AI的X帖 ↗

信息源:the-decoder.com

研究

苹果发布REVERSAL-BENCH基准:自评显示免重置强化学习遇“可逆性悬崖”

快讯
核验于 2026-09-18 00:22

苹果机器学习研究团队介绍REVERSAL-BENCH基准,论文9月15日提交arXiv:以连续参数ρ控制环境可逆性,配重置oracle检验状态可恢复性,覆盖五个物理引擎、八个操作任务。团队自评显示,随ρ升高,免重置强化学习智能体被持续吸收进不可恢复状态、学习停滞,情节式智能体则保持稳定;基准与数据集已放出。

来源:苹果机器学习研究:REVERSAL-BENCH ↗、arXiv论文页 ↗

信息源:machinelearning.apple.com

研究

已读完当前范围的内容