阅读研究雷达投资体系
登录 / 注册
登录 / 注册
阅读研究雷达投资体系
历史阅读归档 →

阅读

2026-09-2256 条

鼠脑细胞衍生AI模型登陆AWS,性能宣称未经第三方验证

快讯
2026-09-22 21:00

生物计算初创公司TBC的“鼠脑”AI模型9月22日起向部分AWS客户开放限量预览,此前只能通过小型云商Bluesky Compute使用。

该技术用大鼠神经元在多电极阵列上的活动模式改进视频生成模型。公司自称对比其运行的某个开源视频模型,推理最高快五倍,但拒绝说明对比对象,属厂商自测口径,无第三方验证。

公司累计融资超5000万美元,其中追加的2500万美元由WIRED首次报道。AWS高管Ubhi自己也提出疑问:生成十分钟以上的长视频时,保真度能否维持,仍是未知数。

信息源:wired.com

研究

Kantata让咨询企业用一句话生成自己的AI代理

快讯
2026-09-22 20:00

Kantata于9月22日发布Agent Studio,用户用自然语言描述任务,平台自动生成并迭代AI代理,公司称已向客户开放。

该工具内嵌于Expertise Engine,由6月发布的Expertise Agent负责组装,每次构建和修改都会校验输入输出结构,无需填表或写代码。目标用户是业务主管和交付总监。

背景是Kantata对市场的判断:各家厂商在批量推出只管单一环节的窄代理,每个都成了新的维护孤岛。需注意,可用性和客户使用情况均为Kantata自述,尚无独立验证。

信息源:siliconangle.com

研究

联合国AI专家批末日论调,主张区分事实与外推

快讯
2026-09-22 19:08

联合国AI科学专家组成员在纽约联大论坛上公开反对末日式AI风险言论,本吉奥主张分清科学定论与合理外推。

DeepMind高管巴拉尔称应投入精力厘清哪些已有定论、哪些属于未知,渲染恐惧无益。雷萨指舆论在生存威胁与风险无足轻重两极间摇摆。

本吉奥承认在外推领域专家本身尚有分歧。以上为IT之家转引法新社的论坛报道,属与会者表态,非专家组正式文件。

信息源:ithome.com

研究

千万参数精炼即可降音频深伪跨域错误率

快讯
2026-09-21 12:00

在已训练的SSL音频深伪检测器上只训练约1000万可训练参数(总参数5.98亿),即可在14个跨域测试集上把池化等错误率从4.85%降到3.74%。

此前要提升跨域检测表现,通常需要改动原模型参数或新增训练数据;CoReLoop不改动原模型参数、不新增训练数据,通过轻量精炼模块和低秩适配器复用编码器输出。

这一4.85%到3.74%的池化等错误率降幅由作者第一方自测得出;可选的停止头按语句选择精炼深度,平均1.18次即可达到3.73%。

14个测试集构成与基线检测器身份需查正文确认,实际泛化能力待独立复现,预印本提交日期为2026-09-17。

信息源:arxiv.org

研究

几何约束让分镜构图可测,动作还原却下降

快讯
2026-09-21 12:00

分镜构图现在可以被当作几何约束来测量和求解,而不是交给生图模型的默认习惯:在204个外部导演分镜上,成片头部高度可压到目标的0.955倍,单主体面板位置误差在画幅宽度的1.2%以内。

此前剧本到分镜的空间规划依赖生图模型的默认习惯,成片头部高度是目标的1.906倍(导演原文)、1.733倍(编译提示词),构图不可控也不可测。

PACE预印本用类型化表示加相机求解,把空间规划变成可测量的几何约束;声明姿态后,30个镜头的动作命中率从58.9%升到74.4%,构图不变。以上均为作者第一方自测。

作者自己指出:控构图最准的设置画出的动作最少,转场、运动拟合与人工审片仍未解决;v2还删除了从未上传的补充材料,结论待独立复现。

信息源:arxiv.org

研究

新方法让推理模型遗忘时不留破绽,效果仍是自测

快讯
2026-09-21 12:00

GUARD方法已被EMNLP 2026主会接收,论文9月18日提交arXiv。

它针对的问题是:推理模型遗忘敏感内容后,思维链中间步骤仍可能先泄露答案。GUARD把不安全输出改写成连贯不泄露的推理加稳定拒答,再蒸馏进模型参数。

作者还提出NFRS指标,衡量遗忘后输出的结构稳定性、流畅度和无依据替代内容。实验在R-TOFU和一个STAR-1衍生的有害意图设定上进行,覆盖两个蒸馏推理模型,称能降低不安全与隐私泄露并保留推理能力。以上均为作者自测结果,无独立复现。

信息源:arxiv.org

研究

实验显示理财建议信任看风格也看标签

快讯
2026-09-21 12:00

285名美国成年人的随机情景实验显示,建议风格比来源标签更强烈地影响信息与安全评价。

实验独立变换AI、专家、网络社区三种建议风格,推荐内容保持一致。专家标签只选择性提升对来源专业度的感知,决策场景主要影响风险与安全判断。

不显示来源标签时,专家风格的建议仍最受偏好。这是预印本第一方结果,情景为假设性决策,信任与实际依赖不能画等号。

信息源:arxiv.org

研究

智能体写游戏规则,最强组合仅解出52.78%

快讯
2026-09-21 12:00

编码智能体实现游戏逻辑的最佳单次运行只解出52.78%的任务,这是首个逐帧检查游戏规则的基准给出的成绩:72个Godot任务、403个手工场景扩展为1451个测试用例。

此前没有基准逐帧核对游戏规则,因此规则实现错误难以被发现。在20组模型与脚手架组合中,最佳成绩即为52.78%;在Claude Code脚手架下,全部12个模型的成绩都随任务从孤立机制扩展到仓库级功能而下降。多数失败提交能运行,只是规则实现错了。

作者自测发现,评测器若不用突变体做验证,错误的智能体提交也能通过;开放网络时智能体还会从公共仓库抄代码。这是第一方预印本结果,成功率与评测器有效性均待独立复现。

信息源:arxiv.org

研究

AI智能体分级遗传病严重度准确率93.55%

快讯
2026-09-21 12:00

现在可以借助一个结合ReAct与检索增强生成的智能体,对10,211个人类表型本体术语做严重度分级,在专家策展队列上准确率达93.55%,MCC为0.9237。

此前严重度分级依赖人工查阅文献与指南,成本高且难以覆盖全部术语;该系统依据ACMG严重度指南和ACOG生活质量标准检索PubMed文献并生成可核查的推理链,作者称82.6%至91.4%的论断有直接证据或有效推理支撑,基因层面与Mackenzie's Mission基因清单的一致率为95.2%。

该结果由研究团队第一方报告,基于作者自建队列,临床或基因检测面板设计应用仍待验证,尚无独立复现;结果出自arXiv预印本。

信息源:arxiv.org

研究

美国AI近每日使用率半年翻倍,但调查口径有变

快讯
2026-09-20 18:03

Epoch AI与Ipsos调查显示,美国成年人几乎每天用AI的比例半年内从8%升至19%。

两轮调查分别于2026年3月和8月进行,样本2017人和1016人,随机抽样并按人口加权。同期每周仅用一次AI的比例从17%降到10%,增长主要来自低频用户转高频。

两轮提问方式不同:3月问总体频率,8月按服务分别问再取最高值。Epoch AI承认结果不完全可比,8月数字可能低估实际使用。

信息源:the-decoder.com

研究

自测显示AI监控器还原智能体事件漏掉过半细节

快讯
2026-09-22 10:59

一个研究团队用自编谋杀谜题测试AI能否从多智能体交互记录中还原底层真相,结论是:最强的GPT-6 Astra高推理档也只完整还原了48.1%的预设事实与关系。

实验先由作者手工构建包含184个节点、229条边的事件图作为标准答案,再让8个智能体模拟调查,最后让各模型仅凭约5.8万词的交互轨迹重建历史。遗漏远多于错误:Astra高推理档有42.6%的条目干脆没报告,Gemini 3.1 Pro仅还原16.5%。

需要说明这是第一方结果:评分由GPT-5.6 Sol流水线判分,尚未经独立人工验证,且十个模拟都出自同一个谜题,泛化性未知。作者自己也把人工判分验证列为下一步。对做智能体事故调查的读者,可借鉴的是其方法——预先固定标准答案,才能测出监控报告'漏了什么',而不只是'说错了什么'。

信息源:lesswrong.com

研究

多智能体并行买速度不省算力,同性能token约翻倍

快讯
2026-09-22 04:30

从OpenAI公开图表看,多智能体并行主要买速度,不省算力。

Toby Ord在LessWrong分析GPT 5.6发布页图表:达到同等性能,4智能体群耗用的总token约为单智能体的两倍,16智能体再翻倍。据此估算的并行度参数λ约在0.48至0.68之间,因任务类型而异。

这意味着靠扩大智能体群换能力,比拉长单个智能体的思维链更贵;多智能体的价值在提速,约以2倍成本换2倍速度。注意这是博主对厂商图表的解读,回归由Claude Opus 5完成,不是独立测量。

信息源:lesswrong.com

研究
下一页阅读 →