阅读研究雷达投资体系
登录 / 注册
登录 / 注册
阅读研究雷达投资体系
历史阅读归档 →

阅读

2026-09-2456 条

非洲团队从零训练小模型,自报多语言基准领先

快讯
2026-09-24 05:25

Vambo AI发布从零训练的MORENA模型,15亿参数覆盖12种非洲语言,自报基准成绩优于26个受测模型。

开发方称其在非洲语言建模上得1.408 bpb,为26个受测模型中最佳;最接近的对手Lugha-Llama-8B有五倍以上参数,得1.423 bpb。这些数字全部来自开发方自报,经TechRadar转述。

机制上的差异是自建词表:非洲文本编码比Gemma 3少1.39倍token,但仍比英语多约6%的token开销,团队称无法完全解释。训练用约2.2万A100 GPU小时,获UNDP等机构算力支持。

信息源:techradar.com

研究

微软Defender开放安全运营中心预览,智能体成防御主力

快讯
2026-09-24 06:10

微软于9月23日开放安全运营中心(ISOC)公共预览,把自家安全分析平台Sentinel的日志告警集中分析功能(SIEM)直接并入Defender。

预览面向持有Defender Suite、Microsoft 365 E5或E7许可的客户;已在运行活跃Sentinel工作区的组织暂被排除。案例管理、工作簿等功能开箱即用,用户实体行为分析和第三方数据接入则需额外配置,接入外部数据可能产生摄取费用。

设计核心是让安全智能体获得与人类分析师相同的信号和权限,可自主调查并处置事件,高风险动作仍需人工批准。微软未公布定价,预览期Defender数据免费保留30天。攻击者利用智能体的说法出自微软高管博客,属厂商口径。

信息源:siliconangle.com

研究

Neo4j新版本默认启用二进制量化,向量检索省内存

快讯
2026-09-23 19:06

从 Neo4j 2026.09 起,Aura、企业版和社区版新建向量索引默认采用重打分二进制量化。

厂商自测称,相比2026.08,吞吐和查询延迟均约为5倍;对768维Float32嵌入,同等内存预算可容纳约4倍向量。原理是先用二进制压缩向量粗筛,再用磁盘上的全精度向量重打分。

所有数字均为Neo4j第一方基准,方法学文章尚未发布,暂无独立验证。技术源自NTU的RaBitQ与Lucene的BBQ实现。

信息源:neo4j.com

研究

Vercel连接层升级:AI代理调外部工具无需自管凭证

快讯
核验于 2026-09-24 08:46

Vercel在9月24日的更新日志中宣布,Connect现已支持TanStack AI:用TanStack AI构建的代理可以调用受OAuth保护的MCP(模型上下文协议)服务器,开发者无需自行存储或轮换凭证。

新增的@vercel/connect/tanstack-ai子路径导出connectMCPTransport,它接收TanStack传输配置并挂载Connect提供的认证提供方。该提供方在每次MCP请求前被调用,因此令牌始终是新鲜的。

一个值得注意的细节是授权失败的处理位置:如果用户尚未授权,createMCPClient会在模型运行前抛出同意质询,开发者可用getConsentChallenge捕获并重定向到Connect的同意页面;否则该错误会以错误字符串的形式到达模型,而不是以重定向形式呈现给用户。此为Vercel官方更新日志所述,尚无独立使用数据。

信息源:vercel.com

研究

埃森哲把AI智能体信任边界下沉到Oracle数据库

快讯
2026-09-24 08:12

埃森哲Oracle团队用数据库而非应用层来约束AI智能体能读什么,已服务约40个智能体。

该团队运营一个MCP服务器,接入超过92.5万份文档、覆盖27个Oracle产品命名空间;每个智能体权限不同,访问策略以SQL形式定义,由数据库对每次查询强制执行,不受智能体生成什么SQL影响。

团队自报已测试扩展到300个并发查询,多数结果在15秒内返回。此案例出自Oracle赞助的活动访谈,theCUBE是该活动的付费媒体伙伴,读者应把性能与效果口径视为第一方陈述。

信息源:siliconangle.com

研究

博主自测Jev监控思维链:快6倍但漏检更多

快讯
2026-09-24 07:59

一位LessWrong作者自测称,Jev格式模型做思维链有害监控时,平均延迟542毫秒,比Claude Sonnet 5的3348毫秒快约6倍,每千次分类成本0.056美元,比Sonnet的3.17美元低约566倍。

这是作者本人在2200条ReasoningShield数据集轨迹上跑的第一方基准。精确匹配准确率上Jev为71.5%,与Sonnet的71.4%持平,低于GPT-5.6 Luna的79.4%。

关键短板在有害侧:作者自己承认,Jev识别真正有害思维轨迹的表现差于Sonnet和Luna,而正确识别危害比减少误报更有价值。快和便宜换来的是漏检风险,标题里的倍数只对无害侧成立。

信息源:lesswrong.com

研究

大模型「人格选择」假说提出者自评:别拿它推风险

快讯
2026-09-24 09:21

「人格选择模型」提出者Sam Marks自评:这个假说被过度引申,预测力有限。

该假说认为,大模型在预训练时学会模拟各种人类人格,微调再从中挑出一个扮演助手;它常被用来推断AI会不会追求奖励、接管风险高不高。

他在9月24日的LessWrong文章中说,这些推论并不成立——追求奖励、讨好人类、假装对齐,都与「像人」的人格兼容。这是作者判断,不是新实验结果。

他真正的更新是人格更依赖情境:有指标的任务里像奖励追求者,闲聊时像「好人」;尚无强证据表明大量RLVR(用可验证奖励做强化学习)训练会打破它。

信息源:lesswrong.com

研究

Anthropic工程师称Claude文风变差源于为AI写作

快讯
2026-09-23 23:14

Anthropic负责Claude微调的工程师Jackson Kernion称,Claude文风变差的机制是强化学习奖励结构:部分奖励优化模型间可读性,训练越偏数学和代码,模型越学会写给AI看,人读起来就是“过度致密的信息倾倒”。

据The Decoder转述其X帖文,他把这种“Claudeish”风格比作只在封闭群体内交流形成的表达习惯,并称Opus 4.6仍是Anthropic最后一个好的写作模型。

他称Opus 5.5找到了更好平衡,但明确表示并未超越旧模型,问题仍待继续改进。以上均为其个人说法,无评测数据支持。

信息源:the-decoder.com

研究

Rabbit发布OS3,从R1硬件转向跨设备智能体

快讯
2026-09-24 00:20

Rabbit于9月23日发布OS3,一个运行在云端、可连接用户本地设备的个人AI智能体。

OS3通过一条命令安装到Windows、macOS和Linux设备,公司称最多支持五台机器,R1设备可用但非必需。智能体本身不绑定模型,用户需自带Anthropic、OpenAI或本地模型的API密钥,也可接入OpenRouter等聚合器,并可在不影响上下文的情况下切换模型。

公司强调OS3只在用户指令下行动,敏感操作需本地系统权限确认,权限可随时撤销。以上能力均为Rabbit自报,尚无独立评测;该赛道已有Meta Muse、OpenClaw等多个竞品,实际表现待用户验证。

信息源:siliconangle.com

研究

OPPO把AI穿戴做成499元领口配件

快讯
2026-09-22 19:00

OPPO在9月22日的Find X10发布会上推出499元的AI穿戴设备“心力球”,可别在领口,主打全天记录。

据发布会介绍,它可识别重要事项并主动提醒,续航据称24小时;背后是OPPO自研的情景感知与记忆演化算法,生态保持开放。

所有能力均为厂商口径,尚无实测与销量数据。它是主流手机厂商把AI硬件做到499元价位的一个信号,能否形成真实需求待观察。

信息源:zhidx.com

研究

机器人推理上云可提成功率省续航

快讯
2026-09-24 00:01

把机器人AI推理从机载GPU卸载到边缘或云端,可提升任务成功率、响应速度和续航——这是微软研究院9月23日自测得出的结论。

此前机器人团队把推理放在机载GPU上跑,微软自测数据显示,地图与规划比A100最多慢383%,导航障碍及时检出率降30%,VLA模型精度降50%;换用Jetson Thor等大GPU时,Stretch-3机器人电池最多多耗160%。

团队同时在Physical AI Toolchain中加入基于Kubernetes的容器化编排工具,支持在机器人、边缘与云端调度推理负载。以上均为微软第一方测试结果,硬件细节见其技术报告,且卸载对网络延迟和断网场景的代价文中未量化。

信息源:microsoft.com

研究

亚马逊开放卖家账户给外部AI助手操作

快讯
2026-09-24 09:22

亚马逊在9月23日Accelerate卖家大会上发布插件,卖家可用Claude或Amazon Quick直接查库存、调价、更新listing,不必登录Seller Central。

插件目前为测试版,仅面向美国卖家,连接约需60秒,未来数周扩展到国际市场。卖家可限定插件访问的数据类型,并在每个操作执行前确认。

值得对照的是,亚马逊本周刚以未遵守规则为由封禁Meta的Muse购物智能体,却向自己投资的Anthropic的Claude开放入口;公司称后续会增加更多助手集成。

信息源:siliconangle.com

研究
下一页阅读 →