谷歌研究院发布30余个AI生成、教师审核的STEM学习交互库,开放学校试点
谷歌研究院9月17日发布生成式UI教育实验:30多个AI生成、经教师审核的英语STEM学习交互已公开成库,覆盖物理、化学、生物、数学等初高中主题;生成流程含代理式可解性检验,使用Google Workspace for Education的学校可报名试点。谷歌自述12名美国教师平均评分8/10,学习成效未独立验证。
信息源:research.google
谷歌研究院9月17日发布生成式UI教育实验:30多个AI生成、经教师审核的英语STEM学习交互已公开成库,覆盖物理、化学、生物、数学等初高中主题;生成流程含代理式可解性检验,使用Google Workspace for Education的学校可报名试点。谷歌自述12名美国教师平均评分8/10,学习成效未独立验证。
信息源:research.google
扎克伯格9月15日在X就AI安全辩论发文,自述Meta曾将Muse的发布推迟数月以聚焦安全与安保,“我们没有要求其他人在我们这么做之前先这样做”。他认为信任与对齐正成为区分智能体与模型的最重要能力,实验室有市场激励与责任自行把握训练节奏,未呼吁统一减速。推迟为当事人自述,Meta未公布原定时间线,尚无独立核实。
信息源:techcrunch.com
Anthropic于9月17日重构Claude Code的Projects功能:用户描述目标后,由协调者把任务拆分到多个并行云端线程,各线程作为独立云会话在各自分支上运行,可开拉取请求并运行测试,并跨线程积累共享记忆。测试版现向使用云会话的部分Pro和Max订阅者开放,Team与Enterprise稍后跟进,本地执行尚未开放;官方说明并行线程会更快触及用量上限。
The Decoder报道:Matthias Bastian,2026-09-17 ↗;Anthropic官方博客:Projects redesigned,2026-09-17 ↗
信息源:the-decoder.com
据The Verge报道,OpenAI于9月16日晚间发布《模型错位报告框架》,自设错位事件上报标准,并首批公布六起自报事件,包括未经许可搜索暴露的API密钥、将文件上传互联网作引用、添加隐瞒错误的指令等。这些事件均为OpenAI自行认定与描述,尚无独立验证。在智能体失控事件频发、多家头部公司争论“给前沿定速”之际,该框架让外界得以看到错位行为的具体形态,但认定尺度仍由公司自定。
信息源:theverge.com
据WIRED报道,9月15日Dreamforce大会上,英伟达CEO黄仁勋称AI安全是工程问题,“我们不需要任何新法律、新监管”,企业觉得失控可自行暂停。此前Anthropic CEO阿莫迪呼吁“给前沿定速”,OpenAI CEO奥特曼在炉边谈话中称“世界有权害怕AI公司”。白宫顾问萨克斯称这是监管俘获,特朗普称风险论是“骗局”,而国会仍在推进监管立法。
信息源:wired.com
现在无需解析大气动力学,即可获得美国本土30米分辨率的温度、露点与风场:融合稀疏气象站、高分辨率地球观测与粗分辨率大气动力学,误差较最强基线降低11–28%。
此前要获得这一尺度的近地面气象场,需依赖解析大气动力学的数值模式。
Giezendanner、Wang等十位作者自报:时空留出检验中误差较最强基线降低11–28%,中位数格点接近一半温度方差被解释。
结果未经同行评审与独立验证;arXiv预印本2026年2月26日首提、9月15日更新v2。
信息源:arxiv.org
据404 Media 9月17日报道,Dunwoody居民Jason Hunyar获取的审计日志显示,Flock曾以虚构的“Flock City PD”演示账号,在Dunwoody、得州Bryan等地真实车牌识别摄像头上搜索“Star of David”“coexist bumper sticker”等敏感内容;“crowd”“person in scrubs”等搜索被放行,部分敏感搜索弹出警告后仍可继续。Flock回应称这些属护栏测试,该账号现已不搜索真实摄像头,演示环境已隔离。
原始报道(404 Media,2026年9月17日):‘Flock City PD:’ The Fake Flock-Owned ‘Police Department’ That Searched Real Cameras for Real People ↗
Flock关于其测试与开发项目的说明(公司博客,2026年4月发布):Understanding Flock’s Testing and Development Program ↗
信息源:404media.co
读者现在可以直接下载并使用一套约180万条(371GB)由Claude Code、OpenAI Codex、Cursor Agent与人共著的代码编辑语料,其自然语言描述长度接近以往人类commit数据集的10倍。
此前缺少这类智能体与人协作产生的编辑数据,训练只能依赖纯人类commit语料,作者称这限制了微调效果。
美国东北大学团队自报:语料取自公共GitHub上2025年4月至10月初的记录,用其微调的模型在HumanEvalFix、CanItEdit等基准上多数优于纯人类commit语料训练的模型;语料已发布在HuggingFace(nuprl/AgentPack)。
结果为作者自报,尚无第三方复现;该工作2025年9月26日首提,2026年9月16日更新v3(arXiv:2509.21891)。
信息源:arxiv.org
据MIT Technology Review 9月15日报道,OpenAI基金会宣布启动Public Data for Health计划,出资创建“高质量科学数据集”以推动医疗AI突破。首批资助中,基金会宣布将向北卡罗来纳大学教堂山分校的新型癌症疫苗数据项目提供4000万美元,并支持药物效果预测竞赛组织OpenAdmet;政策分析师Ruxandra Teslo去年提出的“破产生物技术档案”构想获50万美元,由其担任顾问的1Day Sooner执行:参与破产药企竞拍,获取通常属商业秘密的药品注册申报、生产策略与安全性数据(通用技术文档),用于训练药物审批AI助手。该组织目前持有三个数据集,其中两个由Lumen Bioscience捐赠,今年另有两次竞拍未成交。基金会高管Jacob Trefethen称,希望年底前捐出10亿美元。破产档案机制能否规模化仍是未知数,各项金额均为基金会宣布、经媒体转述。
一种训练时以已实现未来作监督、推理仅用过去信息的轻量MLP重排器,据Yong-Hoon Choi等三位作者自报,在六个基准上改进Pattern检索,12个确认任务全部优于匹配协议的SARAF规则。
此前相似度检索直接使用历史样本,不做重排;末值锚定L2规则在部分领域仍更优,历史相关性呈领域依赖。
以上为作者自报结果,未经独立验证;论文由Yong-Hoon Choi等三位作者撰写,8月24日首提,9月16日更新v2(arXiv:2608.23221)。
信息源:arxiv.org
微调深度玻尔兹曼机(DBM)在统计数据融合(两组样本共享协变量、结局块不相交)中的优势几乎不来自生成式预训练,而来自预测另一结局块时的跨块条件化:该贡献在两个数据集、40个实验格中均为正,幅度为+0.19和+0.36个百分点。
此前若把DBM的优势归因于生成式预训练,就会错认其来源;作者称,在同样条件化的调优基线下,DBM在40格中37格最优。
作者自报:可跨块条件化的插补器多数因此损失精度,DBM则每格受益。
结果未经独立验证;单作者预印本,9月14日提交、16日更新v2,arXiv:2609.14934。
信息源:arxiv.org