纳什解码让小模型赢过大模型
纳什解码让掩码语言模型在问答任务上超越参数量达18倍的自回归模型。
该预印本将文本修订建模为多人博弈,每个Token位置为玩家,目标是最大化联合概率下的纳什均衡。在CLAPNQ、PubMedQA和CoQA上,作者自测发现掩码模型(可并行预测所有位置)经纳什解码后F1和ROUGE分数高于自回归模型(逐词生成)中18倍大的模型,无需微调,但测试时计算量显著增加。尚无独立复现。
信息源:arxiv.org
纳什解码让掩码语言模型在问答任务上超越参数量达18倍的自回归模型。
该预印本将文本修订建模为多人博弈,每个Token位置为玩家,目标是最大化联合概率下的纳什均衡。在CLAPNQ、PubMedQA和CoQA上,作者自测发现掩码模型(可并行预测所有位置)经纳什解码后F1和ROUGE分数高于自回归模型(逐词生成)中18倍大的模型,无需微调,但测试时计算量显著增加。尚无独立复现。
信息源:arxiv.org
TechRadar报道,Adaptavist对英美等五国1000名开发者的调查显示,50%的人使用AI主要是为了向老板展示能力并消除其疑虑。
47%的受访者表示,他们被考核的标准是AI的使用频率而非工作质量,58%称AI使用已纳入绩效指标(KPI)。这种“表演性使用”导致54%的开发者担忧长期职业前景,37%害怕因不使用AI而失业。
Adaptavist DevOps负责人Matt Saunders指出,组织应停止衡量AI采纳率,转而关注实际成果,否则将引发人才外流。该数据反映了当前企业在AI落地过程中,管理手段与技术价值之间的错位。
信息源:techradar.com
谷歌Gmail应用最新APK拆解显示,其正在测试基于Gemini的智能体功能,旨在辅助或自动处理邮件回复。
代码中出现了“使用 Gemini”按钮及“起草回复”选项。当AI无法确定下一步操作时,会显示“需要你的输入”状态,要求用户提供具体信息。
值得注意的是,部分邮件在发送前仍需人工确认。这表明谷歌在推进自动化邮件处理的同时,保留了关键的用户监督环节。该发现源自Android Authority对v2026.09.28版本的逆向工程分析,尚未得到谷歌官方证实。
信息源:ithome.com
Clean优化器将二阶方法的内存复杂度从平方级降至线性级,并允许在单张80GB GPU上预训练13B参数模型。
传统二阶优化器(如SOAP)虽能加速收敛,但内存成本过高难以扩展。Clean利用随机Nyström方法近似预条件矩阵,保留了曲率信息的同时大幅压缩了状态占用。
作者自测显示,Clean达到AdamW最终性能的速度快26%;其低精度变体Q-Clean相比Muon优化器减少超过50%的内存消耗。该结果目前为预印本,尚未经过独立复现验证。
信息源:arxiv.org
谷歌于10月7日上线Playground,这是一款基于浏览器的AI游戏创作平台,用户可通过对话式界面输入提示词生成游戏,无需编程经验。
该平台目前仅向美国18岁以上用户开放,基础功能免费,但Google One订阅用户享有更高的每周Token限额。底层由Gemini、Nano Banana和Lyria模型驱动,支持物理调整、规则重写及角色定制,成品可分享或发布至探索画廊。
同日,谷歌与Unity宣布合作推出Unity Spark,定位为更接近专业开发流程的AI游戏引擎,支持多人协作创作。Spark将于今年晚些时候开启封闭测试,现已开放等待名单注册。此举旨在降低创作门槛,同时覆盖从休闲玩家到专业开发者的不同需求。
信息源:blog.google
长期信息 · 《AI and Compute》(2018)
《AI and Compute》是OpenAI在2018年发布的一份统计报告,看的是训练一个AI模型花了多少算力。它数了历史上各次模型训练的用量,发现算力需求长期按指数翻倍增长,而且好几次著名的能力突破,都紧跟在一次算力大跃升之后出现。
今天看到厂商说「我们堆了十倍算力,模型就变强了」,判断这话可不可信,用的就是这份报告立的框架:算力投入和能力提升之间确实有历史对应关系。后来的分析都是在它这套统计上更新数字,框架没被换掉。
如果某个领域的数据已经用尽或撞上物理上限,就别用它来判断——算力再翻倍也换不来同等提升。它本身是观察统计,不是定律,趋势随时可能被算法进步打断。
《AI and Compute》(2018)|下次复查 2027-09-20
信息源:openai.com
已读完当前范围的内容