长期信息1 分钟阅读·
靠试错学动作的机器,打分会系统性虚高
让机器靠试错学会连续动作——油门打多大、关节转多少——这类做法叫强化学习。
重要性实质性证据E3 可检验写法快讯
让机器靠试错学会连续动作——油门打多大、关节转多少——这类做法叫强化学习。机器要一路维护一个估计:照现在的走法能得多少分。2018年的论文TD3发现这个估计会往高处偏,机器追着虚高分走;修法是养两套独立打分、只信较低者,并放慢换走法。
今天机器人学走路、抓东西的演示,背后常常还是这套试错学习,打分虚高的毛病也就还在。TD3的「两套打分取较低」没被后来的新方法绕开,反而成了主流算法的标配。凡是靠估分来选动作的系统,都该问一句:虚高防住了吗。
如果动作是离散的——选左还是选右,而不是打多少度——就别用它来判断;它的验证全在仿真机器人任务上,别把成绩直接外推到真机器人或别的任务。而且压低打分有代价:真实的好机会也会被一并压低,高估只是换成了低估。
《Addressing Function Approximation Error in Actor-Critic Methods》(2018)|下次复查 2027-09-20