11 · 08强化学习最重要的是学会给机器人奖励
🔊 全文章节朗读
AI3.008强化学习最重要的是学会给机器人奖励
第八章,强化学习,最重要的是学会给机器人奖励。本章讲解让AlphaGo名声大噪的幕后方法:强化学习。作者从驯兽师的秘诀说起,奖励正确行为,忽略错误行为,记者萨瑟兰甚至用这招训练丈夫收拾袜子,这就是心理学上的操作性条件反射。与监督学习不同,强化学习不需要标注样本,智能体在环境中执行动作,偶尔获得奖励,这是它唯一的反馈。作者用机器狗罗茜学踢球的例子详细说明Q学习:罗茜随机尝试,直到偶然踢到球得到十分奖励,再把这种状态和动作的值记进Q表,逐层回传,最终学会从任何位置踢球,作者模拟实验用了大约三百个片段。现实中也有两大绊脚石:真实任务的状态无法罗列成表格,所以改用神经网络;真机训练太慢太危险,只能在模拟世界学习。章末指出,环境越复杂,模拟技能越难迁移到现实,因此强化学习最大的成功不在机器人领域,而在能完美模拟的游戏领域。
自动同步自湛庐有声书管线 · HedgeDoc 原页