31、【加课】强化学习【新增】
文件信息
文件名称
31、【加课】强化学习【新增】
文件大小
2.55 GB
文件状态
有效
存储位置
夸克网盘
分享者
标致*孔雀
📁 31、【加课】强化学习【新增】资源包内容详情 (2.55 GB)
31、【加课】强化学习【新增】 - 文件信息
- 包含文件:章节1:Q-Learning与SARSA算法
- 章节2:DeepQ-LearningNetwork
- 章节3:PolicyGradient策略梯度
- 章节4:ActorCritic(A3C)
- 章节5:DDPG
- PPO
- DPPO算法
- 1:强化学习通过智能体与环境交互进行学习.mp4
- 2:引入马尔科夫链和价值评估的Q值与V值.mp4
- 3:详解Q值和V值以及它们之间关系.mp4
- 4:蒙特卡洛采样回溯计算V值.mp4
- 5:蒙特卡洛和时序差分估算状态V值.mp4
- 6:SARSA算法和Q-learning算法.mp4
- 7:理解Q-table_创建maze交互环境.mp4
- 8:代码实战Q-Learning_Agent和Env整体交互.mp4
- 9:代码实战Q-Learning智能体选择行为.mp4
- 10:代码实战Q-Learning智能体训练模型.mp4
- 11:代码实战Sarsa_Agent和Env整体交互.mp4
- 12:代码实战Sarsa_Agent选择行为和训练模型.mp4
- 13:代码实战SarsaLambda_训练模型.mp4
- 14:DQN算法思想.mp4
- 15:DQN算法具体流程.mp4
- 16:ε-greedy_ReplayBuffer_FixedQ-targets.mp4
- 17:代码实战DQN_Agent和Env整体交互.mp4
- 18:代码实战DQN_构建Q网络.mp4
- 19:代码实战DQN_定义损失函数_构建Target网络更新逻辑.mp4
- 20:代码实战DQN_训练阶段得到Q网络的预测值和真实值.mp4
- 21:代码实战DQN_训练阶段最小化损失_记录loss方便展示_随着learn的越多选择action随机性减小.mp4
- 22:DQN会over-estimate的本质原因.mp4
- 23:DoubleDQN缓解over-estimate.mp4
- 24:DoubleDQN代码实战.mp4
- 25:DuelingDQN.mp4
- 26:困难样本挖掘_Multi-step_NoiseyNet系统的探索.mp4
- 27:计算Action的方差避免风险.mp4
- 28:Rainbow_DQN如何计算连续型的Actions.mp4