↓ Skip to main content
  1. Tags/

Policy-Gradient

2026

从 Q-Learning 到 Policy Gradient:为什么要直接学习策略?

·4692 words·10 mins
上一篇走完了从 Q-Learning 到 DQN 的过程。用神经网络近似 Q-Function,输出各动作的 Q 值,取 argmax 选动作。加上 Experience Replay 和 Target Network,DQN 在 Atari 游戏上工作得很好。 继续跟 MIT 6.S191 Lecture 5 往下走,课程在讲完 DQN 之后,介绍了一种完全不同的思路——不学 Q-Function,直接学 Policy。