<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>DQN on 111qqz的小窝</title><link>https://111qqz.com/tags/dqn/</link><description>Recent content in DQN on 111qqz的小窝</description><generator>Hugo -- gohugo.io</generator><language>zh-cn</language><managingEditor>hust.111qqz@gmail.com (111qqz)</managingEditor><webMaster>hust.111qqz@gmail.com (111qqz)</webMaster><copyright>© 2011-2026 111qqz</copyright><lastBuildDate>Sun, 11 Oct 2026 17:40:00 +0800</lastBuildDate><atom:link href="https://111qqz.com/tags/dqn/index.xml" rel="self" type="application/rss+xml"/><item><title>从 Q-Learning 到 Policy Gradient：为什么要直接学习策略？</title><link>https://111qqz.com/2026/10/q-learning-to-policy-gradient/</link><pubDate>Sun, 11 Oct 2026 17:40:00 +0800</pubDate><author>hust.111qqz@gmail.com (111qqz)</author><guid>https://111qqz.com/2026/10/q-learning-to-policy-gradient/</guid><description>&lt;p&gt;&lt;a href="https://111qqz.com/2026/10/value-iteration-to-q-learning-dqn/" &gt;上一篇&lt;/a&gt;走完了从 Q-Learning 到 DQN 的过程。用神经网络近似 Q-Function，输出各动作的 Q 值，取 argmax 选动作。加上 Experience Replay 和 Target Network，DQN 在 Atari 游戏上工作得很好。&lt;/p&gt;
&lt;p&gt;继续跟 MIT 6.S191 Lecture 5 往下走，课程在讲完 DQN 之后，介绍了一种完全不同的思路——不学 Q-Function，直接学 Policy。&lt;/p&gt;</description></item></channel></rss>