最近的文章
caffe 源码阅读笔记
·30 字·1 分钟
caffe做部署是YYDS!
blob
layer
net
激活函数
卷积
reshape
slice
loss function
reduce
eltwise
argmax
从 Q-Learning 到 Policy Gradient:为什么要直接学习策略?
·4692 字·10 分钟
上一篇走完了从 Q-Learning 到 DQN 的过程。用神经网络近似 Q-Function,输出各动作的 Q 值,取 argmax 选动作。加上 Experience Replay 和 Target Network,DQN 在 Atari 游戏上工作得很好。
继续跟 MIT 6.S191 Lecture 5 往下走,课程在讲完 DQN 之后,介绍了一种完全不同的思路——不学 Q-Function,直接学 Policy。
从 Value Iteration 到 Q-Learning:没有真实 Q 值,模型如何学会决策?
·7401 字·15 分钟
上一篇结尾留了一个问题:如果不知道环境的转移概率和 Reward 函数,应该怎么利用 Bellman Equation 学习策略?
那篇从 Policy Iteration 走到 Value Iteration,用 A/B 两状态的例子跑完了整个过程。最后得到了最优策略,A 选择前往 B,B 选择 \(b_1\),\(V^*(A) = 2.7\)。
从 Policy Improvement 到 Value Iteration:Bellman Equation 如何找到最优策略?
·6109 字·13 分钟
上一篇推完了 Bellman Equation。那篇最后写了一句:Bellman Equation 是一个递归关系,不是一种算法——Value Iteration 和 Policy Iteration 才是利用它求解的具体方法。
当时没有展开。这一篇接着走。
理解 Bellman Equation:从条件期望到概率 DP
·5075 字·11 分钟
上一篇结尾用全期望公式把 \(V^\pi(s)\) 按"下一个 State"分组展开了。Markov Property 那篇讨论了为什么 Bellman Equation 需要 Markov Property 作为前提。
数学工具准备齐了,我打算正式跟一遍 Bellman Equation 的推导。
从条件概率到贝叶斯定理:再理解全概率与全期望
·6128 字·13 分钟
起因 # 上一篇讨论了 Markov Property,提到 Bellman Equation 需要它作为前提。
准备看 Bellman Equation 的推导时,我卡在了一个叫 Law of Total Expectation(全期望公式)的地方。它的核心思想是:计算整体期望时,可以先按某个变量的不同取值分组,分别算各组的条件期望,再按组别的概率加权平均。之前那篇定义的 State Value \(V^\pi(s) = \mathbb{E}_\pi[G_t \mid S_t = s]\),在 Bellman Equation 里正是用这个思路按"下一个 State"分组来展开。
从马尔可夫性质出发:DP 无后效性、HMM 与 VAE 的知识联想
起因 # 继续跟着 MIT 6.S191 Lecture 5 学强化学习。上一篇理解了 Return、State Value Function \(V^\pi(s)\) 和 Action Value Function \(Q^\pi(s,a)\)。
从 Return 到 Q-Function:强化学习如何评价一个尚未发生的决策
·10320 字·21 分钟
上一篇结尾留了一个问题:
如果一个动作的长期回报要等到几十步甚至更多步之后才能知道,那 Agent 在当前状态下,如何判断不同动作的长期价值?
Return 可以衡量一条轨迹的累计收益。但做决策的时候,未来还没有发生——不存在一条可以直接计算的轨迹。那在当前时刻,怎么评价一个 State 甚至一个具体 Action 的长期价值?
从监督学习到强化学习:没有 Label,模型如何学会决策?
·7538 字·16 分钟
起因 # 最近开始看 MIT 6.S191 的 Lecture 5——Deep Reinforcement Learning。
过去几个月写了不少笔记,从 RNN 到 Transformer,从 VAE 到 GAN,基本都属于 supervised 或 self-supervised 的范畴。之前梳理训练信号来源的那篇,整理了四种学习范式——supervised、unsupervised、semi-supervised、self-supervised——的核心区别在于训练信号是谁提供的。