从 Value Iteration 到 Q-Learning:没有真实 Q 值,模型如何学会决策?Oct 11, 2026·7401 words·15 minsDeep-Learning RL Deep-Learning 6.S191上一篇结尾留了一个问题:如果不知道环境的转移概率和 Reward 函数,应该怎么利用 Bellman Equation 学习策略? 那篇从 Policy Iteration 走到 Value Iteration,用 A/B 两状态的例子跑完了整个过程。最后得到了最优策略,A 选择前往 B,B 选择 \(b_1\),\(V^*(A) = 2.7\)。