RL实验室
iOS app by 成林 严. Education · 成林 严
- Store rating
- 0 / 5
- Store rating count
- 0
- Download price
- Free to download
- In-app purchases
- Unknown
- Version
- 1.0.1
- Listing last refreshed
- 2026-09-09
View the original store listing
Store description excerpt
从 Bellman 方程、动态规划、Monte Carlo、TD Learning,到 Q-Learning、PPO、MAPPO、QMIX、MCTS 与 AlphaZero,复杂的强化学习概念被重新拆解为可以观察、操作和理解的动态过程。 你可以看到价值函数如何更新,策略如何变化,智能体如何选择动作;也可以调整关键参数,逐步观察算法内部发生了什么。 看见算法如何运行 在网格世界中观察价值传播与策略变化,通过单步执行理解 Q-Learning、Sarsa、Value Iteration 等算法的更新过程。 不再只是阅读公式,而是直接看到每一次状态变化、价值更新和决策结果。 拆解复杂算法流程 PPO 为什么需要 GAE? Probability Ratio 如何产生? Clip 到底限制了什么? COMA 的反事实基线如何计算? 算法流程检查器将复杂算法拆分为清晰的计算阶段,并同步展示公式、变量、中间结果与关键指标。 理解多智能体强化学习 观察多个智能体在共享环境中的行为,理解局部观测、联合动作、集中式 Critic、通信、信用分配以及 CTDE 等核心思想。 从 Independent Q-Learning 到 MAPPO,逐步理解多智能体算法之间真正的区别。 从博弈论理解策略 通过收益矩阵与策略空间探索 Best Response、Nash Equilibrium、Minimax、Correlated Equilibrium、Regret Matching 等概念。 观察策略如何变化,以及均衡是如何形成的。 看懂神经网络与价值分解 通过可交互网络结构理解 Dueling Network、VDN、QMIX、QTRAN 等方法。 观察个体价值如何组合成团队价值,理解网络连接、Tensor 流动与价值分解约束。 探索搜索树与策略种群 一步步观察 MCTS 的选择、扩展、评估与回传过程,并进一步理解 Self-Play、AlphaZero、PSRO、Meta-Strategy 与 AlphaStar 等方法背后的核心思想。 不只是结果,更关注“为什么” RL Atlas 希望回答的不是: “这个算法最后得到多少 Reward?” 而是: “这个算法为什么这样更新?” “这个参数改变以后发生了什么?” “两个算法真正不同在哪里?” “这条公式在整个算法中到底起什么作用?” 通过公式、动画、参数、运行曲线、算法检查器与对比功能,把强化学习从抽象符号变成可以真正探索的系统。 无论你正在第一次学习强化学习,还是需要重新梳理 PPO、MARL、价值分解、博弈学习与搜索算法,RL Atlas 都希望成为一本可以亲手操作的强化学习图谱。 从状态,到动作;从反馈,到策略。 让算法真正看得见。
Review coverage
AppRill has captured 0 reviews for this app. This is a collected sample, separate from the store rating count. Latest review capture: Not captured yet.
Recent captured chart positions
No chart positions have been captured for this app yet.
Chart position, rating count and review coverage do not establish downloads, revenue or profit. Understand the differences.