强化学习

核心问题:智能体如何通过试错学习在环境中获得最大累积奖励?


📚 内容导航

名称说明链接
马尔可夫决策过程MDP、状态、动作、奖励、策略待补充
值函数方法Q-Learning、SARSA、DQN待补充
策略梯度方法REINFORCE、Actor-Critic、PPO待补充
多智能体学习协作、竞争、通信待补充

🔗 相关链接

主题链接
机器学习概览机器学习
监督学习监督学习
深度学习深度学习

0 items under this folder.