这是一个交互式 GridWorld 强化学习可视化调试器,通过 2x2 画布实时展示 Q-Learning、策略迭代和基础蒙特卡洛智能体的学习过程,包括热力图、策略箭头、奖励曲线和逐步解释。

Stars

4

7 天增长

暂无数据

Fork 数

0

开放 Issue

0

开源协议

暂无数据

最近更新

2026-07-31

AI 仓库情报摘要
FR-AI / ANALYSIS

为什么值得关注

它将 Q 表、TD 误差、策略迭代等抽象概念以可视化、可操作的方式呈现,并提供了可直接运行的 agent 和 TODO 模板,非常适合作为学习和实验的 RL 沙盒。

适合谁使用

  • 刚接触强化学习的学生
  • 需要交互式 RL 教学演示的教师或培训者
  • 希望实验 Q-Learning 或自定义 agent 的开发者
  • 对 GridWorld 算法感兴趣的爱好者

典型使用场景

  • 实时观察 Q 表如何随每一步训练发生变化
  • 在同一张地图上对比 Q-Learning、策略迭代和蒙特卡洛的行为
  • 通过修改指定的 agent 文件实现并测试 SARSA 等自定义算法
  • 教学或自学价值迭代、探索策略、TD 更新等强化学习概念

项目优势

  • 可视化界面丰富:状态价值热力图、贪心策略箭头、累计奖励曲线、步骤解释面板和格子 Q 值详情。
  • 提供多种可运行 agent(Q-Learning、策略迭代、基础蒙特卡洛)以及扩展用代码模板。
  • 支持暂停、单步、重置回合、重新生成地图、点击格子、键鼠实时调参等交互操作。
  • 地图类型和 agent 接口可配置,自定义算法只需遵循清晰的抽象类约定。

使用前须知

  • 除 Q-Learning 外,策略迭代和蒙特卡洛的模板需要自行补全 TODO,未提供完整的高级实现。
  • 基础蒙特卡洛 agent 只在回合结束时更新,单步过程中 Q after 可能暂时不变,容易让使用者困惑。
  • 这是一个基于 Matplotlib 的桌面可视化项目,并非完整的强化学习库或生产训练框架。

README 快速开始

安装与运行

相关仓库与替代方案

根据分类、Topic 和编程语言匹配的相似项目。

lopopolo
精选
lopopolo GitHub avatar

harness-engineering

Harness Engineering is a methodology for improving coding agent outputs by carefully crafting the environment around them—providing curated context, tools, and executable constraints that encode an organization’s nonfunctional requirements and cumulative lessons.

AI 与机器学习AI 智能体
2,390
slvDev
精选
slvDev GitHub avatar

esp32-ai

A 28.9 million parameter language model runs on an $8 ESP32-S3 microcontroller entirely on-device, generating simple stories at about 9.5 tokens per second.

AI 与机器学习大语言模型
1,960
littledivy
精选
littledivy GitHub avatar

mimic

mimic captures traffic from any iOS or web app and automatically generates a Python client library that lets you call the app's API like a regular library.

AI 与机器学习
1,482