LYiHub GitHub avatar

QWOP_rl_training_public

LYiHub

一个结合QWOP物理模拟环境与PPO强化学习框架的项目,用于训练智能体完成100米、110米跨栏和跳远,并支持导出回放上传排行榜。

Stars

151

7 天增长

+53

Fork 数

27

开放 Issue

0

开源协议

Apache-2.0

最近更新

2026-07-21

AI 仓库情报摘要
FR-AI / ANALYSIS

为什么值得关注

它为极具挑战性的QWOP游戏提供了从训练到排行榜提交的完整开源流程,包含预编译物理引擎、多环境API以及RND探索奖励。

适合谁使用

  • 强化学习研究人员(需要非平凡连续控制基准)
  • 游戏AI爱好者(希望训练QWOP智能体)
  • 排行榜参赛者(想提交训练模型)
  • 学习PPO和策略蒸馏的开发者

典型使用场景

  • 使用PPO训练智能体完成QWOP的100米跑、110米跨栏或跳远
  • 导出确定性或最佳记录回放文件用于排行榜提交
  • 实验奖励函数和超参数(如RND、帧堆叠)以提升智能体性能
  • 将大型教师策略蒸馏为小型学生模型以加快评估速度

项目优势

  • 预编译的Windows物理DLL确保训练和排行榜使用一致的模拟
  • 通过pybind11支持单环境和批量环境,提高训练效率
  • 包含完整的PPO实现,可配置参数、RND探索和TensorBoard日志
  • 提供策略蒸馏脚本,支持模型压缩和潜在加速

使用前须知

  • 仅支持64位Windows(因预编译物理DLL和构建依赖)
  • 默认PyTorch安装需要CUDA兼容GPU;纯CPU训练可能较慢
  • 物理后端采用单独二进制许可,限制重新分发的灵活性

README 快速开始

安装

项目描述

跑步游戏强化学习训练框架

相关仓库与替代方案

根据分类、Topic 和编程语言匹配的相似项目。

lopopolo
精选
lopopolo GitHub avatar

harness-engineering

Harness Engineering is a methodology for improving coding agent outputs by carefully crafting the environment around them—providing curated context, tools, and executable constraints that encode an organization’s nonfunctional requirements and cumulative lessons.

AI 与机器学习AI 智能体
2,390
slvDev
精选
slvDev GitHub avatar

esp32-ai

A 28.9 million parameter language model runs on an $8 ESP32-S3 microcontroller entirely on-device, generating simple stories at about 9.5 tokens per second.

AI 与机器学习大语言模型
1,960
littledivy
精选
littledivy GitHub avatar

mimic

mimic captures traffic from any iOS or web app and automatically generates a Python client library that lets you call the app's API like a regular library.

AI 与机器学习
1,482