robot_futuring_rl 是一个面向真实机器人闭环学习的开源全栈系统,基于 OpenPI 的 π 系列模型,并补充了 VLA 微调、三态进展标注、RL Token 两阶段训练、PICO 遥操作和 HIL 纠错数据采集。

Stars

28

7 天增长

暂无数据

Fork 数

4

开放 Issue

0

开源协议

Apache-2.0

最近更新

2026-07-31

AI 仓库情报摘要
FR-AI / ANALYSIS

为什么值得关注

它把从机器人数据采集、人工纠错标注、优势加权训练到在线策略部署的完整闭环工程链路组织成相互隔离的模块,模型、训练器、标注平台、ROS2 遥操作和机器人协议适配层均可独立使用。

适合谁使用

  • 从事 VLA 训练和真机部署的机器人研究人员与工程师
  • 使用进展/奖励信号进行模仿学习或强化学习的研究者
  • 构建人机回环数据采集与遥操作管线的开发者
  • 需要为新机械臂或移动操作机器人接入训练系统的团队

典型使用场景

  • 微调或部署 π₀ / π₀-FAST / π₀.₅ 等 VLA 策略
  • 使用 -1/0/1/2 三态进展标注为机器人片段生成奖励
  • 通过 HIL PICO WebUI 按 LeRobot v2.1 格式纠错采集数据
  • 训练并部署 RL Token Stage 2 actor,结合 replay 与 TD3+BC 进行推理

项目优势

  • 模块隔离设计:模型训练、标注平台、PICO bridge 和机器人协议适配可独立使用
  • 基于 YAML 的机器人配置将状态/动作维度、ROS topic、相机和推理频率与核心代码解耦
  • 三态标注平台带 ready 数据校验规则和固定 reward 映射,支持多相机 episode 标注
  • RL Token Stage 2 的 cache/replay 流程绑定配置、标签和 checkpoint 哈希,防止不一致复用

使用前须知

  • 仓库不分发训练数据、模型 checkpoint 或 XRoboToolkit SDK/PC Service 二进制
  • PICO 和 HIL 真机运行依赖 ROS2、机器人消息包、相机 topic、模式服务及机器人侧安全控制器
  • 配置层软限位不能替代机器人安全控制器

README 快速开始

安装

相关仓库与替代方案

根据分类、Topic 和编程语言匹配的相似项目。

slvDev
精选
slvDev GitHub avatar

esp32-ai

A 28.9 million parameter language model runs on an $8 ESP32-S3 microcontroller entirely on-device, generating simple stories at about 9.5 tokens per second.

AI 与机器学习大语言模型
1,960
gavamedia
精选
gavamedia GitHub avatar

deltafin

Deltafin is a research project that runs the 2.8-trillion-parameter Mixture-of-Experts model Kimi K3 on a single Apple Silicon Mac (e.g., M1 Max with 64 GB) at about 16 seconds per token, using exact, reproducible inference with local or streaming expert loading.

AI 与机器学习大语言模型
304
jamesob
精选
jamesob GitHub avatar

local-llm

A comprehensive guide for building and configuring a high-end local machine to run state-of-the-art LLMs, with detailed hardware choices, BIOS tuning, and Docker-based model serving.

AI 与机器学习大语言模型
1,660