在OpenRLHF框架中实现了GRPO(组相对策略优化)训练器,复现了DeepSeek-R1的核心对齐算法,无需单独训练奖励模型。

Stars

99

7 天增长

暂无数据

Fork 数

0

开放 Issue

0

开源协议

暂无数据

最近更新

2026-07-15

AI 仓库情报摘要
FR-AI / ANALYSIS

为什么值得关注

它将DeepSeek-R1的GRPO引入OpenRLHF生态,带来了可量化的改进:GPU显存减少35%,训练速度提升1.8倍,AlpacaEval胜率达96.2%,使RLHF更加高效。

适合谁使用

  • 研究新型RLHF算法的学者
  • 寻找比PPO更省显存和时间的实践者
  • 希望复现DeepSeek-R1训练流程的开发者

典型使用场景

  • 使用组相对优势估计对齐大语言模型
  • 在有限GPU资源下运行RLHF训练
  • 快速实验不同group size和KL惩罚系数
  • 在具体任务上对比GRPO与PPO的效果

项目优势

  • 无需奖励模型,简化流程并降低计算开销
  • 相比PPO减少35%的GPU显存占用
  • 整体训练速度提升1.8倍
  • 在AlpacaEval 2.0上达到96.2%胜率,接近PPO的100%

使用前须知

  • AlpacaEval胜率略低于PPO(96.2% vs 100%)
  • 实现依赖于OpenRLHF框架,独立复用性有限
  • 不同模型和数据集上的性能可能有所差异(README未覆盖)

README 快速开始

快速开始

项目描述

GRPO alignment algorithm trainer based on OpenRLHF

相关仓库与替代方案

根据分类、Topic 和编程语言匹配的相似项目。

lopopolo
精选
lopopolo GitHub avatar

harness-engineering

Harness Engineering is a methodology for improving coding agent outputs by carefully crafting the environment around them—providing curated context, tools, and executable constraints that encode an organization’s nonfunctional requirements and cumulative lessons.

AI 与机器学习AI 智能体
2,390
slvDev
精选
slvDev GitHub avatar

esp32-ai

A 28.9 million parameter language model runs on an $8 ESP32-S3 microcontroller entirely on-device, generating simple stories at about 9.5 tokens per second.

AI 与机器学习大语言模型
1,960
littledivy
精选
littledivy GitHub avatar

mimic

mimic captures traffic from any iOS or web app and automatically generates a Python client library that lets you call the app's API like a regular library.

AI 与机器学习
1,482