一个三阶段偏好训练框架(SFT → Final-Answer DPO → Trajectory DPO),教会大语言模型通过“生成草稿→自我批评→修正答案”实现自纠正能力。

Stars

4

7 天增长

暂无数据

Fork 数

0

开放 Issue

0

开源协议

暂无数据

最近更新

2026-07-30

AI 仓库情报摘要
FR-AI / ANALYSIS

为什么值得关注

它通过合成偏好对和显式的轨迹对齐,为LLM注入自纠正能力提供了清晰的流水线,并配有修正成功率、过度修正率等评测指标。

适合谁使用

  • 研究LLM自纠正与推理能力的NLP研究人员
  • 构建稳健数学推理系统的机器学习工程师
  • 应用DPO和SFT进行偏好对齐的实践者
  • 对自动化数据合成训练感兴趣的开发者

典型使用场景

  • 提升模型在数学题上的自我修正能力
  • 构建自动修正草稿答案的系统
  • 在原始草稿正确时减少过度修正的错误
  • 训练模型生成高质量批评意见和修正答案

项目优势

  • 提供完整的三阶段训练方案,附带现成的脚本与配置
  • 从GSM8K自动生成合成偏好对(包括修复和保持正确两类)
  • 支持QLoRA/LoRA高效训练,最低仅需16GB显存
  • 综合的评测体系,涵盖自纠正成功率、过度修正率及直接数学准确率

使用前须知

  • 合成数据主要来自GSM8K数学应用题,在其他领域的泛化性尚未验证
  • 训练流水线为多阶段,需要仔细调参并消耗GPU资源
  • 使用自定义数据集需要适配README中描述的中间数据格式

README 快速开始

安装 PyTorch(根据你的 CUDA 版本选择)

pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu121

相关仓库与替代方案

根据分类、Topic 和编程语言匹配的相似项目。

slvDev
精选
slvDev GitHub avatar

esp32-ai

A 28.9 million parameter language model runs on an $8 ESP32-S3 microcontroller entirely on-device, generating simple stories at about 9.5 tokens per second.

AI 与机器学习大语言模型
1,960
gavamedia
精选
gavamedia GitHub avatar

deltafin

Deltafin is a research project that runs the 2.8-trillion-parameter Mixture-of-Experts model Kimi K3 on a single Apple Silicon Mac (e.g., M1 Max with 64 GB) at about 16 seconds per token, using exact, reproducible inference with local or streaming expert loading.

AI 与机器学习大语言模型
304
jamesob
精选
jamesob GitHub avatar

local-llm

A comprehensive guide for building and configuring a high-end local machine to run state-of-the-art LLMs, with detailed hardware choices, BIOS tuning, and Docker-based model serving.

AI 与机器学习大语言模型
1,660