SEED 是一种自演化在策略蒸馏框架,用于长周期 LLM 智能体,通过让同一个策略检查点同时扮演行动者和分析者,收集轨迹、提取事后技能并在强化学习中将技能引起的动作概率变化蒸馏回自身。

Stars

198

7 天增长

暂无数据

Fork 数

7

开放 Issue

1

开源协议

MIT

最近更新

2026-07-17

AI 仓库情报摘要
FR-AI / ANALYSIS

为什么值得关注

它提出了策略与事后监督共同演化的新范式,在无需外部技能库或推理时检索的情况下,从稀疏的奖励信号中实现密集的令牌级监督。

适合谁使用

  • 从事 LLM 智能体强化学习的研究人员
  • 构建长周期自主智能体系统的工程师
  • 对自我改进策略蒸馏感兴趣的 AI 从业者
  • 研究语言模型中技能习得的学者

典型使用场景

  • 训练智能体完成网络购物任务(WebShop)
  • 训练智能体完成交互式家务任务(ALFWorld)
  • 训练智能体完成基于搜索的开放域问答
  • 训练智能体完成 Sokoban 和 EZPoints 等游戏环境

项目优势

  • 通过将情节奖励转化为令牌级学习信号,一致优于仅基于结果的强化学习(GRPO)
  • 训练中内化的技能在推理时优于使用技能提示的方法
  • 自演化蒸馏使事后监督与策略不断变化的行为保持对齐,优于静态蒸馏
  • 在 ALFWorld、SearchQA 和 WebShop 三个多样化基准上展示了显著成果

使用前须知

  • 需要两阶段训练(SFT 加 RL)以及多个环境的特定安装(例如 WebShop 要求 Python 3.10)
  • 论文流程中初始事后技能标注依赖外部 LLM API(OpenAI)
  • 由于在策略蒸馏和同步轨迹分析,计算成本可能较高

README 快速开始

Installation

相关仓库与替代方案

根据分类、Topic 和编程语言匹配的相似项目。

lopopolo
精选
lopopolo GitHub avatar

harness-engineering

Harness Engineering is a methodology for improving coding agent outputs by carefully crafting the environment around them—providing curated context, tools, and executable constraints that encode an organization’s nonfunctional requirements and cumulative lessons.

AI 与机器学习AI 智能体
2,390
slvDev
精选
slvDev GitHub avatar

esp32-ai

A 28.9 million parameter language model runs on an $8 ESP32-S3 microcontroller entirely on-device, generating simple stories at about 9.5 tokens per second.

AI 与机器学习大语言模型
1,960
littledivy
精选
littledivy GitHub avatar

mimic

mimic captures traffic from any iOS or web app and automatically generates a Python client library that lets you call the app's API like a regular library.

AI 与机器学习
1,482