Antidoom 是一个专用工具,通过最终令牌偏好优化(FTPO)生成偏好数据并训练 LoRA 适配器,以减少语言模型生成中的重复循环(doom loops)。

Stars

334

7 天增长

暂无数据

Fork 数

31

开放 Issue

0

开源协议

Apache-2.0

最近更新

2026-07-07

AI 仓库情报摘要
FR-AI / ANALYSIS

为什么值得关注

它针对 LLM 推理中一种常见且具体的失败模式——重复循环——采用了一种高效的方法,该方法改编自经过验证的偏好优化方法(Antislop),并提供了详细的超参数指南以及包括 AMD ROCm 在内的多 GPU 支持。

适合谁使用

  • 从事 LLM 重复和推理问题的研究人员与工程师
  • 推理类语言模型(如 LFM 系列)的开发者
  • 使用 LoRA 微调模型并需要修复输出循环的 ML 实践者
  • 拥有 AMD GPU 并需要经过验证的 ROCm 工作流的用户

典型使用场景

  • 减少长链式思考或推理生成中的 doom 循环
  • 针对小型推理模型(如 1.2B)的生产级微调
  • 自动创建用于偏好式重复抑制的数据集
  • 调试和分析模型生成中的重复模式

项目优势

  • 聚焦于特定失败模式,精准攻击循环起始令牌而非完整答案
  • 基于已发表研究(Antislop)且实现可复现
  • 全面的生成、正则化和训练超参数配置
  • 经过验证的 ROCm 支持,提供具体的 AMD 故障排除和配置文件

使用前须知

  • 仅针对一种失败模式(重复循环),不解决通用输出质量或安全性问题
  • 需要高端 GPU 硬件(NVIDIA/CUDA 或 AMD MI 系列)及足够的显存
  • 若超参数(学习率、最大训练样本数)未仔细调整,训练极易过拟合

README 快速开始

Quick Start

相关仓库与替代方案

根据分类、Topic 和编程语言匹配的相似项目。

lopopolo
精选
lopopolo GitHub avatar

harness-engineering

Harness Engineering is a methodology for improving coding agent outputs by carefully crafting the environment around them—providing curated context, tools, and executable constraints that encode an organization’s nonfunctional requirements and cumulative lessons.

AI 与机器学习AI 智能体
2,390
slvDev
精选
slvDev GitHub avatar

esp32-ai

A 28.9 million parameter language model runs on an $8 ESP32-S3 microcontroller entirely on-device, generating simple stories at about 9.5 tokens per second.

AI 与机器学习大语言模型
1,960
littledivy
精选
littledivy GitHub avatar

mimic

mimic captures traffic from any iOS or web app and automatically generates a Python client library that lets you call the app's API like a regular library.

AI 与机器学习
1,482