OSAC-Bench 是一个公开预览基准,用于评估操作系统代理在持续状态诊断、受限工具使用和可问责协作方面的能力,包含两个轨道(各五项任务)。

Stars

6

7 天增长

暂无数据

Fork 数

0

开放 Issue

0

开源协议

NOASSERTION

最近更新

2026-07-29

AI 仓库情报摘要
FR-AI / ANALYSIS

为什么值得关注

它引入了结构化的协作模型(意图所有者、证据工作者、独立验证者)和确定性检查机制,用于评估 OS 代理的記憶复用和过时事实拒绝,填补了 OS 代理可重复评估的空白。

适合谁使用

  • OS 代理的研究人员和开发者
  • 研究工具使用和记忆基准的学术研究者
  • 构建基于 Linux 自动化代理的开源社区
  • 设计代理评估框架的工程师

典型使用场景

  • 评估 OS 代理跨包、服务或运行时配置诊断系统状态变化的能力
  • 通过作用域指纹验证和过时事实拒绝测试代理记忆复用策略
  • 在确定性检查下对多代理协作模式(如所有者・工作者・验证者)进行基准测试
  • 使用冻结的公开开发任务套件对代理运行器进行可复现的集成测试

项目优势

  • 领域级轨道(系统和运行时状态)不依赖特定发行版,使用合成的固定夹具
  • 清晰的基于角色的协作模型,责任可观测,并配有确定性检查器合约
  • 公开开发答案键和引用验证器,无需依赖即可进行集成测试
  • 方法论与已有基准对齐,同时贡献了原创的 OS 代理任务内容

使用前须知

  • 公开预览 – 不是官方的 OS 认证套件或排行榜;结果需精确版本跟踪
  • CC BY-NC 4.0 许可证禁止未经单独书面许可的商业使用
  • 需要 Node.js 18+,且公共仓库中没有保留的黄金答案(评估者需提供私有捆绑包)

README 快速开始

Quick start

项目描述

Research benchmark for evidence-grounded OS-agent collaboration, continuous state diagnosis, scoped memory reuse, and stale-state rejection.

相关仓库与替代方案

根据分类、Topic 和编程语言匹配的相似项目。

mshumer
精选
mshumer GitHub avatar

Claude-of-Duty

A browser-based first-person shooter built entirely with procedural generation and orchestrated AI agents, featuring 55k lines of Three.js/WebGL2 code and no art assets.

AI 与机器学习AI 智能体
1,234
gnipbao
精选
gnipbao GitHub avatar

story-to-handdrawn-video

A Remotion-based tool that converts Chinese story text or ordered hand-drawn images into vertical hand-drawn diary-comic animation with handwritten captions, left-to-right reveals, optional page-curl transitions, and silent H.264 output for post-production dubbing.

AI 与机器学习AI 智能体
683
0xwilliamortiz
精选
0xwilliamortiz GitHub avatar

ponytail-improved

Ponytail is a plugin for AI coding agents that enforces a disciplined ladder of reuse before writing code, reducing code volume by roughly 54% while preserving safety.

AI 与机器学习AI 智能体
545