WANDR是一个用于评估AI智能体在结构化、高容量信息工作(包括发现、丰富、提取、实体消歧和证据支持的答案合成)中的基准测试。

Stars

253

7 天增长

暂无数据

Fork 数

30

开放 Issue

0

开源协议

Apache-2.0

最近更新

2026-07-16

AI 仓库情报摘要
FR-AI / ANALYSIS

为什么值得关注

它提供了一个严格的、分层评估框架,包含任务本地验证器、多提供商支持以及详细的度量指标,适用于广泛而深入的研究基准测试。

适合谁使用

  • 研究基于智能体的信息检索与合成的人工智能研究员
  • 构建和评估基于LLM的研究助手的开发者
  • 对复杂知识工作任务进行AI系统基准测试的组织
  • 集成自动化评估流水线以支持智能体工作流的平台工程师

典型使用场景

  • 对LLM智能体进行需要广泛网络发现和精确实体提取的多步研究任务基准测试
  • 评估AI生成的研究报告的质量和可靠性,并带有证据支持的合成
  • 测试不同AI提供商(OpenAI、Anthropic、Perplexity等)在结构化研究基准上的性能
  • 通过标准化任务包验证Harbor等智能体编排框架

项目优势

  • 分层架构(源数据、适配器、Harbor任务、Relay)支持独立开发和复用
  • 任务本地评估器具有自包含评分功能,可在无需外部运行时依赖的情况下发布和验证
  • 支持多个AI提供商和执行环境(本地Docker、E2B),提供灵活的基准测试
  • 提供全面的输出文件,包括奖励、度量、轨迹和人类可读报告,便于深入分析

使用前须知

  • 需要为求解器、获取器和评判器支付API调用费用;完整基准测试可能非常昂贵
  • 设置复杂:需要Python 3.12、uv、Docker和多个API密钥,且没有内置消费上限
  • 首次运行缓慢,因为需要构建Docker镜像和安装依赖;后续运行仅能复用缓存

README 快速开始

Quick Start

相关仓库与替代方案

根据分类、Topic 和编程语言匹配的相似项目。

lopopolo
精选
lopopolo GitHub avatar

harness-engineering

Harness Engineering is a methodology for improving coding agent outputs by carefully crafting the environment around them—providing curated context, tools, and executable constraints that encode an organization’s nonfunctional requirements and cumulative lessons.

AI 与机器学习AI 智能体
2,390
slvDev
精选
slvDev GitHub avatar

esp32-ai

A 28.9 million parameter language model runs on an $8 ESP32-S3 microcontroller entirely on-device, generating simple stories at about 9.5 tokens per second.

AI 与机器学习大语言模型
1,960
littledivy
精选
littledivy GitHub avatar

mimic

mimic captures traffic from any iOS or web app and automatically generates a Python client library that lets you call the app's API like a regular library.

AI 与机器学习
1,482