AI Response Auditor 是一个人工参与的质量评估工具,根据五个明确标准对 AI 生成的回答打分,标记风险并导出可追溯的 JSON 报告,所有处理均在浏览器本地完成。

Stars

3

7 天增长

暂无数据

Fork 数

0

开放 Issue

0

开源协议

暂无数据

最近更新

2026-07-30

AI 仓库情报摘要
FR-AI / ANALYSIS

为什么值得关注

该仓库展示了一种有文档、可复现的 AI 回答评估方法,使用清晰的评分标准、确定性哈希和人工审核,同时确保隐私且无外部依赖。

适合谁使用

  • 评估 AI 输出质量的 QA 专业人员
  • 展示分析技能的作品集构建者
  • 教授 AI 回答评估的教育工作者
  • 寻找评分审计参考实现的开发者

典型使用场景

  • 审查聊天 AI 回答是否符合指令
  • 评估 AI 生成文本的一致性和事实依据
  • 为内部 AI 质量检查创建可审计记录
  • 学习如何为 AI 输出构建手动 QA 流程

项目优势

  • 明确的五项评分标准(0-2分制)
  • 完全本地处理,无网络请求,数据不离开浏览器
  • 确定性 SHA-256 标识符,实现可追溯和可复现
  • 同时提供 Web(静态 HTML/JS)和 Python(Streamlit)参考实现

使用前须知

  • 不验证事实真伪,完全依赖审核者提供的证据
  • 自动评分建议不能替代人工判断
  • 该项目为个人作品集,不代表专业 AI 模型训练经验

README 快速开始

AI Response Auditor

Herramienta de portafolio para evaluar respuestas de inteligencia artificial mediante una rúbrica explícita, evidencia trazable y una decisión humana final.

Demostración pública: AI Response Auditor en GitHub Pages

Qué problema resuelve

Una respuesta de IA puede sonar convincente y aun así incumplir instrucciones, contradecirse o presentar información sin respaldo. Esta aplicación convierte esa revisión subjetiva en un flujo repetible: cinco criterios, puntuaciones acotadas, alertas de riesgo y un expediente exportable.

El proyecto demuestra análisis de requisitos, definición de criterios de aceptación, QA manual, validación, documentación y revisión humana. Es un proyecto personal de portafolio; no representa experiencia laboral formal ni entrenamiento profesional de modelos.

Funciones

  • Registra la instrucción, la respuesta y la evidencia disponible.
  • Aplica cinco criterios con puntuaciones de 0 a 2.
  • Calcula una puntuación total de 0 a 10.
  • Sugiere APROBADA, REVISAR o RECHAZADA con umbrales documentados.
  • Señala riesgos críticos y altos.
  • Mantiene la decisión final bajo control humano.
  • Genera un identificador SHA-256 determinista para trazabilidad.
  • Exporta el expediente completo en JSON.
  • Incluye tres casos completamente ficticios.
  • Procesa todo localmente en el navegador: no usa APIs, cuentas ni servicios externos.

Rúbrica

CriterioPregunta de controlEscala
Seguimiento de instrucciones¿Cumple las restricciones y el formato solicitado?0–2
Claridad¿Se entiende sin ambigüedades innecesarias?0–2
Consistencia interna¿Evita contradicciones dentro de la respuesta?0–2
Información respaldada¿Evita afirmar datos que la evidencia no sostiene?0–2
Utilidad y completitud¿Resuelve lo solicitado con suficiente detalle?0–2

Escala común: 0 = no cumple, 1 = cumple parcialmente, 2 = cumple.

Arquitectura

El repositorio conserva dos implementaciones equivalentes:

  • Versión web estática: index.html, assets/styles.css, assets/app.js y assets/auditor.js. Es la versión publicada en GitHub Pages.
  • Implementación de referencia en Python: app.py y src/auditor.py, ejecutables localmente con Streamlit.

No hay dependencias JavaScript en producción. La v

项目描述

QA manual, revisión humana y trazabilidad para evaluar respuestas de IA con criterios claros.

相关仓库与替代方案

根据分类、Topic 和编程语言匹配的相似项目。

mshumer
精选
mshumer GitHub avatar

Claude-of-Duty

A browser-based first-person shooter built entirely with procedural generation and orchestrated AI agents, featuring 55k lines of Three.js/WebGL2 code and no art assets.

AI 与机器学习AI 智能体
1,234
gnipbao
精选
gnipbao GitHub avatar

story-to-handdrawn-video

A Remotion-based tool that converts Chinese story text or ordered hand-drawn images into vertical hand-drawn diary-comic animation with handwritten captions, left-to-right reveals, optional page-curl transitions, and silent H.264 output for post-production dubbing.

AI 与机器学习AI 智能体
683
7-e1even
精选
7-e1even GitHub avatar

learn-agent

A collection of notes on building coding agents, derived from the production development of the desktop agent Reina, with each mechanism simplified into a zero-dependency, single-file Node.js demo.

AI 与机器学习大语言模型
218