AI Response Auditor is a human-in-the-loop QA portfolio tool that scores AI-generated answers against five explicit criteria, flags risks, and exports traceable JSON reports, all processed locally in the browser.

Stars

3

7-day growth

No data

Forks

0

Open issues

0

License

No data

Last updated

2026-07-30

AI repository intelligence
FR-AI / ANALYSIS

Why it is worth attention

This repository demonstrates a well-documented, reproducible approach to evaluating AI responses using a clear rubric, deterministic hashing, and human oversight, all while ensuring privacy and zero external dependencies.

Who it is for

  • QA professionals evaluating AI outputs
  • Portfolio builders demonstrating applied analysis skills
  • Educators teaching AI response evaluation
  • Developers seeking a reference implementation of a rubric-based auditor

Use cases

  • Reviewing chat AI responses for compliance with instructions
  • Assessing consistency and factual grounding of AI-generated text
  • Creating auditable records for internal AI quality checks
  • Learning how to structure a manual QA process for AI outputs

Strengths

  • Explicit five-criteria rubric with clear scoring scale (0-2)
  • Full local processing – no network requests, no data leaves the browser
  • Deterministic SHA-256 identifier for traceability and reproducibility
  • Includes both web (static HTML/JS) and Python (Streamlit) reference implementations

Considerations

  • Does not verify factual truth – depends entirely on reviewer-provided evidence
  • The automatic verdict suggestion is not a replacement for human judgment
  • Project is a personal portfolio piece and does not represent professional AI model training

README quick start

AI Response Auditor

Herramienta de portafolio para evaluar respuestas de inteligencia artificial mediante una rúbrica explícita, evidencia trazable y una decisión humana final.

Demostración pública: AI Response Auditor en GitHub Pages

Qué problema resuelve

Una respuesta de IA puede sonar convincente y aun así incumplir instrucciones, contradecirse o presentar información sin respaldo. Esta aplicación convierte esa revisión subjetiva en un flujo repetible: cinco criterios, puntuaciones acotadas, alertas de riesgo y un expediente exportable.

El proyecto demuestra análisis de requisitos, definición de criterios de aceptación, QA manual, validación, documentación y revisión humana. Es un proyecto personal de portafolio; no representa experiencia laboral formal ni entrenamiento profesional de modelos.

Funciones

  • Registra la instrucción, la respuesta y la evidencia disponible.
  • Aplica cinco criterios con puntuaciones de 0 a 2.
  • Calcula una puntuación total de 0 a 10.
  • Sugiere APROBADA, REVISAR o RECHAZADA con umbrales documentados.
  • Señala riesgos críticos y altos.
  • Mantiene la decisión final bajo control humano.
  • Genera un identificador SHA-256 determinista para trazabilidad.
  • Exporta el expediente completo en JSON.
  • Incluye tres casos completamente ficticios.
  • Procesa todo localmente en el navegador: no usa APIs, cuentas ni servicios externos.

Rúbrica

CriterioPregunta de controlEscala
Seguimiento de instrucciones¿Cumple las restricciones y el formato solicitado?0–2
Claridad¿Se entiende sin ambigüedades innecesarias?0–2
Consistencia interna¿Evita contradicciones dentro de la respuesta?0–2
Información respaldada¿Evita afirmar datos que la evidencia no sostiene?0–2
Utilidad y completitud¿Resuelve lo solicitado con suficiente detalle?0–2

Escala común: 0 = no cumple, 1 = cumple parcialmente, 2 = cumple.

Arquitectura

El repositorio conserva dos implementaciones equivalentes:

  • Versión web estática: index.html, assets/styles.css, assets/app.js y assets/auditor.js. Es la versión publicada en GitHub Pages.
  • Implementación de referencia en Python: app.py y src/auditor.py, ejecutables localmente con Streamlit.

No hay dependencias JavaScript en producción. La v

Description

QA manual, revisión humana y trazabilidad para evaluar respuestas de IA con criterios claros.

Related repositories

Similar projects matched by category, topics, and programming language.

mshumer
Featured
mshumer GitHub avatar

Claude-of-Duty

A browser-based first-person shooter built entirely with procedural generation and orchestrated AI agents, featuring 55k lines of Three.js/WebGL2 code and no art assets.

AI & Machine LearningAI Agents
1,234
gnipbao
Featured
gnipbao GitHub avatar

story-to-handdrawn-video

A Remotion-based tool that converts Chinese story text or ordered hand-drawn images into vertical hand-drawn diary-comic animation with handwritten captions, left-to-right reveals, optional page-curl transitions, and silent H.264 output for post-production dubbing.

AI & Machine LearningAI Agents
683
7-e1even
Featured
7-e1even GitHub avatar

learn-agent

A collection of notes on building coding agents, derived from the production development of the desktop agent Reina, with each mechanism simplified into a zero-dependency, single-file Node.js demo.

AI & Machine LearningLarge Language Models
218