一个简单的Streamlit工具,可上传对话文件,按自定义维度对AI回答进行评分并给出理由,保存历史记录并支持导出CSV/Markdown表格。

Stars

4

7 天增长

暂无数据

Fork 数

0

开放 Issue

0

开源协议

暂无数据

最近更新

2026-07-31

AI 仓库情报摘要
FR-AI / ANALYSIS

为什么值得关注

它提供了一个轻量级、可本地运行的方案,通过可配置的评分标准和持久化记录,系统性地评估AI对话输出质量。

适合谁使用

  • 测试聊天机器人回复质量的开发者
  • 评估AI助手表现的产品经理
  • 对AI输出进行打分的QA或数据标注团队
  • 使用自定义评分规则的研究人员

典型使用场景

  • 从上传的对话日志中按自定义质量维度对AI回答进行评分
  • 建立历史评分数据库以追踪AI表现变化
  • 导出CSV或Markdown评分表用于报告或进一步分析
  • 通过自定义模型API和提示词快速搭建本地评估界面

项目优势

  • 支持上传txt和docx格式的对话文件
  • 允许自定义评分维度和提示词
  • 自动保存评分历史并支持导出
  • 通过pip和Streamlit即可简单本地部署

使用前须知

  • 使用前需要手动配置模型API、密钥和模型名称
  • 仅支持txt/docx文件格式
  • 被描述为简单测试网页,并非生产级系统

README 快速开始

这是个简单的测试网页,是个Streamlit 工具:上传对话文件(txt/docx),对每段对话中 AI 的回答按自定义维度评分,并给出评分理由。并且评分之后,会存下历史记录,以及可以导出的csv/markdown表格,便于统计评分。

代码拉到本地后,依次运行下面的命令,即可自动打开浏览器,开始使用。

运行

pip install -r requirements.txt pip install plotly streamlit run app.py

首页上传文件评分;第一次启动需要在,「配置」页设置模型(API 地址/Key/模型名)、提示词、评分维度;「历史」页可以回看往期评分。

项目描述

a simply test web for a intern

相关仓库与替代方案

根据分类、Topic 和编程语言匹配的相似项目。

yetone
精选
yetone GitHub avatar

kill-ai-slop

Kill AI Slop is a multilingual field guide and agent skill that catalogues 33 common AI-generated design tells with interactive before-after demos, and provides a tool to scan and fix web projects.

AI 与机器学习AI 智能体
805
lopopolo
精选
lopopolo GitHub avatar

harness-engineering

Harness Engineering is a methodology for improving coding agent outputs by carefully crafting the environment around them—providing curated context, tools, and executable constraints that encode an organization’s nonfunctional requirements and cumulative lessons.

AI 与机器学习AI 智能体
2,390
slvDev
精选
slvDev GitHub avatar

esp32-ai

A 28.9 million parameter language model runs on an $8 ESP32-S3 microcontroller entirely on-device, generating simple stories at about 9.5 tokens per second.

AI 与机器学习大语言模型
1,960