🤖 EvalRPG社区版
逐一评估您的AI代理和MCP服务器。
EvalRPG社区版是一个开源的对话评估工具,通过逼真的多回合对话而不是孤立的提示来测试人工智能系统。与传统的评估工具不同,EvalRPG模拟了真实的对话,其中代理必须维护上下文、使用工具并在多个回合中适应用户需求。
  
看看Youtube上的介绍视频!

🎯 为什么要进行对话式评估?
传统的评估工具使用单次提示来测试人工智能系统,但 真正的人工智能代理通过对话工作他们需要:
- 理解上下文 跨越多个转弯
- 使用工具和外部服务 (MCP服务器)
- 处理不明确的请求 并提出澄清问题
- 保持对话流畅 以及用户体验
EvalRPG通过创建来弥合这一差距 真实的对话场景 通过不同的角色来测试你的代理的真实能力。
✨ 主要特点
🎭 动态人物角色生成
- 人工智能生成了多样化的测试角色
- 可定制的角色特征
- 现实的对话开场白
- 每次评估运行有多个角色
🔧 MCP服务器集成
- 连接到外部工具和服务
- 测试真实世界的代理能力
- HTTP流媒体支持
- 多种服务器配置
📊 综合分析
- 成功/失败跟踪
- 会话长度分析
- 持续时间指标
- 详细的对话日志
⚙️ 灵活的配置
- 自定义完成标准
- 可调节的对话限制
- 多次运行以提高可靠性
- 多种AI模型支持
🚀 入门指南
选项1:使用Streamlit托管版本
最简单的入门方法是使用托管的Streamlit版本。只需上传您的配置并开始评估!
选项2:本地安装
先决条件
- Python 3.12或更高版本
- OpenAI API密钥(或兼容的API)
安装
- 克隆存储库:
git clone
cd conversational-evals- 使用uv安装依赖项(推荐):
uv sync- 运行应用程序:
streamlit run main.py🔄 运作原理
1️⃣ 生成人
根据您的评估需求,创建具有独特背景、目标和沟通风格的多样化对话角色。
- 自定义角色提示
- 自动分集
- 真实的开场白
2.️⃣ 配置代理
使用系统说明设置您的AI代理,并连接MCP服务器以访问工具。
- 自定义系统提示
- MCP服务器集成
- 模型选择
3.️⃣ 运行评估
执行多回合对话,并使用详细的成功指标和对话日志分析结果。
- 完成标准
- 转弯限制
- 每个角色多次运行
📖 使用指南
设置您的第一次评估
- 配置您的AI模型 在侧边栏中:
- 添加API密钥 - 选择您的型号(GPT-4、Claude等) - 如果使用自定义端点,请设置基本URL
- 生成人物角色:
- 编写一个提示,描述要模拟的用户类型 - 指定要生成的角色数量 - 点击“生成”以创建各种测试字符
- 配置评估设置:
- 定义完成标准(什么是成功) - 设置最大对话次数 - 选择每个角色的运行次数
- 添加MCP服务器 (可选):
- 配置您的代理可以使用的外部工具 - 设置HTTP流端点 - 测试工具集成
- 运行评估:
- 点击“运行评估”开始测试 - 实时监控进度 - 查看详细的结果和对话日志
人物角色提示示例
Generate personas for testing a customer support chatbot for an e-commerce platform.
Include users with different technical skill levels, various types of issues
(billing, shipping, returns), and different communication styles (direct, verbose, confused).完成标准示例
The conversation is successful if the agent:
1. Correctly identifies the user's issue
2. Provides a clear solution or next steps
3. Maintains a helpful and professional tone throughout
4. Uses appropriate tools when needed (e.g., order lookup, refund processing)支持的型号
- 任何与OpenAI兼容的API端点(OpenAI、Anthropic、LiteLLM)
MCP服务器配置
EvalRPG支持用于工具集成的模型上下文协议(MCP)服务器。在侧边栏中配置服务器,以测试代理使用外部工具和服务的能力。
📊 了解结果
跟踪指标
- 成功率:符合完成标准的对话百分比
- 平均转弯次数:平均对话次数
- 持续时间:每次对话所花费的时间
- 人物表演:按角色类型划分的成功率
会话分析
- 带有时间戳的完整对话日志
- 逐段分析
- 工具使用跟踪
- 错误识别和分类
🤝 贡献
EvalRPG社区版是开源的,欢迎投稿!无论您是在修复错误、添加功能还是改进文档,我们都希望得到您的帮助。
开发设置
git clone
cd conversational-evals
uv sync --dev运行测试
# Add test commands here when available📄 许可证
此项目根据MIT许可证获得许可-请参阅 许可证 文件以获取详细信息。
🙏 致谢
📞 支持
- 问题:在我们的网站上报告错误并请求功能 页
- 讨论:加入对话
- 文档:查看我们的 维基 获取详细指南
______________________________________________________________________
EvalRPG社区版 -逐一评估您的代理和MCP服务器。 🤖✨
