AgentDesk MCP——对抗性人工智能综述
](https://www.npmjs.com/package/@ezark-publish/agentdesk-mcp) ](https://www.npmjs.com/package/@ezark-publish/agentdesk-mcp)   
人工智能管道的质量控制——一种MCP工具。适用于Claude Code、Claude Desktop和任何MCP客户端。
29.5%的团队没有对AI输出进行评估。 (LangChain调查) 知识工作者每周花费4.3小时对人工智能输出进行事实核查。 (微软2025)
AgentDesk MCP修复了这个问题。在30秒内为任何AI管道添加独立的对抗性审查。
快速开始
npm(推荐)
npx @ezark-publish/agentdesk-mcp克劳德代码
claude mcp add agentdesk-mcp -- npx @ezark-publish/agentdesk-mcp克劳德桌面
{
"mcpServers": {
"agentdesk-mcp": {
"command": "npx",
"args": ["-y", "@ezark-publish/agentdesk-mcp"],
"env": { "ANTHROPIC_API_KEY": "sk-ant-..." }
}
}
}HTTP传输(流式HTTP)
作为HTTP服务器运行,用于远程访问、Smithery托管或多客户端设置:
# Start with HTTP transport on port 3100
MCP_HTTP_PORT=3100 npx @ezark-publish/agentdesk-mcp
# Or use the --http flag (defaults to port 3100)
npx @ezark-publish/agentdesk-mcp --httpMCP端点: POST http://localhost:3100/mcp 健康检查: GET http://localhost:3100/health
从GitHub安装(可选)
npm install github:Rih0z/agentdesk-mcp需求
ANTHROPIC_API_KEY环境变量(使用您自己的键--BYOK)
工具
review_output
对任何人工智能生成的输出进行对抗性质量审查。独立审查员 假设作者犯了错误 并积极寻找问题。
输入:
| 参数 | 必填 | 说明 |
|---|---|---|
output | 是 | 人工智能生成的输出要查看 |
criteria | 否 | 自定义审核标准 |
review_type | 否 | 类别: code, content, factual, translation等等。 |
model | 否 | 审阅者模型(默认值: claude-sonnet-4-6) |
输出:
{
"verdict": "PASS | FAIL | CONDITIONAL_PASS",
"score": 82,
"issues": [
{
"severity": "high",
"category": "accuracy",
"description": "Claim about X is unsupported",
"suggestion": "Add citation or remove claim"
}
],
"checklist": [
{
"item": "Factual accuracy",
"status": "pass",
"evidence": "All statistics match cited sources"
}
],
"summary": "Overall assessment...",
"reviewer_model": "claude-sonnet-4-6"
}review_dual
双重对抗性审查 --两名独立评审员从不同角度评估输出,然后合并代理将结果结合起来。
- 如果 要么 审阅者发现了一个关键问题→ 合并判决是 失败
- 拿着 降低 得分
- 合并并消除所有问题的重复
用于质量至关重要的高风险输出。
参数与 review_output.
运作原理
- 对抗性提示:要求审阅者假设出现了错误。毫无疑问。
- 循证检查表:每个PASS项目都需要具体的证据。没有证据的项目会自动降级为FAIL。
- 反游戏验证:如果检查表中超过30%的项目缺乏证据,整个审查将被迫失败,最高得分为50分。
- 结构化输出:判决+数字分数+分类问题+检查表(不仅仅是“看起来不错”)。
用例
- 代码审查:检查错误、安全问题、性能问题
- 内容审查:验证准确性、可读性、SEO、受众契合度
- 事实核查:在人工智能生成的文本中验证索赔
- 翻译质量:检查准确性和自然度
- 数据提取:验证完整性和正确性
- 任何AI输出:总结、报告、提案、电子邮件等。
为什么不让同一个AI来审查呢?
自我审查已经 系统性宽大处理偏见一个LLM在审查自己的输出时,也有同样的盲点,这些盲点造成了错误。研究表明,模特在产生幻觉时使用自信语言的可能性要高出34%。
AgentDesktop使用 单独的审阅者调用 对抗性提示——与自我审查有着根本的不同。
比较
| 功能 | AgentDesk MCP | 手动提示 | Braintrust | DeepEval |
|---|---|---|---|---|
| 一个工具设置 | 是 | 否 | 否 | 不 |
| 对抗性评论 | 是 | DIY | 否 | 否 |
| 双重评价 | 是 | DIY | 否 | 否 |
| 反游戏验证 | 是 | 否 | 否 | 不 |
| 不需要SDK | 是 | 是 | 否 | 否 |
| MCP本机 | 是 | 否 | 否 | 不 |
局限性
- 提示注入:与所有法学硕士法官制度一样,对抗性投入可能会试图操纵审查员的判决。反游戏验证层减轻了表面的游戏,但确定的对抗输入仍然是一个挑战。对于高风险用例,结合确定性验证。
- BYOK成本:每个
review_output调用进行1个LLM API调用;review_dual使3。将此因素纳入您的管道成本。
托管API(独立产品)
对于喜欢HTTP集成的团队,提供了一个具有附加功能(代理市场、上下文学习、工作流)的托管REST API agentdesk.usedevtools.com.
发展
git clone https://github.com/Rih0z/agentdesk-mcp.git
cd agentdesk-mcp
npm install
npm test # 35 tests
npm run build许可证
麻省理工学院
______________________________________________________________________
