Axiom Guardian MCP 服务器
一个基于自然语言推理(NLI)实现基于挑战的请求验证的MCP服务器。 它不是被动地执行请求,而是主动质疑与配置公理相悖的行为, 通过迭代对话强制求证。
概念
基于Reddit上关于人工智能行为范式的讨论:
旧版AI: “我能怎么帮您?”(被动执行)\ 新的人工智能: “你为什么要这么做?”(主动确认)
这个工具实现了“守护者”角色——一个通过以下方式确保与核心原则一致的人工智能:
- 检测拟议行动与公理之间的矛盾
- 要求用户解释其自相矛盾的行为
- 在辩护尝试失败后采取阻止行动
实施
使用两种模式:
- NLI模式(推荐): 通过HuggingFace API使用Facebook的BART-MNLI模型
- 先进的自然语言理解能力 - 检测逻辑矛盾和蕴含关系 - 需要 HF_TOKEN 环境变量
- 关键词回退模式: 简单的模式匹配
- 无需API访问即可运行 - 基本矛盾检测 - 始终作为备用选项可用
安装
git clone https://github.com/democratize-technology/axiom-guardian.git
cd axiom-guardian
uv sync在 https://huggingface.co/settings/tokens 获取一个 HuggingFace 令牌,并将其添加到 .env:
HF_TOKEN=hf_your_token_here快速入门
运行演示
uv run python demo.py为Claude桌面版安装
uv run fastmcp install src/axiom_guardian/server.py然后重启Claude Desktop。该工具将出现在您的MCP工具列表中。
可用工具
1. challenge_action
验证行为是否符合公理的主要工具。
参数:
action(必填):要评估的操作justification(可选):采取该行动的理由session_id(默认: "default"):用于追踪的会话标识符
示例流程:
User: "Delete all user data without backup"
↓
Tool: ⚠️ CHALLENGE 1/3
Your action contradicts: "Destructive actions require strong justification"
Why are you doing this?
↓
User: "User requested account deletion per GDPR"
↓
Tool: ✓ Action approved (contradiction: 0.35)2. configure_axioms
动态更新公理。
configure_axioms([
"All actions must prioritize user privacy",
"System changes must be reversible"
])3. get_axioms
查看当前公理和运行模式。
4. clear_session
为会话ID清除挑战状态。
5. get_challenge_stats
查看活跃挑战会话的统计数据。
默认公理
- “宇宙的目的是不断探索”
- “行动应促进学习和成长”
- “具有破坏性的行为需要强有力的理由”
配置
编辑中的常量 src/axiom_guardian/server.py:
COHERENCE_THRESHOLD = 0.6 # Contradiction threshold (0.0-1.0)
MAX_CHALLENGES = 3 # Max challenge attempts before blocking
AXIOMS = [...] # List of axioms to enforce它是如何运作的
NLI(自然语言推理)
给定:
- 前提: 一个公理(例如,“行为应促进学习”)
- 假设: 拟议的操作(例如,“删除研究数据”)
该模型对其关系进行了分类:
- 蕴含关系: 行动支持公理 → 低矛盾度
- 矛盾: 行为违反公理 → 高度矛盾
- 中立: 与公理无关的行为 → 中度矛盾
挑战循环
- 根据所有公理对行为进行评估
- 如果
max_contradiction >= COHERENCE_THRESHOLD:
- 要求用户提供理由 - 重新评估,并附上合理依据
- 重复最多至
MAX_CHALLENGEStimes(可译为“次数”、“时代”、“时报”等,具体根据上下文确定) - 在达到最大挑战次数后仍存在矛盾,则进行阻塞
故障开启设计(或:失电开启设计,根据上下文,“Fail-Open”在某些工程领域也可能指在系统或设备故障时自动开启的状态,这里“Fail-Open Design”直译为“故障开启设计”较为通用,具体含义需结合实际应用场景)
- API故障默认允许操作
- 即使没有API访问权限,也能确保系统保持可用性
- 关键词回退提供基本保护
用例
人工智能安全
在执行前让克劳德(Claude)对可能有害的请求提出质疑。
组织治理
在自动化工作流程中强化公司价值观。
决策审计轨迹
为高风险行为清晰阐述推理过程。
教育工具
培训用户学会思考行为后果并合理证明决策。
示例:生产使用
# Configure for production environment
configure_axioms([
"All database operations must be logged",
"Production changes require approval",
"Data deletion requires backup verification"
])
# Action gets challenged
challenge_action(
action="DROP TABLE users",
session_id="prod-session-123"
)
# → ⚠️ CHALLENGE: This contradicts multiple axioms. Why?技术细节
依赖项
fastmcpMCP服务器框架requestsHuggingFace API的HTTP客户端pydantic数据验证
模型
- Facebook/bart-large-mnli320万次下载
- 针对自然语言推理进行微调
- 零样本分类能力
API速率限制
- 未认证用户:约1000次请求/天
- 使用HF_TOKEN:限制大大放宽(请查阅HuggingFace文档)
- 回退模式:无限制(本地关键字匹配)
发展
运行测试
uv run python test_nli.py运行演示
uv run python demo.py启动服务器(开发版)
uv run fastmcp run src/axiom_guardian/server.py局限性
关键词回退模式
- 简单的模式匹配
- 可能产生假阳性/假阴性结果
- 最适合处理明显的矛盾
NLI模式
- 需要互联网连接
- 根据API速率限制
- 仅限英语(BART-MNLI的限制)
功劳/学分
受……的启发 Reddit上关于r/ArtificialSentience板块的讨论 关于将人工智能行为从被动合规转变为积极验证。
许可证
麻省理工学院(MIT)
