🧠 古巴思考
人工智能代理的高级认知推理引擎 --一种模型上下文协议(MCP)服务器,通过6级认知管道、9层抗幻觉、MCTS质量执行、带Veto Gate的8信号过程奖励模型(PRM)、偏见检测、元认知分析、持续思维会话、具有Kahn DP最长路径的思维图拓扑、模式崩溃检测、Softmax门控注意力奖励评分、CUSUM变化点检测、ONNX语义嵌入(fastembed)、NLI矛盾检测(rust-bert)、Flesch-Kincaid可读性评分和跨MCP记忆共生来增强AI推理。
3个工具。零云依赖。186次测试。9轮审计。16个魔法常数已正式验证。
______________________________________________________________________
古巴为什么思考?
人工智能代理以扁平、非结构化的序列进行思考。古巴思维给了他们:
- 6级认知引擎 --Bloom分类状态机:定义→ 研究→ 分析→ 假设→ 验证→ 合成
- 9层抗幻觉 --假设跟踪、置信度校准、CoVe结构与验证问题检测、证据积累、索赔接地(按索赔接近度)、EWMA阈值执行、矛盾检测、预热保护、反过度思考
- 6D质量指标 --清晰度(根TTR 40%+Flesch-Kincaid 30%+句子一致性30%)、深度(子句计数)、广度(名词多样性)、逻辑(连接密度)、相关性(TF-IDF余弦)、可操作性(命令式+特殊性)
- 过程奖励模型(PRM) --使用V9逻辑否决门进行8信号代码评估:
Gate × (0.6×Verify + 0.4×Quality)防止不可编译的代码得分过高 - 沙盒执行 --PyO3 0.28沙盒,具有基于AST的安全扫描、RLIMIT_AS 512MB内存上限、递归限制100、嵌套深度100、PEP 578审计挂钩、ReDoS保护、Z3空真值检测器。支持 数值Python, sympy,以及 SciPy
- MCTS强制回溯 --协议级拒绝(
isError: true)当EWMA降至预算感知阈值以下,并设有对冲拒绝区时 - MCTS图 --竞技场分配PUCT+自适应UCT(基于方差的c_PUCT,相关性_lambda)——优于标准UCB1
- 思维图谱(GoT) --具有Kahn拓扑排序+DP的DAG拓扑用于正确的最长路径深度,Tarjan SCC循环检测O(V+E)用于循环推理
- 持续的思考环节 --交叉调用状态累积:EWMA、新颖性、图、置信度振荡、深度退化、根锚定、假设漂移
- 认识论倒退 --当MCTS拒绝一个想法时,会话状态的快照/回滚,防止幻觉前提毒害未来的推理
- 模式崩溃检测 --OrthogonalityGuard:Jaccard相似性+针对失败想法的语义嵌入相似性可检测被转述的被拒绝的想法
- 偏差检测 --5种认知偏差(锚定、确认、可用性、沉没成本、旅行车),有信心+可操作的建议
- 元认知分析 --填充率、内容词比(Coh-Metrix)、索赔密度、谬误检测、辩证推理检查
- 纠正指令 --3个严重级别(信息/警告/纠正),针对薄弱质量维度的规范性改进
- 舞台内容对齐 --验证思维内容是否与声明的认知阶段+逻辑有效性得分(推理/接收2024)相匹配
- 奖励一致性检查 --PRM↔EWMA发散检测(Z≈1.9,P(误报)≈2.9%)用于奖励游戏预防
- Softmax门控注意力 --通过τ=0.5的softmax实现动态EWMA权重,贝叶斯先验初始化(Fin-PRM启发,Zhou等人,2025)
- CUSUM变化点检测 --无滞后质量崩溃检测代替MACD(μ=0.70,k=0.05,h=0.15)
- 跨MCP内存共生 --桥到 古巴回忆录 带防重复保护
- EWMA奖励跟踪 --6信号复合材料,具有自适应α地板、阶段自适应重量分布、CUSUM崩溃预测、过程优势验证器(PAV)、停滞/疲劳检测
- 矛盾检测 -NLI零样本分类(rust-bet)+直接否定,30+反义词对,量词与句子上下文冲突
- 新颖性跟踪 --通过Jaccard距离+语义嵌入相似性(快速嵌入BGE小,384 dim)进行释义检测,每个思维步骤的Shannon信息增益
- 深度退化 --跟踪质量。每个想法的深度历史记录,检测到与基线相比下降>50%(KV缓存饱和代理)
- 代码感知指标 --当输入是代码还是自然语言时,质量、深度和指令会发生变化
- 反过度思考 --停滞检测、疲劳监测、模式崩溃保护、早期停止信号
______________________________________________________________________
快速开始
1.先决条件
- 锈蚀1.83+ & 货物
- Python 3.10+ (用于PRM沙盒执行)
- libtorch --自动下载者
rust-bert构建期间(~2GB,仅限CPU)
2.建造
git clone https://github.com/LeandroPG19/cuba-thinking.git
cd cuba-thinking/cuba_cognitive_engine
cargo build --release注: 首次构建下载ONNX模型文件(fastembed约33MB)和libtorch(rust-bert约2GB)。后续版本将被缓存。
3.配置您的AI编辑器
添加到您的MCP配置中(例如。, mcp_config.json).你 必须 集 LD_LIBRARY_PATH 转到构建工件内的libtorch目录:
{
"mcpServers": {
"cuba-thinking": {
"command": "/path/to/cuba-thinking/cuba_cognitive_engine/target/release/cuba_cognitive_engine",
"args": [],
"env": {
"LD_LIBRARY_PATH": "/path/to/cuba-thinking/cuba_cognitive_engine/target/release/build/torch-sys-/out/libtorch/libtorch/lib"
}
}
}
}要找到确切的路径:
find target/release/build -path '*/torch-sys-*/out/libtorch/libtorch/lib' -type d或者,使用附带的包装器脚本:
{
"mcpServers": {
"cuba-thinking": {
"command": "/path/to/cuba-thinking/run_mcp.sh",
"args": []
}
}
}零云API密钥。100%本地运行。模型在首次运行时自动下载。
______________________________________________________________________
三种工具
1. cuba_thinking --深度推理
核心认知引擎。通过完整的分析流程评估每个思考步骤。
所需参数:
| 参数 | 类型 | 说明 |
|---|---|---|
thought | string | 当前思维步骤(必须是代码/形式逻辑,而不是自然语言) |
thoughtNumber | number | 当前思想数(从1开始) |
nextThoughtNeeded | boolean | 是否有下一个思考步骤 |
可选参数:
| 参数 | 类型 | 说明 |
|---|---|---|
thinkingStage | 字符串 | DEFINE, RESEARCH, ANALYZE, HYPOTHESIZE, VERIFY, SYNTHESIZE |
confidence | 数字 | 0.0–1.0,根据舞台期望进行校准 |
assumptions | string\[\] | 跨思想跟踪和重复数据消除 |
hypothesis | string | 正在测试的当前假设 |
budgetMode | 字符串 | fast, balanced, thorough, exhaustive |
biasDetected | string | 代理报告的偏差: anchoring, confirmation, availability, sunk_cost, bandwagon |
branchFromThought | number | MCTS探测的分支点 |
branchId | string | 并行推理路径的标识符 |
输出包括: EWMA奖励百分比、信任评分、校准置信度、质量评分、矛盾警告、偏见警报、纠正指令、记忆指令、趋势指标、奖励一致性警告。
2. verify_code --过程奖励模型(PRM)
在沙盒环境中执行Python代码,并评估8个质量信号。
参数:
| 参数 | 类型 | 说明 |
|---|---|---|
code | string | 要验证的Python代码(断言、函数、计算) |
8个PRM信号:
| 信号 | 权重 | 评分 |
|---|---|---|
| E1编译 | 0.25 | 1.0(如果执行成功),否则为0.0 |
| E2断言传递 | 0.25 | 1.0,传递断言,0.3,不传递断言,0.0失败 |
| E3复杂性 | 0.10 | 如果CC≤7,则为1.0,如果CC≤10,则为0.7,否则为0.0 |
| E4类型安全 | 0.08 | 1.0带类型注释,0.3不带类型注释 |
| E5安全导入 | 0.05 | 1.0干净,0.0有安全违规 |
| E6决定论 | 0.10 | 1.0可重复,0.5随机/时间 |
| E7覆盖率 | 0.07 | 断言功能比 |
| E8多样性 | 0.10 | 唯一断言目标/总断言(反游戏) |
V9 Veto门: Gate = (E1×0.7 + E4×0.3).max(0.05) --无论其他信号如何,不可编译的代码都会接近零分。
判决: 优秀(≥85%)、良好(≥65%)、可接受(≥45%)、不足(\ h (lag-free, replaces MACD)
- **奖励历史记录**:上限为20个入口(VecDeque环形缓冲区)
- **停滞检测**:3个以上步骤,EWMA变化\0.4→ 警告(Z≈1.9,P≈2.9%)
______________________________________________________________________
## 思维图谱(GoT)
跨推理链的DAG拓扑跟踪:
- **节点**:每个思考步骤都成为一个节点
- **边缘**:顺序和修订依赖关系
- **最长路径**:Kahn拓扑排序+动态规划(收敛安全)
- **循环检测**:Tarjan的SCC算法O(V+E)检测循环推理
______________________________________________________________________
## MCTS图——PUCT+自适应UCT
竞技场分配的MCTS具有PUCT评分(优于标准UCB1):
PUCT(s,a) = Q(s,a) + c_puct × P(s,a) × √(N_parent) / (1 + N_child) c_puct adapts based on variance of child Q-values
______________________________________________________________________
## 持续的思考会议
会话在共享相同假设的多个MCP工具调用之间维护状态:
- **EWMA积累**:质量跟踪在通话中持续存在
- **新颖性跟踪**:通话时词汇量会增加
- **思维图谱**:DAG跨调用构建
- **趋势指标**: ↗️ 改善,→ 稳定,↘️ 下降
- **假设漂移(G11)**:与原始假设的语义距离
- **根部锚固**:组合漂移检测(假设+初步想法)
- **置信度波动**:快速检测交替置信度(5个读数中>3个符号变化)
- **深度退化**:跟踪质量。深度历史,检测到与基线相比下降>50%
- **认识论倒退**:当MCTS拒绝一个想法时进行快照/回滚
- **模式崩溃保护**:存储被拒绝的想法,通过Jaccard检测释义>0.6
- **自动过期**:TTL 600防止内存泄漏
______________________________________________________________________
## 沙盒安全
通过PyO3实现的多层Python沙盒:
|层|保护|
|-------|------------|
| **AST扫描仪** |在解析时阻止危险的导入(os.system、subprocess等)|
| **嵌套深度** |最大100个支架深度——防止CPython C机架耗尽|
| **内存限制** |RLIMIT_AS 512MB——防止OOM炸弹|
| **递归限制** |100-防止堆栈溢出|
| **并发** |信号量最多2个并发执行|
| **超时** |最多5秒|
| **代码大小** |最大输入50KB|
| **PEP 578审计陷阱** |在运行时阻止操作系统级事件|
| **ReDoS防护** |re.compile的反向参考长度限制|
| **Z3空洞的真理** |检测Z3求解器输出中的琐碎断言|
______________________________________________________________________
## 舞台内容对齐(V8)
验证思维内容是否与其宣称的认知阶段相匹配:
- **6个关键字模式集**:每个阶段都有双语(英语/西班牙语)
- **对齐得分**:声明的阶段模式与检测到的阶段模式的比率
- **逻辑有效性得分**:4个维度——前提参考(30%)、结论支持(30%),反向参考(20%),无逻辑缺口(20%)
- **警告**:当对齐\2个图案时发生火灾
______________________________________________________________________
## 偏差检测
|偏差|检测方法|
|------|-----------------|
| **锚定** |过度依赖首次提及的数据|
| **确认** |仅寻求支持性证据|
| **可用性** |依赖最近/难忘的例子|
| **沉没成本** |不顾证据为先前的决定辩护|
| **从众** |“每个人都使用X”推理|
每个检测到的偏差都包括置信水平、解释和可操作的建议。
______________________________________________________________________
## 记忆共生
穿过MCP桥 [古巴回忆录](https://github.com/LeandroPG19/cuba-memorys):
|阶段|触发|动作|
|-------|---------|--------|
| **定义** (思想≤2)|问题定义| `cuba_faro` 搜索+ `cuba_expediente` 错误检查|
| **假设** |新假设| `cuba_expediente` 防重复保护|
| **验证** |索赔核实| `cuba_faro(mode:"verify")` 接地检查|
| **合成** (最终)|结论| `cuba_cronica` 课程巩固|
类似于皮质-海马巩固周期(McClelland等人,1995)。
______________________________________________________________________
## 预算模式
|模式|EWMAα下限|MCTS阈值|质量门|最大思考量|长度惩罚|
|------|:------------:|:--------------:|:------------:|:------------:|:--------------:|
| ⚡ `fast` |0.30 | 50%| 0.30 | 5 | 80字|
| ⚖️ `balanced` |0.25 | 40%| 0.25 | 10 | 150字|
| 🔎 `thorough` |0.20 | 35%| 0.20 | 20 | 250字|
| 🔬 `exhaustive` |0.15 | 30%| 0.15 | 50 | 400字|
______________________________________________________________________
## 建筑
cuba-thinking/ └── cuba_cognitive_engine/ ├── Cargo.toml └── src/ ├── main.rs # Entry point ├── server/ │ ├── mcp_protocol.rs # JSON-RPC 2.0, tool dispatch, progress streaming │ └── observability.rs # Prometheus metrics, tool timing └── engine/ ├── mod.rs # Module registry │ ├── ── Cognitive Core ── ├── stage_engine.rs # 6-stage state machine (Bloom's Taxonomy) ├── quality_metrics.rs # 6D quality + Shannon entropy + LZ76 + Root-TTR ├── ewma_reward.rs # Softmax Gated Attention + CUSUM + PAV ├── budget.rs # 4 budget modes with optimal stopping (Wald 1945) ├── anti_hallucination.rs # 9-layer trust verification + Pareto L2 norm ├── bias_detector.rs # 5 cognitive bias detectors (Kahneman & Tversky) ├── metacognition.rs # Filler, CWR (Coh-Metrix), fallacies, dialectics ├── thought_graph.rs # GoT DAG + Kahn DP + Tarjan SCC O(V+E) ├── memory_bridge.rs # Cross-MCP memory symbiosis + anti-repetition ├── formatter.rs # Output formatting │ ├── ── Semantics ── ├── semantic_similarity.rs # ONNX embeddings (fastembed BGE-small, 384-dim) + TF-IDF fallback + LRU cache ├── contradiction_detector.rs # NLI zero-shot (rust-bert) + negation, 30+ antonyms, quantifiers ├── novelty_tracker.rs # Jaccard distance + semantic embedding similarity (paraphrase detection) ├── claim_grounding.rs # ROSCOE faithfulness + specificity │ ├── ── Deep Reasoning ── ├── thought_session.rs # Persistent sessions + rollback + trends + drift ├── corrective_directives.rs # 3-level prescriptive corrections (SEAL/FS-C) ├── stage_validator.rs # Stage alignment + Logical Validity (ReasonEval 2024) │ ├── ── Execution ── ├── micro_prm.rs # 8-signal PRM + Veto Gate (V9) ├── sandbox.rs # PyO3 sandbox + AST + RLIMIT + PEP 578 ├── mcts_graph.rs # PUCT + Adaptive UCT (arena-allocated) └── shared_utils.rs # Centralized stopwords, UTF-8 truncation
### 依赖项
|板条箱|版本|用途|
|-------|:-------:|---------|
| `tokio` |1.50|异步运行时|
| `serde` + `serde_json` |1.0 |序列化|
| `pyo3` |0.28|PRM代码执行的Python沙盒|
| `fastembed` |5.12|ONNX语义嵌入(BGE-small-en-v1.5384 dim)|
| `rust-bert` |0.23|NLI用于矛盾检测的零样本分类|
| `lru` |0.16 |用于嵌入和沙箱评估的LRU缓存|
| `dashmap` |6.x |会话存储的无锁并发哈希映射|
| `regex` |1.12 |图案匹配|
| `tracing` |0.1 |结构化日志记录|
| `anyhow` + `thiserror` |1.0/2.0|错误处理|
| `bumpalo` |3.20|MCTS图的竞技场分配|
| `mimalloc` |0.1|高性能内存分配器|
______________________________________________________________________
## 默认情况下为静音
功能仅在可操作时显示:
|功能|出现时|
|---------|-------------|
|EWMA奖励|始终(核心指标)|
|纠正指令|质量维度低于阈值|
|矛盾警告|检测到否定/反义词/量词冲突|
|偏见警报|检测到认知偏见模式|
|元认知警告|填充>30%或CWR\50%,与基线相比|
|置信度波动|>5个读数中有3个符号变化|
|假设漂移|与原始语义距离>阈值|
|模式崩溃| Jaccard相似度>0.6,拒绝思考|
|奖励分歧|PRM↔EWMA散度>40pp(Z≈1.9)|
|运动学崩溃| CUSUM检测到质量加速下降|
|阶段不匹配|声明阶段与检测阶段不一致|
|内存指令|定义/假设/验证/合成阶段|
______________________________________________________________________
## 数学验证
通过单元测试和形式化分析验证的每个公式:
|#|公式|说明|已验证|
|---|---------|-------------|:--------:|
|1|EWMAα=最大值(2/(n+1),α_floor)|自适应平滑(Roberts 1959)|✅ |
|2|Softmax w_i=p_i×exp(|x_i-μ|/τ)|门控注意力(周2025)|✅ |
|3|CUSUM S_t=max(0,S\_{t-1}+x_t-μ-k)|变化点检测|✅ |
|4|PRM门=(E1×0.7+E4×0.3)最大值(0.05)|否决门|✅ |
|5 |复合奖励(6个信号)|权重总和为1.0(3个阶段配置文件)|✅ |
|6|PRM复合(8个信号)|权重总和为1.0+否决门|✅ |
|7 |信任评分(5个组成部分)|权重总和为1.0 |✅ |
|8|TF-IDF余弦相似性|一致性评分(Salton 1975)|✅ |
|9|Jaccard | A∩B|/|A∪B||新颖性+模式崩溃检测|✅ |
|10|TTR/√N|根TTR归一化|✅ |
|11|Tarjan SCC O(V+E)|循环检测正确性|✅ |
|12|Kahn的DP拓扑排序|DAG最长路径(收敛安全)|✅ |
|13|Pareto L2范数d²+c²>1.65|游戏检测(Z≈1.645,第90个pctl)|✅ |
|14 | Sigmoid P(拒绝)=1/(1+e^(20d))|对冲MCTS拒绝|✅ |
|15|香农H(X)+LZ76|信息密度|✅ |
|16||PRM-EWMA|>0.4|奖励一致性(Z≈1.9,P≈2.9%)|✅ |
______________________________________________________________________
## 古巴生态系统的一部分
|项目|目的|
|---------|---------|
| [古巴记忆](https://github.com/LeandroPG19/cuba-memorys) |持久记忆——知识图谱、Hebbian学习、RLHF反馈|
| **古巴思考** |认知推理——质量指标、抗幻觉、PRM、MCTS执行|
| [古巴搜索](https://github.com/LeandroPG19/cuba-search) |网络搜索——研究、抓取、验证、文档查找|
| [古巴执行官](https://github.com/LeandroPG19/cuba-exec) |命令执行——后台进程、信号、交互式stdin|
它们共同赋予了人工智能代理 **记忆+推理+搜索+执行**.
______________________________________________________________________
## 学术参考文献
|#|引文|用于|
|---|----------|----------|
|1|Anderson和Krathwohl(2001)。“修订的布鲁姆分类法”| 6个认知阶段|
|2 |罗伯茨(1959)。“EWMA控制图”|自适应EWMA平滑|
|3|Kocsis和Szepesvári(2006)。“UCB应用于树木”|了解预算的MCTS阈值|
|4|Golovneva等人(2023)。“ROSCOE”--ICLR |忠诚,要求接地|
|5|Dhuliawala等人(2023)。“CoVe减少幻觉”——元人工智能|验证链|
|6|Lightman等人(2023)。“让我们一步一步验证”--OpenAI |步骤级奖励(PRM)|
|7 |卡尼曼和特沃斯基(1974)。“不确定性下的判断”|认知偏差检测|
|8 |弗拉维尔(1979)。“元认知与认知监控”|元认知分析|
|9|Graesser等人(2004)。“Coh-Metrix”|内容词比率|
|10 |坦普林(1957)。“儿童的某些语言技能”|TTR清晰度指标|
|11 |亨特(1965)。“语法结构”|子句深度分析|
|12 |关等人(2024)。“GRACE”|行动能力评分|
|13 |瓦尔德(1945)。“序贯分析”|证据积累,最佳停止|
|14 |香农(1948)。“通信数学理论”|信息增益,熵|
|15|McClelland等人(1995)。“互补学习系统”|记忆共生|
|16|DeepSeek(2025)。“思想论”|反过度思考|
|17 |赞加里(1994)。“EWMA风险管理”|自适应阿尔法下限|
|18 |索尔顿(1975)。“向量空间模型”|TF-IDF余弦相似度|
|19 |塔扬(1972)。“深度优先搜索和线性图算法”|SCC循环检测|
|20|Lempel和Ziv(1976)。“有限序列的复杂性”|LZ76复杂性度量|
|21 | Press等人(2022)。“列车短,测试长”|深度退化|
|22 |第578页(2019)。“Python运行时审计钩子”|沙盒安全层|
|23 | Cilibrasi和Vitányi(2005)。“压缩聚类”——IEEE TIT|模式崩溃检测|
|24 |卡恩(1962)。“大网络拓扑排序”——CACM|DAG最长路径|
|25|Besta等人(2024)。“思维图谱”——苏黎世联邦理工学院|GoT DAG拓扑|
|26|Greenblatt等人(2024)。“Sycophancy to Subperfuge”--arXiv:2406.10162|奖励游戏检测|
|27 |孙等人(2024)。“思维图”——arXiv:2409.10038|DAG形式化|
|28 |周等(2025)。“Fin PRM”| Softmax门控注意力|
|29 |佩奇(1954)。“连续检查方案”|CUSUM变化点检测|
|30 |松香与银(2011)。“PUCT算法”|MCTS探索策略|
______________________________________________________________________
## 许可证
[CC BY NC 4.0](https://creativecommons.org/licenses/by-nc/4.0/) --免费使用和修改, **非商业用途**.
______________________________________________________________________
## 作者
**莱安德罗·佩雷斯G。**
- github: [@LeandroPG19](https://github.com/LeandroPG19)
- 电子邮件: [leandropatodo@gmail.com](mailto:leandropatodo@gmail.com)