SCM法律概念瓶颈
概念验证 --小概念模型应用于西班牙裔美国司法管辖区的法律推理。
*“与其预测下一个令牌,不如强迫模型回答:这篇文章激活了哪些法律原则,有多强?”*
______________________________________________________________________
理论背景
该存储库实现了以下核心架构思想:
莱勒,I.A.(2025)。 小概念模型:西班牙裔美国司法管辖区法律人工智能的专业框架.SSRN 5555478。 https://papers.ssrn.com/sol3/papers.cfm?abstract_id=5555478
该框架直接借鉴了:
Barrault等人(2024)。 大概念模型:句子表示空间中的语言建模元公平。 https://arxiv.org/abs/2412.08821
核心思想
标准LLM在 令牌空间:一个约100000维的词汇表,其中每个正向传递通过统计模式匹配预测下一个令牌。这会产生流畅的文本,但会使推理变得不透明和不确定——对同一法律问题进行两次运行可能会产生相互矛盾的答案。
该系统在以下情况下运行 概念空间世界法律原则的24维空间。每一份法律文本都基于这一固定基础。输出不是散文,而是\[0,1\]²中的分数向量⁴ — 完全可审计,跨文档可比,可复制。
Token Space (LLM): "El contrato..." → [token₁, token₂, ...] → fluent text (stochastic)
Concept Space (SCM): "El contrato..." → [AbusoDerecho: 0.91, BuenaFe: 0.12, ...] (deterministic)这类似于LCM(Barrault等人,2024)在句子嵌入空间而不是单词级标记空间中的操作方式——通过更高层次的抽象推理实现跨语言泛化。SCM将同样的见解应用于法律推理:概念,而不是符号,是法律分析的正确单位。
24项普遍法律原则(勒勒架构)
| # | 原理 | 领域 |
|---|---|---|
| 1 | 合法性 | 宪法 |
| 2 | Igualdad | 宪法 |
| 3 | 尊严人权 | 宪法 |
| 4 | 等级制度 | 宪法 |
| 5 | 布埃纳菲 | 民用/商用 |
| 6 | 合法企业 | 民事/行政 |
7.诺达纳尔。民事。 |8|刑事诉讼|行政/刑事诉讼| |9|公平|民商| |10 | AbusoDerecho |民事/商事| |11|责任|民商| |12|Noenriquecimentosincausa|平民| |13|团结|社会/劳工| |14|正当程序|程序| |15 |预防接种|刑事/行政| |16|不溯及既往|宪法| |17 | InDubioProHomine |人权| |18 |自治自愿|民用/商用| |19 | PactaSuntServanda |民用/商用| |20 | Integridad |道德/专业| |21 | TratoDigno |劳动力/消费者| |22|广告|行政| |23 |动议|行政/司法| |24 | TutelaJudicial Efectiva |程序|
______________________________________________________________________
建筑
Input text
│
▼
┌─────────────────────────────────────────┐
│ Concept Bottleneck │
│ GPT-4o + Zod Structured Outputs │
│ Triple-run consensus (3x parallel) │
│ Output: vector ∈ [0,1]²⁴ │
└─────────────────────────────────────────┘
│
├── principles_scores: { AbusoDerecho: 0.91, BuenaFe: 0.12, ... }
├── confidence_score: 0.87
├── confidence_spread: { AbusoDerecho: 0.03, ... } ← inter-run variance
├── summary: "factual summary"
└── schema_version: "2.1.0"三重运行共识:每次评估并行运行三次对GPT-4o的独立调用,并对得分进行平均。这 confidence_spread field报告了三次运行中每个原则的最大最小范围。点差>0.15表示评估文本中的语义不稳定。
MCP集成:该引擎作为MCP(模型上下文协议)工具公开,允许Claude Desktop或Cursor在生成任何法律分析之前调用它——将LLM的推理锚定在基于原则的输出中,而不是自由的统计生成中。
______________________________________________________________________
快速开始
需求
- Node.js>=18
- 可访问的OpenAI API密钥
gpt-4o
安装
git clone https://github.com/adrianlerer/omnibrain-mcp.git
cd omnibrain-mcp
npm install
cp .env.example .env # Add your OPENAI_API_KEY运行演示(不需要Claude)
npm run demo预期产量:
Active principles (score >= 0.3):
AbusoDerecho ████████████████████ 0.912 spread=0.021
DebidoProceso ██████████████░░░░░░ 0.731 spread=0.043
TutelaJudicialEfectiva █████████░░░░░░░░░░░ 0.448 spread=0.089
Proporcionalidad ████░░░░░░░░░░░░░░░░ 0.221 spread=0.034
Summary: The clause forces the counterparty to waive due process rights...
Global confidence: 0.841
Schema version: 2.1.0构建并连接到Claude Desktop
npm run build添加到您的Claude桌面配置(~/Library/Application Support/Claude/claude_desktop_config.json):
{
"mcpServers": {
"scm-legal": {
"command": "node",
"args": ["/absolute/path/to/omnibrain-mcp/dist/index.js"],
"env": {
"OPENAI_API_KEY": ""
}
}
}
}然后问克劳德: *“使用SCM概念瓶颈评估此合同条款。”*
______________________________________________________________________
与OmniBrain的关系
此存储库是 纯SCM引擎:仅概念提取,无持久性。
完整的系统——包括矢量存储(pgvector/Supabase)、批量文档索引器和按原则分数的混合检索——位于:
adrianlerer/omnibrain-pro--私人生产系统adrianlerer/scm-omnibrain-pipeline--管道集成
这种分离是有意的:概念瓶颈是一个独立的推理层。OmniBrain是消耗它的记忆层。
______________________________________________________________________
引用这项工作
@article{lerer2025scm,
title = {Small Concept Models: A Specialized Framework for
Legal AI in Hispanic-American Jurisdictions},
author = {Lerer, Ignacio Adrián},
year = {2025},
month = {10},
journal = {SSRN},
note = {SSRN 5555478},
url = {https://papers.ssrn.com/sol3/papers.cfm?abstract_id=5555478}
}______________________________________________________________________
许可证
麻省理工学院——见 许可证.
