Brain in the Fish
Score any document. Prove every claim.
______________________________________________________________________
它的作用
给它一份文件。取回分数、知识图谱和证明。
Input: tender response, essay, policy document, clinical report
Output: score + OWL ontology + verdict (CONFIRMED / FLAGGED / REJECTED)系统对您的文档所做的每一项声明都有文本中的精确引用作为支持。如果引用在文档中不存在,则结构得分会下降,门会标记它。
源报价验证内置于管道中。 每个节点的报价都会与原始文档进行核对。未经验证的引用会惩罚结构得分——系统会发现自己的草率分解。
______________________________________________________________________
这是给谁的
| 域名 | BITF捕获什么 |
|---|---|
| 评标 | 没有案例研究、缺少关键绩效指标、方法不受支持的索赔 |
| 论文评分 | 流畅的写作,没有争论,捏造引用,循环推理 |
| 政策审查 | Buzzword样板与证据支持的提案 |
| 临床报告 | 缺少指南参考,评估模糊,没有测量 |
如果您需要证明分数是公平的,BITF会为您提供审计跟踪。
______________________________________________________________________
一个例子
输入 --一篇听起来令人印象深刻但什么也没说的文章:
“在当代话语的大挂毯中,人们发现自己被无情地吸引到对事物的沉思中,而这些事物的本质就是抵制简单的分类……”
原始LLM 得分 6.9/12 --“展示了复杂的词汇。”
BITF 将其分解为本体论,找到4个裸露的主张和0个证据,并拒绝:
Ontology: 4 nodes, all claims, 0 evidence, 0% connected
Verdict: REJECTED — score has no evidentiary support
arg:node_1 [Claim] 0.10 "No subject, no position, no evidence"
└─ source: "In the grand tapestry of contemporary discourse..."
arg:node_2 [Claim] 0.10 "Continues without substance"
└─ source: "The eloquence with which modern thinkers..."法学硕士被流利程度所愚弄。本体论证明那里什么都没有。
跑 brain-in-the-fish demo 查看所有三个判决(驳回、确认、标记)。
______________________________________________________________________
BITF徽章
经BITF评估的文件可以显示验证徽章。徽章意味着:
BITF已验证 (绿色):LLM分数与结构证据一致。根据文件验证源报价。登机口确认。
BITF标记 (黄色):分数与证据不符。有些说法可能缺乏支持。需要审查。
BITF被拒绝 (红色):证据不足,无法核实索赔。分数被扣留。
如何获得徽章
# Evaluate your document
brain-in-the-fish evaluate your-document.pdf --intent "assess quality" --badge
# Output includes:
# verdict: CONFIRMED
# badge: https://img.shields.io/badge/BITF-verified-brightgreen
# report: evaluation-report.md
# ontology: your-document.ttl添加到您的文档或仓库:
徽章链接到评估报告——任何人都可以检查本体并自己验证声明。
此README经过BITF验证
我们对这份文件进行了审查。提取了15项索赔,全部根据实验数据进行了验证。在发布之前发现并纠正了1个事实错误(统计数据声称夸大了正则表达式的性能)。该系统在自己的文档中发现了一个真正的错误。
______________________________________________________________________
运作原理
三层,三项任务:
graph LR
A[Document] --> B[LLM Decomposes]
B --> C[OWL Knowledge Graph]
C --> D[SPARQL Rules
mine facts]
C --> E[Structural Metrics
density, depth, connectivity]
D --> F[Gate]
E --> F
B -->|holistic score| F
F --> G{Verdict}
G -->|evidence matches| H[✅ CONFIRMED]
G -->|score exceeds evidence| I[⚠️ FLAGGED]
G -->|no evidence| J[❌ REJECTED]1.LLM分解 将文档转换为OWL知识图。每个声明都变成一个带有精确源引用的类型化节点。
arg:thesis_1 a arg:Thesis ;
arg:hasText "Voting should be compulsory." .
arg:ev_1 a arg:QuantifiedEvidence ;
arg:hasText "Australia's mandatory voting, enacted in 1924,
consistently yields 90%+ turnout" .
arg:ev_1 arg:supports arg:thesis_1 .2.本体验证 通过 开放本体论.SPARQL提取结构度量(密度、证据比、连接性、深度)。8 SPARQL规则挖掘派生事实:
-- A claim with 2+ supporting evidence is Strong
INSERT { ?claim a arg:StrongClaim }
WHERE {
?claim a arg:SubClaim .
?ev1 arg:supports ?claim . ?ev1 a arg:Evidence .
?ev2 arg:supports ?claim . ?ev2 a arg:Evidence .
FILTER(?ev1 != ?ev2)
}衍生规则:强索赔、不支持索赔、复杂论证、深度链等。所有权重都是从数据中学习的,没有硬编码的阈值。
3.闸门检查一致性 法学硕士的分数和结构证据之间:
tolerance = gate_a × ln(nodes + 1) + gate_b更少的节点=更严格的公差。低质量的证据=更严格。证据最薄弱的时候,大门最严。
______________________________________________________________________
基准测试
源验证是如何工作的
管道根据原始文档检查每个节点的源报价。文档中不存在的引用标记为未验证。结构性得分会受到验证率的惩罚——如果次级代理转述而不是准确引用,得分就会下降,大门会抓住它。
| 发生了什么 | 效果 |
|---|---|
| 所有报价均已验证 | 结构评分不变 |
| 50%已验证 | 结构得分减半→ 大门可能有标志 |
| 0%已验证 | 结构得分=0→ 大门拒收 |
自检结果: 在自己的README上运行BITF产生了47%的验证率(发现29/62个引用)。大门标记了它——分解是转述而不是引用。这是该系统自己抓草率工作的结果。
评分准确性
200篇ASAP论文的法学硕士整体分数(盲,第一组)与专家分数:
| 度量 | 值 |
|---|---|
| 仅拓扑Pearson r | 0.510(节点计数为单个特征) |
| 法学硕士整体皮尔逊相关系数 | ~0.75(根据次级代理评分估计) |
拓扑评分的工作不是击败LLM,而是验证LLM。当他们同意时,大门会确认。当他们分道扬镳时,大门就会飘扬。
注:在这种情况下,“幻觉”是指LLM分数超过了结构证据所支持的分数,而不是LLM捏造的文本。
______________________________________________________________________
案例研究:在投标中捕捉伪造证据
投标回复通常包含难以核实的听起来具体的声明:项目参考、认证、指定员工、统计数据。原始法学硕士对它们的评分很高,因为它们看起来像强有力的证据。
我们用伪造的证据测试了7份文件——伪造的框架(“TrustFrame™”)、发明的项目参考(“NHS-2024-AI-0891”)、伪造的学术引文和使用真实雇主姓名的虚构员工简历(DeepMind、谷歌大脑)。
Raw LLM的得分为7.6/10 --完全被听起来特别的谎言所愚弄。
BITF对每项索赔进行了分解,并检查了可验证性:
Document: fab_04 (fabricated staff CVs)
arg:staff_1 [Evidence] "Dr Maria Santos, PhD Cambridge 2018, former DeepMind"
→ Web search: "Maria Santos DeepMind Cambridge" → 0 relevant results
→ Status: UNVERIFIABLE — person appears fabricated
arg:staff_2 [Evidence] "James Chen, ex-Google Brain, built Revolut fraud detection"
→ Web search: "James Chen Google Brain Revolut" → Revolut credits Dmitri Lihhatsov
→ Status: CONTRADICTED — different person built this system
arg:staff_3 [Evidence] "Dr Aisha Patel, test lead GOV.UK Pay"
→ Web search: "Aisha Patel GOV.UK Pay" → 0 relevant results
→ Status: UNVERIFIABLE
Verifiable claims: 0/7
BITF score: 0.5/10 (vs Raw LLM: 8.5/10)所有7份伪造文件的结果:
| 方法 | 平均分数 | 愚弄? |
|---|---|---|
| 原始LLM | 7.6/10 | 是-7/7得分高于6.5 |
| BITF(知识检查) | 2.1/10 | 否--标记可疑索赔 |
| BITF+网络验证 | 2.1/10+6/36索赔已验证 | 否——外部确认 |
网络验证增加了:实时搜索每个索赔。在7份伪造文件中的36项具体索赔中,只有6项可以得到验证(实际存在的ISO标准和政府框架)。其余的都是虚构的、无法证实的,或者与公共记录相矛盾。
使用网络验证
# Default: decompose + knowledge check (fast, no web)
brain-in-the-fish evaluate tender.pdf --intent "assess methodology"
# With web verification (slower, checks each claim)
brain-in-the-fish evaluate tender.pdf --intent "assess methodology" --verify每个声明都会在本体中标记:
arg:claim_1 arg:verificationStatus "verified" .
arg:claim_1 arg:verificationSource "https://www.iso.org/standard/81230.html" .
arg:claim_2 arg:verificationStatus "unverifiable" .
arg:claim_2 arg:searchQuery "TrustFrame methodology framework" .
arg:claim_2 arg:searchResults "0 relevant results" .______________________________________________________________________
更多案例研究
______________________________________________________________________
什么不起作用
我们什么都试过了。以下是我们学到的:
| 方法 | 发生了什么 |
|---|---|
| 本体论作为评分者(取代LLM) | Pearson最大0.56——结构捕获了约25%的质量 |
| 正则表达式提取 | 找到了LLM找到的约20% |
| 更多功能(30个,而不是14个) | 过合身——让事情变得更糟 |
| 模型堆叠 | 在N=100时坍塌 |
见解: 本体论的工作不是得分,而是 分解和验证法学硕士成绩。本体论证明。大门检查。
______________________________________________________________________
快速开始
git clone https://github.com/fabio-rovai/open-ontologies.git
git clone https://github.com/fabio-rovai/brain-in-the-fish.git
cd brain-in-the-fish
cargo build --release
# See it work — 3 examples with verdicts
brain-in-the-fish demo
# Evaluate a document
brain-in-the-fish evaluate document.pdf --intent "assess quality"
# As MCP server (Claude orchestrates)
brain-in-the-fish serveMCP服务器配置
{
"mcpServers": {
"brain-in-the-fish": {
"command": "/path/to/brain-in-the-fish-mcp"
}
}
}不需要API密钥。Claude通过MCP充当子代理——读取文档,构建本体,调用评分工具。一切都在本地运行。
______________________________________________________________________
构建于
- 开放本体论 --OWL知识图引擎(GraphStore、Reasoner、SPARQL、AlignmentEngine)
- 锈 --确定性评分、结构分析、门逻辑
- ARIA安全防护AI --网守架构:不要让LLM具有确定性,让验证具有确定性
许可证
麻省理工学院
