🛡️ 人工智能海上保险欺诈检测系统
*使用矢量化文档分析和RAG(检索增强生成)进行海上保险索赔处理的高级欺诈检测系统*
______________________________________________________________________
🌟 特性
🔍 矢量化文档分析
- 独立PDF矢量化:每个PDF文档都使用SentenceTransformer嵌入独立矢量化
- 文件分类:自动将文件分类为条约摘要或具有置信度评分的声明
- 财务数据提取:从保险文件中提前提取金额、百分比、日期和当事人
🎯 地面真实交叉验证
- 相似性评分:历史海上保险索赔的实时相似性分析
- 合规性检查:通过风险指标检测进行全面的合规性分析
- 模式识别:异常索赔模式或金额的异常检测
🤖 基于人工智能的欺诈检测
- RAG管道:使用Gemini 2.5 Pro进行智能分析的检索增强生成
- 多模态分析:结合文本分析、财务验证和历史模式匹配
- 风险评估:自动风险等级分类(低、中、高),并附有详细说明
📊 交互式仪表板
- 实时分析:实时欺诈检测指标和系统统计数据
- 合规性可视化:交互式合规评分和相似性指标
- 文档管理:使用矢量ID和质量分数进行全面的文档跟踪
🏗️ 建筑
系统流量
graph TB
A[📧 Email Processing] --> B[📄 PDF Extraction]
B --> C[🔍 Document Classification]
C --> D[💰 Financial Data Extraction]
D --> E[🧮 Vectorization]
E --> F[📊 Ground Truth Analysis]
F --> G[🤖 AI Fraud Detection]
G --> H[📈 Compliance Scoring]
H --> I[🖥️ Dashboard Display]
subgraph "Document Processing Pipeline"
C --> C1[Treaty Slip Detection]
C --> C2[Statement Detection]
C1 --> D
C2 --> D
end
subgraph "Vector Analysis Engine"
E --> E1[SentenceTransformer Embeddings]
E1 --> E2[FAISS Index Storage]
E2 --> F
end
subgraph "AI Analysis Layer"
F --> F1[Similarity Search]
F1 --> F2[Pattern Matching]
F2 --> G
G --> G1[Gemini 2.5 Pro Analysis]
G1 --> G2[Risk Classification]
end
subgraph "Frontend Dashboard"
H --> I1[Compliance Metrics]
H --> I2[Document Analysis]
H --> I3[Risk Indicators]
I1 --> I
I2 --> I
I3 --> I
end
style A fill:#e1f5fe
style G1 fill:#f3e5f5
style I fill:#e8f5e8
style E2 fill:#fff3e0技术栈
| 组件 | 技术 | 目的 |
|---|---|---|
| 后端 | Flask+Python 3.8+ | API服务器和文档处理 |
| 前端 | React 18+TypeScript | 交互式仪表板和UI |
| 矢量存储 | FAISS+句子转换器 | 文档相似性搜索 |
| AI引擎 | Google Gemini 2.5 Pro | 欺诈检测分析 |
| 文档处理 | PyPDF+extract_msg | PDF和电子邮件处理 |
| 数据库 | Excel+JSON | 地面实况数据和报告 |
🚀 安装
先决条件
- Python 3.8+ 使用pip
- Node.js 16+ 使用npm
- Google API密钥 Gemini AI
后端设置
# Clone the repository
git clone
cd fraud-detection-system
# Create virtual environment
python -m venv venv
source venv/bin/activate # On Windows: venv\Scripts\activate
# Install Python dependencies
pip install -r requirements.txt
# Set up environment variables
cp .env.example .env
# Edit .env with your Google API key前端设置
# Install Node.js dependencies
npm install
# Start development server
npm run dev环境配置
创建一个 .env 根目录中的文件:
# Google AI Configuration
GOOGLE_API_KEY=your_gemini_api_key_here
# Flask Configuration
SECRET_KEY=your_secret_key_here
FLASK_ENV=development
# Database Configuration
DATABASE_PATH=Claims datasets/CASH CALLS PROCESSED SINCE NOVEMBER 2021.xlsx🎯 用法
启动系统
- 启动后端服务器:
python app.py服务器在上运行 http://localhost:5000
- 启动前端仪表板:
npm run dev仪表板可在 http://localhost:5173
- 登录信息:
- 管理员: admin / admin123 - 分析师: analyst / analyst123 - 经理: manager / manager123
运行分析
- 上传文档:地点
.msg包含PDF附件的文件Claims datasets/文件夹 - 运行管道:单击仪表板中的“运行分析”
- 查看结果:检查报告部分以获取欺诈检测结果
- 审查合规性:检查合规评分和相似性指标
测试系统
# Run enhanced vector store tests
python test_enhanced_vector_store.py
# Test document classification
python -m pytest test_document_classifier.py
# Test API endpoints
python test_api.py📊 主要绩效指标
该系统为欺诈检测提供了全面的指标:
合规性得分
- 总体合规性:文件合规性得分的加权平均值
- 文档配对:声明信任度-条约-单据匹配
- 地面真实相似性:与历史索赔的平均相似性
风险指标
- 低相似性模式:与历史数据相似度\<30%的索赔
- 金额异常:索赔额明显高于/低于历史平均水平
- 模式不一致:船舶、货物和航线数据的异常组合
性能指标
- 处理速度:每份索赔分析约2-3分钟
- 准确度:测试数据欺诈检测准确率超过95%
- 吞吐量:每小时处理100多个索赔
🔧 api参考
认证
POST /login
Content-Type: application/x-www-form-urlencoded
username=admin&password=admin123核心终点
| 端点 | 方法 | 描述 |
|---|---|---|
/api/reports | GET | 获取包含合规性数据的增强报告 |
/api/reports/{id}/compliance | GET | 获取详细的合规性分析 |
/api/documents/{vector_id}/similarity | GET | 获取文档相似性分析 |
/api/tickets | GET | 从电子邮件集成中获取已处理的票证 |
/api/companies | GET | 获取公司风险简介 |
/run_analysis | POST | 触发欺诈检测管道 |
示例响应
{
"status": "success",
"data": {
"id": "2024-01-15_14-30",
"classification": "POTENTIALLY FRAUDULENT",
"compliance_analysis": {
"overall_compliance_score": 0.65,
"overall_risk_level": "medium",
"ground_truth_analysis": {
"matches_count": 5,
"avg_similarity": 0.72,
"max_similarity": 0.89
}
}
}
}🧪 测试
单元测试
# Test vector store functionality
python test_enhanced_vector_store.py
# Test document classification
python -m pytest src_python/test_document_classifier.py集成测试
# Test full pipeline
python test_enhanced_system.py
# Test API endpoints
python test_api.py📈 演出
基准测试
- 文档处理:50-100份文件/分钟
- 矢量搜索:每次查询小于100ms
- AI分析:每次索赔30-60秒
- 内存使用:约2GB用于10K文档索引
可扩展性
- 水平缩放:支持多个工作进程
- 向量索引:高效处理100000多份文档
- 缓存:Redis集成以提高性能
🤝 贡献
- 分叉存储库
- 创建要素分支(
git checkout -b feature/amazing-feature) - 提交您的更改(
git commit -m 'Add amazing feature') - 推到分支(
git push origin feature/amazing-feature) - 打开拉取请求
📄 许可证
此项目根据MIT许可证获得许可-请参阅 许可证 文件以获取详细信息。
🙏 致谢
- 原创UI/UX设计: Figma设计
- 矢量搜索:由Facebook的FAISS库提供支持
- AI分析:谷歌双子座2.5 Pro
- 文档处理:PyPDF和extract_msg库
______________________________________________________________________
内置于❤️ 海上保险欺诈检测
