人工智能知识中心
AI知识中心是一个本地与云端集成的自动化环境,它结合了 OpenWebUI(中文可译为“开放网页用户界面”), Groq(注:这是一个专有名词,通常不进行翻译,保持原样。在某些语境下,如果需要解释其含义或背景,可以添加说明,但在此直接给出译文), 火爬行(或译为“火焰爬行者”,具体译名可能根据上下文调整),以及 Ollama(注:Ollama是一个用于训练和运行大型语言模型的开源工具,此处直接保留原名,不进行意译) 用于智能数据抓取、知识管理以及AI辅助自动化。
这个项目利用了 模型上下文协议(MCP) 框架,使人工智能模型能够直接与外部工具和应用程序编程接口(API)进行交互。\ 通过Groq的MCP兼容响应API和Firecrawl的MCP服务器,它实现了AI相关数据的自动检索、总结和组织,并将其同步到可通过OpenWebUI访问的知识库中。
______________________________________________________________________
目的
该项目的目的是提供一个统一、模块化的系统,用于:
- 跑步 OpenWebUI 通过NVIDIA Docker在本地使用GPU加速。
- 整合 Groq API 用于高速推理的、具备推理能力的大型语言模型(LLM)推理。
- 通过自动化实现网页抓取和摘要生成任务 Firecrawl API.
- 将所有收集到的数据整理到一个本地目录中,以便 OpenWebUI知识同步。
- 同时启用两者 本地和基于云的AI模型 在一个环境中无缝协作。
这种设置非常适合研究、人工智能知识整合以及利用大型语言模型(LLM)驱动的自动化进行实验。
______________________________________________________________________
特点/功能
- 自动化数据抓取
- harvest_ai_models.js从Hugging Face抓取热门的AI模型。 - harvest_reddit_ai.js抓取与人工智能相关的Reddit子版块讨论。 - harvest_investor_news_firecrawl.js抓取金融与投资新闻及市场情绪。
- 持续输出管理
- 在(某个位置/目录下)组织了子目录 /outputs 对于每个数据源。 - 可选的实时挂载到OpenWebUI /uploads 用于自动同步的文件夹。
- 多模型支持
- 使用Ollama进行本地推理(例如。, gemma3:4b 或者 llama3:8b)。 - 通过Groq进行云端推理(例如。, gpt-oss-120b, llama-3.1-70b)。
- GPU加速
- 集成NVIDIA驱动程序支持,以提升本地大型语言模型(LLM)性能。
- 容器化环境
- 单身 docker-compose.yml 处理构建、运行和持久化。
- 安全配置
- .env 文件管理API密钥和模型配置。
展示台;陈列柜
- 金融新闻概要来自 投资者Ne - 使用Groq的GPT-OSS-120b和Firecrawl进行MCP网页抓取,通过本地Llama3.3-70b基础模型结合知识/系统提示进行总结
- 
- 基于定制化Llama3.3-70b的AI研究员模型对Huggingface.co及AI与LLM子版块的新帖子进行总结与分析。
- 
- MCP 提示 -> 抓取 -> 自动化总结执行过程
- 
______________________________________________________________________
目录结构
ai_knowledge_hub/
│
├── docker-compose.yml # Docker setup for OpenWebUI with GPU + mounts
├── harvest_ai_models.js # Scraper for Hugging Face trending models
├── harvest_reddit_ai.js # Scraper for Reddit AI communities
├── package.json # Node dependencies for scraper scripts
├── .env # Environment variables (not committed)
├── .env.example # Example environment file for setup
├── outputs/ # Auto-generated data folder
│ ├── RedditAI/
│ └── AI_Models/
└── README.md # Project documentation______________________________________________________________________
安装说明
1. 克隆仓库
git clone https://github.com/hieudku/ai-knowledge-hub.git
cd ai-knowledge-hub______________________________________________________________________
2. 创建环境变量
复制这个示例 .env 文件并编辑您的API凭证:
cp .env.example .env然后打开 .env 并插入您的实际密钥:
GROQ_API_KEY=your_groq_api_key_here
FIRECRAWL_API_KEY=your_firecrawl_api_key_here
OLLAMA_API_BASE_URL=http://host.docker.internal:11434
DEFAULT_MODEL=choose_your_own_local_model
ENABLE_MCP_SERVERS=true
NVIDIA_VISIBLE_DEVICES=all
NVIDIA_DRIVER_CAPABILITIES=compute,utility______________________________________________________________________
3. 启动Docker容器
docker compose up -d运行后,请访问:
http://localhost:3000现在,您将能够运行带有GPU加速的OpenWebUI,同时支持与本地Ollama的连接,并提供Groq和Firecrawl的集成,用于网页抓取和模型推理。
______________________________________________________________________
4. 运行收获脚本
Node.js脚本实现了数据抓取的自动化,并将输出结果馈送到OpenWebUI挂载的知识路径中。
抓取热门AI模型
node harvest_ai_models.js抓取AI相关Subreddits(论坛板块)
node harvest_reddit_ai.js所有抓取的数据将自动保存至:
outputs/AI_Models/
outputs/RedditAI/如果你的Docker容器挂载了这个文件夹(如在配置中所指定的那样) docker-compose.yml), 文件将自动出现在OpenWebUI的内部 知识 → 同步目录 用于即时索引。
______________________________________________________________________
环境文件参考
示例 .env 变量:
# API Integrations
GROQ_API_KEY=
FIRECRAWL_API_KEY=
# Local Ollama Configuration
OLLAMA_API_BASE_URL=http://host.docker.internal:11434
DEFAULT_MODEL=gemma3:4b
# External MCP Integration
ENABLE_MCP_SERVERS=true
# GPU Configuration
NVIDIA_VISIBLE_DEVICES=all
NVIDIA_DRIVER_CAPABILITIES=compute,utility______________________________________________________________________
Docker 配置概览
你的 docker-compose.yml 处理所有服务和卷挂载:
version: "3.9"
services:
openwebui:
image: ghcr.io/open-webui/open-webui:latest
container_name: openwebui
restart: unless-stopped
ports:
- "3000:8080"
env_file:
- .env
deploy:
resources:
reservations:
devices:
- driver: nvidia
count: all
capabilities: [gpu]
volumes:
- ollama:/root/.ollama
- openwebui_data:/app/backend/data
- C:/Users/hieuc/ai_knowledge_hub/outputs:/app/backend/data/uploads/mounted-scrapping
volumes:
ollama:
openwebui_data:______________________________________________________________________
架构概述
人工智能知识中心 整合多个系统:
| 组件 | 角色 | 描述 |
|---|---|---|
| OpenWebUI | 前端界面 | 用于本地和外部大型语言模型(LLM)的聊天用户界面 |
| Ollama(注:Ollama是一个用于本地运行大型语言模型的工具或框架,直接翻译可能无法准确传达其含义,但在此处保留原英文以保持专业性,同时根据语境可理解为“奥拉玛”或直接以其英文名指代。) | 本地推理 | 在本地运行小型到中型的开源模型 |
| Groq API | 云推理 | 提供超快速推理模型(例如,GPT-OSS-120B) |
| 火爬行者(或根据上下文可译为“火蚁”、“火行者”等,具体译法需结合语境) 网络抓取API | 自动提取和总结网页内容 | |
| 收获脚本 | 自动化层 | 获取并保存AI内容至 /outputs/ |
| Docker Compose | 部署编排器 | 使用GPU和持久卷构建并运行系统 |
______________________________________________________________________
推荐使用流程
- 使用 Docker Compose 启动 OpenWebUI。
- 运行抓取脚本(
harvest_ai_models.js或者harvest_reddit_ai.js)。 - 文件将出现在挂载点中
/uploads/容器内的文件夹。 - 打开 OpenWebUI → *知识标签页* 同步或刷新您的目录。
- 使用最新的上下文知识查询你的大型语言模型(如Groq、Ollama等)。
______________________________________________________________________
安全与最佳实践
- Do(做) 不是 坚定你的(决心/承诺等,具体根据上下文确定)
.env文件。 - 仅创建和分享
.env.example带有占位符键。 - 在Groq和Firecrawl仪表板上查看并限制您的API使用限制。
- 如果要公开暴露您的实例,请在OpenWebUI设置中配置身份验证。
- 定期备份您的
outputs/如果你依赖长期数据积累,那么请查看目录。
______________________________________________________________________
故障排除
| 问题 | 可能原因 | 解决方案 | ||||
|---|---|---|---|---|---|---|
| (无) | (无) | (无) | nvidia-container-toolkit | 容器启动失败 | 缺少NVIDIA运行时或GPU驱动程序 | 安装 |
OLLAMA_API_BASE_URL | Ollama 网络问题 | 主机绑定错误 | 确保 http://host.docker.internal:11434 使用 | |||
.env 根据上面的信息,执行如下指令: | ||||||
| 文件值 | outputs/ | OpenWebUI中无抓取数据 | 挂载路径不匹配 | 确保主机 /app/backend/data/uploads 被映射到 |
______________________________________________________________________
|
许可证\ 此项目仅供教育和研究用途发布。\ 您可以自由修改或扩展它,用于本地人工智能开发或内部工具构建。
______________________________________________________________________
所有依赖项均受其各自许可证的约束。
致谢/功劳/贡献\ 由Hieu Cu开发并维护。 结合来自(某处)的开源组件OpenWebUI ,Ollama(注:Ollama是一个开源的机器学习框架,用于训练和部署机器学习模型,此处直接音译为“奥拉玛”,但具体翻译可能需根据上下文或品牌官方译名调整。) ,Groq ,以及 火爬行者(或根据上下文可译为“火蜥蜴”、“火虫”等,具体译名需结合语境确定)
