Token导航 LogoToken导航TokenDH.com
Kubrick Multimodal Agent logo
搜索检索未说明官方级别未说明来源级核验

Kubrick Multimodal Agent

MCP Server

Kubrick AI是一个开源的多模态AI代理,能够处理图像、文本、音频和视频,适用于视频搜索、语义理解和实时交互等场景。

工具数

0

提示词数

0

GitHub Stars

0

资源数

0
开源工具PythonClaude视频处理Claude DesktopClaude

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

作者 / 组织

DharunKumar-G

提供方

DharunKumar-G

最后核验

2026/5/17 20:21

快速接入

先看主来源和安装命令,再打开仓库或文档;下面只保留这个条目的关键接入事实。

详细介绍

Kubrick AI — Multimodal MCP Agent

Hi Dave...

An AI Agent that can understand images, text, audio and videos.

A free, Open-source course by The Neural Maze and Neural Bits in collaboration with Pixeltable and Opik

______________________________________________________________________

🚀 实时部署

Kubrick部署在 Azure容器应用 (印度中部地区):

服务URL
🎬 库布里克UIhttps://kubrick-ui.ashydune-7443625c.centralindia.azurecontainerapps.io
⚡ 代理APIhttps://kubrick-api.ashydune-7443625c.centralindia.azurecontainerapps.io
🔌 MCP服务器内部(可在Azure容器应用程序环境中访问)

______________________________________________________________________

🛠️ 技术栈和功能

语言

语言用法
Python 3.12后端-MCP服务器、代理API、视频处理管道
TypeScript前端——基于React的聊天UI

框架和库

框架角色
FastMCP模型上下文协议服务器——向代理公开工具、提示和资源
快速API将UI连接到代理后端的RESTful API层
React 18+Vite具有实时视频交互的单页聊天应用程序UI
Tailwind CSS实用程序优先的响应式UI样式CSS框架
Groq SDKLlama 4 Scout和Maverick模型的LLM推理客户端
导师从LLM响应中提取结构化输出
像素表多模态数据处理——视频帧提取、嵌入和状态代理内存
句子转换器语义视频搜索的文本/图像嵌入生成
PyTorch+变压器用于视觉语言模型和嵌入的ML模型运行时
OpenAI SDK通过OpenAI API生成图像字幕和嵌入
PyAV(ffmpeg)视频解码、帧采样和剪辑提取

数据库和存储

技术目的
PostgreSQL(通过Pixeltable)用于视频元数据、帧嵌入和代理内存的嵌入式数据库
Azure共享卷跨MCP服务器、API和UI容器的共享媒体存储

基础设施和DevOps

工具角色
Docker&Docker编写通过共享网络将所有3项服务容器化
Azure容器应用云部署——自动扩展、托管容器
Azure容器注册表私有Docker镜像注册表
NginxUI的静态文件服务和反向代理
紫外线快速Python包管理器(取代pip/poetry)

可观察性和LLMOps

工具目的
Opik(彗星)LLM跟踪、提示版本控制和代理可观察性
MCP检查员在本地调试和测试MCP服务器工具/提示

核心功能

  • 🎥 视频处理流水线 --上传视频、提取帧、生成字幕和嵌入,并构建可搜索的视频索引
  • 🔍 语义视频搜索 --使用自然语言或图像查询视频以查找相关剪辑
  • 🤖 MCP工具使用代理 --Groq驱动的代理(Llama 4 Scout/Maverick),负责路由查询、选择工具和生成响应
  • 💬 实时聊天界面 --HAL 9000主题聊天界面,支持视频上传、图像附件和视频剪辑播放
  • 🧠 代理内存 --通过Pixeltable实现持久的对话记忆,用于上下文多回合交互
  • 📡 MCP协议 --通过流式HTTP使用工具、提示和资源实现完整的模型上下文协议

架构概述

┌─────────────┐     ┌──────────────┐     ┌──────────────┐
│  Kubrick UI │────▶│  Kubrick API │────▶│  Kubrick MCP │
│  (React)    │     │  (FastAPI)   │     │  (FastMCP)   │
│  Port 3000  │     │  Port 8080   │     │  Port 9090   │
└─────────────┘     └──────────────┘     └──────────────┘
                     │ Groq (LLM)         │ OpenAI (Embed)
                     │ Opik (Trace)       │ Pixeltable (DB)
                     │ Memory (PT)        │ PyTorch (ML)

______________________________________________________________________

📖 关于本课程

厌倦了那些只教你如何将现有的MCP服务器连接到Claude Desktop的教程吗?

是的,我们也是。

这就是为什么我们建造 库布里克AI,用于视频处理任务的MCP多模代理。对!你没看错。

💡 代理+视频处理。..和MCP!

本课程是The Neural Maze和Neural Bits(从现在开始称为“The Neural Bros”)之间的合作,专为希望超越基础知识并构建严肃的、可投入生产的人工智能系统的开发人员而设计。特别是,您将:

  • 了解如何使用Pixeltable和FastMCP构建用于视频处理的MCP服务器
  • 设计一个定制的、由Groq驱动的代理,通过其自己的MCP客户端连接到您的MCP服务器
  • 将您的代理系统与Opik集成,以实现完全可观察性和快速版本控制

🖊️ 你将学到

  • 了解如何使用Pixeltable进行多模式数据处理和有状态代理
  • 使用FastMCP创建复杂的MCP服务器:公开资源、提示和工具
  • 对MCP服务器应用提示版本控制(而不是在代理API中定义提示)
  • 了解如何为您的代理实施自定义MCP客户端
  • 使用Llama 4 Scout和Maverick作为LLM,从头开始实现MCP工具代理
  • 使用Opik进行MCP提示版本控制
  • 了解如何使用Opik实现自定义跟踪和监控
🚀 没有捷径。没有绒毛。让我们边做边学。

______________________________________________________________________

💻 你会做什么:

完成本课程后,您将学习如何设计和使代理能够在单个系统中理解跨图像、视频、音频和文本输入的多模式数据。

具体来说,您将获得:

  • 构建复杂的多模态处理流水线
  • 构建一个视频搜索引擎,并通过MCP(模型上下文协议)将其功能暴露给代理
  • 构建一个可用于生产的API来为代理提供动力。
  • 整合LLMOps原则和最佳软件工程实践。
  • 了解视频、嵌入、流式API、视觉语言模型(VLM)等。

完成本课程后,您将通过HAL主题的衍生产品构建自己的库布里克特工,扮演一对新眼睛和耳朵的角色:

______________________________________________________________________

入门指南

库布里克是 一个简单的教程。所以,要启动并运行这个系统,你需要先做几件事。

我们已经详细介绍了让你开始做这件事的步骤 GETTING_STARTED.md 文件。

💡 让库布里克跑步只是第一步!现在您已经启动并运行了它,是时候真正了解它的工作原理了(参见 课程大纲).

______________________________________________________________________

观看完整视频课程

______________________________________________________________________

🧑‍🎓 这门课程是为谁开设的?

通过从头开始自己构建,你将从这门课程中获得最大的收益。 课程组成部分的结构涵盖了关键概念,并演示了如何在此基础上构建,最终实现人工智能系统。

目标受众你将获得的技能
ML/AI工程师构建复杂的MCP服务器,学习将AI模型应用于视频、图像和语音。
软件工程师学习将AI组件与API连接起来,构建端到端的代理应用程序。
数据工程师/科学家学习设计人工智能系统,管理视频/音频/图像数据处理和结构。

无论你的经验或头衔如何,本课程旨在用你可以理解、学习和应用的实用术语和概念来解析复杂的主题,帮助你构建一个完整的人工智能系统。

🎓 先决条件

在本节中,我们概述了在学习本课程时提高学习体验的一些要求和好处。

类别标签描述
编程技能(初级)要求了解一般编程和Python语言语法。
AI/ML概念(初级)很高兴有了解AI、AI模型和AI系统背后的基本概念。
法学硕士、MCP、代理人很高兴有如果你了解他们,那就太好了,如果你不了解,那就没问题。我们将逐步教授和解释。
任何操作系统的笔记本电脑/PC要求AI模型推理都需要计算。为了克服这一点,我们将主要使用基于API的模型。

本课程的总体水平为初级/中级,但别担心。我们的目标是逐步解释为更多受众设计的每个组件。

💰 费用是多少?

感谢我们的赞助商Pixeltable和Opik,本课程及其材料是开源的,完全免费!

您将能够以最低的成本运行Kubrick示例。这是因为我们将使用OpenAI和Groq进行LLM和VLM通话,这些通话提供免费增值计划:

提供商免费积分
OpenAI首次注册5美元
Groq500000代币/天
\[!注意\]\ 在这个设置中,为了运行Kubrick Agent示例,免费增值计划就足够了。

📚 课程大纲

Kubrick Agent开源课程由五个综合模块组成,涵盖概念、系统设计、工具和实践实施。

为了充分利用这门课程,我们建议:

  • 克隆此存储库。
  • 按照每个模块的入门部分进行操作。
  • 阅读模块文章以了解每个组件。
  • 按照视频课程进行实践。
  • 设置代码并运行项目。

|模块号|深度课程(链接)|课程总结(3分钟)|描述|代码| | - | -------------- | ------------ | -------- | ----------- | | 0 | | 获取摘要 |课程介绍和概述。概述基本组件|N/A | 1 | | 获取摘要 |深入了解多模式处理管道的核心组件,涵盖视频、图像、文本和音频数据。 | 库布里克·麦克普 | 2 | | 获取摘要|使用FastMCP构建Kubrick MCP服务器。涵盖MCP协议(传输、通信)、功能、工具、资源和提示。添加Opik Integration和MCP Inspector,以实现高效调试和本地测试。 | 库布里克·麦克普 | 3 | | 获取摘要 |从头开始构建Kubrick MCP代理。使用Pixeltable实现内存层,使用FastMCP实现MCP客户端。了解如何将MCP工具转换为特定的提供商工具(Groq)| 库布里克api | 4 | | 获取摘要 |构建Groq代理,涵盖React UI-FastAPI API通信,并通过Opik(Comet)添加LLMOps可观察性和会话跟踪| 库布里克api | 5 | | 获取摘要 |免费开源库布里克课程的完整综述。|无

赞助商

像素表 是唯一一个为多模式数据提供增量存储、转换、索引和编排的Python框架。 | Opik LLM评估平台可帮助您构建、评估和优化运行更好、更快、更便宜的LLM系统

作者

Miguel Otero Pedrido

AI / ML Engineer

Alex Razvant

AI / ML Engineer

找到我们

发布描述订阅

神经比特 |了解行业标准和生产就绪的人工智能工程| | |

神经迷宫 |学习构建实际工作的人工智能系统,从原理到生产。每周三送达。 | |

目录标签

目录标签

开源工具PythonClaude视频处理多模态AI本地部署语义搜索AI代理

支持客户端

Claude DesktopClaude

接入字段

传输方式(transport,传输协议)

未说明

鉴权方式(authType,认证方式)

none

工具数量(toolCount,工具数)

0

资源数量(resourceCount,资源数)

0

提示词数量(promptCount,提示词数)

0

权限和风险

未说明none部署方式未说明

接入前请确认传输方式、认证方式和部署位置,并根据实际工具能力限制访问范围。

安装前确认

不要直接授予不必要的文件、网络或账号权限;先核对安装命令和配置内容。

仍需确认:installCommand

来源信息

继续浏览同类 MCP