Token导航 LogoToken导航TokenDH.com
Me Gpt (Adrianco) logo
搜索检索stdio官方级别未说明来源级核验

Me Gpt (Adrianco)

MCP Server

将个人公开内容(书籍、博客、演讲等)整合训练为能模仿作者风格回答问题的个性化大语言模型。

工具数

0

提示词数

0

GitHub Stars

285

资源数

0
PythonClaude搜索Claude DesktopClaudeCursor

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

作者 / 组织

adrianco

提供方

adrianco

最后核验

2026/5/17 20:22

运行时

Python

快速接入

先看主来源和安装命令,再打开仓库或文档;下面只保留这个条目的关键接入事实。

命令预览

python mcp_server.py --author virtual_adrianco

详细介绍

meGPT-将作者的内容上传到LLM

在我的职业生涯中,我制作和展示了20年的公共内容,我想拥有一个法学硕士学位,接受过培训,能够用我的“声音”回答问题并生成我的意见摘要。目前,我已经找到了几家正在建立个人形象的公司,并尝试了soopra.ai。为了鼓励这个领域的发展和竞争,我组织了我的公共内容和对这个回购中来源的引用。

我自己的内容存储或链接到authors/virtual_adrianco中,由以下部分组成:

  • 4本已出版书籍(提供两本pdf),约10本书籍前言,约100篇博客文章(文本)
  • 2008-2022年推特存档(对话文本)
  • Mastodon.social-2021年至今https://mastodon.social/@阿德里安科(RSS在https://mastodon.social/@adrianco.rss)
  • Github项目(代码)
  • 博客文章来自https://adrianco.medium.com作为文本提取到authors/virtual-adrianco/medium_posts(带提取脚本)
  • 博客文章来自https://perfcap.blogspot.com作为文本提取到authors/virtual-adrianco/blogger_percap_posts(使用提取脚本)
  • 约100张演示文稿(图片)最受欢迎:https://github.com/adrianco/slides/tree/master/Greatest%20Hits
  • 约20个播客(音频对话,应该是很好的问答培训材料)
  • 超过135个演讲和采访视频(音频/视频/UTube个人视频、播放列表和整个频道)

如果另一位作者想将此存储库用作起点,请克隆它并在authors下添加您自己的内容目录。如果你想免费贡献内容供其他人用作训练数据集,那么发送一个pull请求,我会把它包含在这里。代码目录中的脚本用于通过从帐户所有者必须下载的twitter或媒体存档中提取内容来帮助作者预处理内容。

知识共享——归属共享。明确授予任何人将其用作开发meGPT概念的训练集的权限。任何作者/演讲者/专家都可以免费使用,从而产生一个聊天机器人,可以像作者一样回答问题,并参考已发布的内容。我称自己构建的这个虚拟世界为adrianco,并就云计算、可持续性、性能工具、微服务、加速创新、Wardley映射、开源、混沌工程、弹性、Sun Microsystems、Netflix、AWS等发表了意见。我很乐意分享任何开发的模型。我不需要将其货币化,我已经半退休,并且已经成功地将这些内容货币化了,我不再为大公司工作了。.

我不是Python程序员

这个仓库中的所有代码最初都是由ChatGPT 4或Cursor-Claude Sonnet3.7的免费版本根据简短的提示编写的,没有后续的编辑,我在这里和那里花了几分钟的时间。我可以阅读Python,并且基本上能理解它,但我不是一个有经验的Python程序员。在相关问题中查找生成ChatGPT代码的聊天线程的公共链接。当我转换到Cursor时,我在每个文件的开头都将上下文作为块注释包含在内。这是一种低得离谱的摩擦和编写简单代码的简单方法。开发迁移到了Cursor,因为它有更好的方法来管理整个项目的上下文。

YouTube处理

YouTube处理器已得到增强,可以自动处理多种类型的YouTube内容:

支持的YouTube URL类型

  • 个人视频: https://www.youtube.com/watch?v=VIDEO_ID
  • 播放列表: https://www.youtube.com/playlist?list=PLAYLIST_ID
  • 整个频道: https://www.youtube.com/@username/videoshttps://www.youtube.com/c/channelname/videos

工艺特点

  • 自动检测:处理器自动检测URL是单个视频、播放列表还是频道
  • 批量加工:频道和播放列表会自动扩展为单个视频条目
  • 同意页面处理:自动处理YouTube的“继续之前”同意页面
  • 稳健提取:用于提取视频元数据和ID的多种回退方法
  • MCP兼容性:所有视频都保存为单独的MCP兼容JSON文件

YouTube下载

YouTube有严格的机器人检测措施,这可能会使自动下载变得具有挑战性。该脚本尝试了多种方法来处理YouTube内容:

  1. 首先,它试图直接从页面HTML中提取视频元数据
  2. 对于同意页面,它会自动提交同意书
  3. 使用多个正则表达式模式在页面源中查找视频ID
  4. 如果标准方法失败,则退回到替代提取方法
  5. 当无法提取单个视频时,为频道创建占位符条目

尽管采取了这些措施,但YouTube的机器人检测非常复杂,一些内容可能仍然无法自动处理。在这种情况下,处理器将创建引用原始URL的占位符条目。

为了获得最佳效果,您可以尝试:

  • 使用不同的网络(某些IP地址更有可能触发机器人检测)
  • 使用VPN
  • 来自移动网络的处理(通常限制较少)
  • 在YouTube系统限制较少的非高峰时段进行处理

示例用法

在你的 published_content.csv,您现在可以包含以下任何YouTube URL类型:

Kind,SubKind,What,Where,Published,URL
youtube,,Individual Tech Talk,Conference Name,2024,https://www.youtube.com/watch?v=VIDEO_ID
youtube,,My Tech Talks Playlist,Various Conferences,2024,https://www.youtube.com/playlist?list=PLAYLIST_ID
youtube,,My Complete YouTube Channel,Personal Channel,2024,https://www.youtube.com/@username/videos

处理器将自动将播放列表和频道扩展为单独的视频条目,使所有内容都可以通过MCP服务器进行搜索和访问。

增强的内容处理

内容处理系统得到了显著增强,可以处理复杂的内容结构和档案:

文件类型处理

系统现在支持CSV中的“文件”类型条目,这些条目指向包含多个内容文件的目录:

Kind,SubKind,What,Where,Published,URL
file,,Lots of blog post text extracted from medium archive,Medium Archive,2025,./authors/virtual_adrianco/medium_adrianco/
file,,Lots of blog post text extracted from blogger archive,Blogger Archive,2014,./authors/virtual_adrianco/blogger_perfcap_posts/

支持的存档格式

  • 媒体档案:自动检测 [URL] https://... 格式化并提取个人帖子
  • 博客档案:手柄 Title: ...\nURL: https://... 帖子摘录格式
  • 通用文本文件:处理具有URL提取功能的任何文本文件

工艺特点

  • 自动URL提取:在文本文件中查找各种格式的URL
  • 内容分类:分配适当的子类(medium_post、blogger_post等)
  • 摘要生成:自动为实质性内容创建摘要
  • 去重:防止多次处理同一内容
  • 错误处理:强大的处理能力和全面的日志记录

支持的内容类型

  • 油管:单个视频、播放列表、整个频道(135个项目)
  • 播客:附文字记录和摘要的剧集(52个项目)
  • 书籍:带摘录文本和摘要的PDF(10个项目)
  • 故事:带有可选附件的叙述性内容(18项)
  • 文件:博客档案、演示文稿、文档(394项)
  • InfoQ视频:技术专题介绍(2项)

总计: 611个内容项 通过MCP服务器处理和访问。

MCP服务器集成

该存储库现在包括一个全面的模型上下文协议(MCP)服务器,使AI应用程序可以访问内容集合。MCP服务器将处理后的内容转换为AI可访问的知识库。

当前内容统计(virtual_adrianco)

  • 总项目:611条内容
  • Youtube视频:135(单个视频、播放列表、频道)
  • 文件档案:394(中型帖子、博客帖子、演示文稿)
  • 播客节目:52(附成绩单和摘要)
  • 故事:18(叙述性内容)
  • 书籍:10(带摘录文本和摘要的PDF)
  • InfoQ视频:2(技术演示)

MCP服务器功能

  • 内容搜索:跨标题、标签和来源的语义搜索
  • 内容过滤:按类型、标记和元数据筛选
  • 分析:收集统计和内容分析
  • 人工智能集成:兼容克劳德桌面、光标、自定义AI代理
  • 多个传输:STDIO、HTTP和SSE支持

用法

# Start MCP server (default STDIO mode for Claude Desktop)
python mcp_server.py --author virtual_adrianco

# Start HTTP server for web applications
python mcp_server.py --author virtual_adrianco --transport streamable-http --port 8080

# Generate MCP resources for any author
python create_mcp.py virtual_adrianco

有关详细的测试和集成示例,请参阅 mcp_testing/ 目录。

建设一个作家

要使用此仓库,请将其克隆到本地磁盘,设置python环境,为作者运行build.py脚本,它将遍历该作者的已发布内容表,依次处理每一行。构建脚本将创建下载/ 并在其中创建一个state.json文件,记录成功的处理步骤,这样build.py的增量运行就不会重新运行相同的下载。每种数据都需要处理器目录中的相应脚本。

git clone https://github.com/adrianco/megpt.git
cd megpt
python3 -m venv venv

窗户:

venv\Scripts\activate

macOS/Linux:

source venv/bin/activate
pip install -r requirements.txt

如果在开发过程中安装了任何其他软件包,请通过以下方式重新生成需求

pip freeze > requirements.txt

运行构建脚本

Usage: build.py 
python build.py virtual_adrianco

出于测试目的,处理来自任意URL的单一类型数据,输出到下载,而不更新state.json文件

Usage: python process.py    

创建基于RAG的LLM角色

有关如何使RAG更好地工作的详细信息,请参阅此演示文稿https://github.com/datastaxdevs/conference-2024-devoxx/ 查看此问题https://github.com/adrianco/meGPT/issues/11对于我使用soopra.ai进行的实验,目前正在对该内容的一个子集进行训练,并在https://app.soopra.ai/Cockcroft/chat

当前功能状态

Build.py和process.py似乎运行正常。 bookprocessor.py正确下载书籍的pdf,并提取页面范围,以便挑选出相关部分,或分离多个作者。 每个故事下载都需要定制提取,新堆栈的正确div名称(thenewstack.io)已添加为子类,正确的文本内容下载适用于故事类型的内容。 中等博客下载是从作者可以请求的存档中处理到作者Medium_posts目录中的文本文件中的。 Blogger.com档案被处理成文本文件,其中包含原始故事的网址。 处理推特档案以从档案中提取对话,忽略除涉及多条推文的对话中的公共推文以外的任何内容。我使用的存档是在从Twitter到X的命名转换之前保存的。

备注

我已经整理了一段时间的内容,并将不时更新参考表和媒体下载https://github.com/adrianco/meGPT/blob/main/authors/virtual_adrianco/published_content.csv

YouTube视频本身有索引偏移的转录本,但转录本质量不好,只能由视频所有者通过API读取。使用pytube下载视频并用耳语处理它们更容易生成更精心策划的转录本,如果有多个演讲者,则可以识别作者何时发言。

Twitter存档-原始存档文件超过100MB,对于github来说太大了。extract_conversations脚本用于仅提取对话中的推文,以便对其进行进一步分析以找到问题和答案。执行此操作的代码由ChatGPT编写,首次运行,但如果输出有任何问题,我很乐意分享原始推文。提交一个问题。

Mastodon存档-以RSS提要的形式提供。

中型博客平台-提供最近十篇文章的RSS提要。存档下载由code/media_posts.py处理,以提取公共帖子的文本,忽略草稿。

已经创建了跟踪摄入处理代码开发的问题。

目录标签

目录标签

PythonClaude搜索个性化AI本地部署内容归档语音克隆RAG系统数字遗产

支持客户端

Claude DesktopClaudeCursor

接入字段

传输方式(transport,传输协议)

stdio

鉴权方式(authType,认证方式)

none

运行时(runtime,运行环境)

Python

工具数量(toolCount,工具数)

0

资源数量(resourceCount,资源数)

0

提示词数量(promptCount,提示词数)

0

权限和风险

stdionone部署方式未说明

接入前请确认传输方式、认证方式和部署位置,并根据实际工具能力限制访问范围。

安装前确认

不要直接授予不必要的文件、网络或账号权限;先核对安装命令和配置内容。

来源信息

继续浏览同类 MCP