贪吃者
面向AI的通用内容转换为Markdown
Gobbler将任何内容(YouTube视频、网页、文档、音频文件,甚至实时浏览器会话)转换为干净、结构化的标记,人工智能系统可以立即对其进行推理。
 
问题
人工智能助手在降价时工作得最好。但内容以无数种格式存在——PDF、视频、登录后的网页、录音。将内容转换为AI可以使用的格式需要:
- 每种内容类型都有不同的工具
- 用于提取和格式化的自定义脚本
- 元数据丢失和输出不一致
- AI代理没有统一的方式访问内容
Gobbler解决了这个问题。 一个工具,一种输出格式,多种访问模式。
解决方案
# Every content type → Same pattern → Same output format
gobbler youtube "https://youtube.com/watch?v=..." -o transcript.md
gobbler document report.pdf -o report.md
gobbler audio meeting.mp3 -o meeting.md
gobbler webpage "https://docs.example.com" -o docs.md每次转换都会产生 使用YAML frontmatter标记:
---
source: https://youtube.com/watch?v=VIDEO_ID
type: youtube_transcript
title: "Video Title"
duration: 847
word_count: 2341
converted_at: 2025-01-03T10:30:00Z
---
# Video Title
Content here, ready for AI consumption...快速开始
# Install
git clone https://github.com/Enablement-Engineering/gobbler.git
cd gobbler && make install
# Start services (for web/document conversion)
make start-docker
# Convert content
gobbler youtube "https://youtube.com/watch?v=dQw4w9WgXcQ"
gobbler document paper.pdf --no-ocr -o paper.md
gobbler audio interview.mp3 --model small -o interview.md📖 全部文件
使用Gobbler的三种方法
1.CLI(用于人和脚本)
gobbler youtube URL # YouTube transcripts
gobbler audio FILE # Audio/video transcription
gobbler document FILE # PDF, DOCX, PPTX, XLSX
gobbler webpage URL # Web pages (JS-rendered)
gobbler batch youtube-playlist URL # Batch processing2.技能(针对AI代理)
技能是markdown指令文件(SKILL.md)教AI代理如何使用 gobbler CLI。兼容:
skills/
├── gobbler-youtube/ # 📺 YouTube transcription
├── gobbler-audio/ # 🎙️ Audio/video transcription
├── gobbler-document/ # 📄 Document conversion (PDF, DOCX, PPTX, XLSX)
├── gobbler-webpage/ # 🌐 Web scraping with JS rendering
├── gobbler-browser/ # 🔌 Browser automation + AI chat integrations
├── gobbler-setup/ # 🔧 Installation and troubleshooting
└── gobbler-utils/ # 📦 Batch processing utilities每项技能包括 OpenClaw兼容元数据 对于自动依赖性检查:
metadata:
openclaw:
emoji: 📺
requires:
bins: [gobbler] # CLI tools that must be installed
install:
- id: gobbler
kind: script
label: Install Gobbler
script: |
git clone https://github.com/Enablement-Engineering/gobbler.git
cd gobbler && uv sync && uv tool install .使用OpenClaw:
# Copy skills to your OpenClaw workspace
cp -r skills/* ~/.openclaw/skills/
# Or symlink for development
ln -s $(pwd)/skills/* ~/.openclaw/skills/使用克劳德代码:
# Add skills directory to CLAUDE.md or workspace instructions
echo "Skills available in ./skills/" >> CLAUDE.md这 gobbler-browser 技能包括NotebookLM、Claude.ai、ChatGPT和Gemini的集成(DOM自动化-可能会因网站更新而中断)。
技能使用 渐进式披露--代理仅在启动时加载技能元数据,然后在触发时读取完整的CLI指令。
3.MCP协议(适用于AI编码助手)
# For Claude Code
claude mcp add gobbler-mcp -- uv --directory /path/to/gobbler run gobbler-mcp// For OpenCode (opencode.json)
{
"mcp": {
"gobbler": {
"type": "local",
"command": ["uv", "--directory", "/path/to/gobbler", "run", "gobbler-mcp"]
}
}
}// For Claude Desktop (~/.config/claude/claude_desktop_config.json)
{
"mcpServers": {
"gobbler-mcp": {
"command": "uv",
"args": ["--directory", "/path/to/gobbler", "run", "gobbler-mcp"]
}
}
}特性
内容转换
| 类型 | 命令 | 后端 |
|---|---|---|
油管 gobbler youtube URL | youtube转录api | |
| 音频/视频 | gobbler audio FILE | 更快的耳语(本地) |
| 文件 | gobbler document FILE | 文档(Docker) |
| 网页 | gobbler webpage URL | Crawl4AI(Docker) |
浏览器自动化
通过Gobbler扩展控制浏览器以获取经过身份验证的内容:
gobbler browser extract # Extract current page
gobbler notebooklm query "..." # Query NotebookLM
gobbler chatgpt query "..." # Send to ChatGPT
gobbler claude query "..." # Send to Claude.ai
gobbler gemini query "..." # Send to Gemini设置:
- 在Chrome中加载扩展程序:
- 首选 chrome://extensions/ - 启用“开发人员模式” - 点击“加载解包”→ 选择 browser-extension/ 文件夹
- 创建一个名为的选项卡组 “小家伙” (右键单击任何选项卡→ 添加到组→ 新组)
- 将要控制的选项卡添加到Gobbler组
只有“Gobbler”组中的选项卡是可访问的——这可以防止意外访问敏感选项卡。
批处理
gobbler batch youtube-playlist "https://youtube.com/playlist?list=..."
gobbler batch directory ./documents --pattern "*.pdf"
gobbler batch webpages urls.txt --output-dir ./pages建筑
Gobbler提供了三个接口,它们都使用相同的CLI和后端:
┌─────────────────────────────────────────────────────────────┐
│ Your Automations │
└──────────────┬──────────────┬──────────────┬───────────────┘
│ │ │
┌────────▼────┐ ┌──────▼─────┐ ┌─────▼─────┐
│ Skills │ │ gobbler │ │ MCP │
│(CLI instrs) │ │ CLI │ │ Server │
└────────┬────┘ └──────┬─────┘ └─────┬─────┘
│ │ │
└──────────────┼──────────────┘
▼
┌─────────────────┐
│ Provider Layer │
│ (Converters) │
└────────┬────────┘
│
┌───────────────────┼───────────────────┐
▼ ▼ ▼
┌─────────┐ ┌───────────┐ ┌─────────┐
│ Whisper │ │ Docling │ │Crawl4AI │
│ (local) │ │ (Docker) │ │(Docker) │
└─────────┘ └───────────┘ └─────────┘技能 是教导Claude运行哪些CLI命令的markdown文件。 主控程序 公开了与Claude Desktop/Code工具相同的功能。
安装
先决条件
- Python 3.11+
- 紫外线 (Python包管理器)
- Docker桌面(用于web/文档转换)
- ffmpeg(用于从视频中提取音频)
安装
# Install uv (if not already installed)
curl -LsSf https://astral.sh/uv/install.sh | sh
# Clone and install
git clone https://github.com/Enablement-Engineering/gobbler.git
cd gobbler
make install
# Start Docker services
make start-docker
# Verify
gobbler --version没有Docker怎么办
- YouTube文字记录 -直接使用YouTube的API
- 音频转录 -使用本地Whisper模型
Docker需要什么
- 文档转换 -文档服务(端口5001)
- 网络抓取 -Crawl4AI服务(端口11235)
配置
配置文件: ~/.config/gobbler/config.yaml
services:
docling: "http://localhost:5001"
crawl4ai: "http://localhost:11235"
storage:
type: "sqlite"
path: "~/.config/gobbler/jobs.db"
logging:
level: "INFO"故障排除
文档转换崩溃
# Use --no-ocr for digital PDFs (faster, less memory)
gobbler document file.pdf --no-ocr -o output.md服务没有响应
docker compose up -d
docker compose ps
curl http://localhost:5001/health # Docling
curl http://localhost:11235/health # Crawl4AIYouTube“IP被屏蔽”
# Set up TranscriptAPI.com for reliable access
export TRANSCRIPTAPI_KEY=your_key
gobbler youtube "URL"看 狼吞虎咽的设置技巧 以完成故障排除。
项目结构
gobbler/
├── src/
│ ├── gobbler_cli/ # CLI interface (typer)
│ ├── gobbler_core/ # Converters & utilities
│ ├── gobbler_mcp/ # MCP protocol server
│ ├── gobbler_relay/ # Browser extension bridge
│ └── gobbler_queue/ # Background job queue
├── skills/ # AI agent instruction files
├── browser-extension/ # Chrome/Firefox extension
└── docker-compose.yml # External services文档
📖 全部文件 -安装、配置和使用指南
关键页面:
许可证
MIT许可证-请参阅 许可证 文件。
致谢
建在巨人的肩膀上:
- Crawl4AI -网络抓取
- Docling -文档转换
- 更快的耳语 -音频转录
- youtube转录api -YouTube文字记录
