Token导航 LogoToken导航TokenDH.com
开发操作浏览器clawhub未标认证来源可访问clear审计提醒

douyin-content-tracker抖音内容跟踪器

Agent Skill

用于辅助文档、README、Markdown、说明文和内容稿件的整理与改写。它适合让 Agent 提炼结构、补齐章节、统一术语、检查链接或把零散材料整理成可读文档。使用时应保留项目已有事实、命令和路径,不要把未确认的信息写成确定结论;涉及对外文案时,还需要控制语气,避免过度营销或夸大能力。

总安装

3,036

周安装

124

GitHub Stars

公开资料未说明

下载量

972
OpenClaw

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

GitHub

来源数

2

许可证

MIT-0

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:douyin-content-tracker(抖音内容跟踪器)
来源仓库:https://github.com/gpttang/douyin-content-tracker
安装命令:
openclaw skills install douyin-content-tracker
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。该命令会通过 OpenClaw 从第三方来源获取 Skill;本站只展示命令,不托管安装包,也不自动执行。

ClawHubOpenClaw
openclaw skills install douyin-content-tracker

简介

抓取抖音创作者视频并提取音频进行语音转录。

  • 适合内容研究、素材整理或数据分析类任务。
  • 支持 Playwright 与 yt-dlp 后备方案,兼容多种下载方式。
  • 安装命令:openclaw skills install douyin-content-tracker,需配置 ffmpeg 与 Whisper 环境。
  • 涉及第三方工具链,建议验证本地依赖是否完整安装。

SKILL.md

name
douyin-content-tracker
description
Scrapes Douyin creator videos, downloads audio (Playwright+ffmpeg with yt-dlp fallback), and transcribes with Whisper. Covers setup, daily tracking, cookie management, and troubleshooting.

Douyin Content Tracker

通过 MediaCrawler 爬取抖音创作者视频,用 Playwright+ffmpeg 下载音频(被封锁时自动切换 yt-dlp),用 Whisper 进行语音识别转写。

快速开始

一键完整流程(推荐)

SKILL_DIR=$(python -c "import pathlib; print(pathlib.Path.home().rglob('douyin-content-tracker-skill/SKILL.md').__next__().parent)")
cd "$SKILL_DIR"

# 1. 整理最新 3 条视频
python scripts/track_latest.py --limit 3

# 2. 下载音频并转写(macOS)
export KMP_DUPLICATE_LIB_OK=TRUE
WHISPER_MODEL=small python scripts/extract_subtitle.py

首次设置

1. 安装 Python 依赖

cd $SKILL_DIR
pip install -r scripts/requirements.txt
pip install openai-whisper
python -m playwright install chromium

# yt-dlp(音频下载备用方案)
pip install yt-dlp
# 或
brew install yt-dlp

2. 安装 MediaCrawler

# macOS/Linux
git clone https://github.com/NanmiCoder/MediaCrawler ~/MediaCrawler
cd ~/MediaCrawler && pip install -r requirements.txt

# Windows
git clone https://github.com/NanmiCoder/MediaCrawler D:/MediaCrawler
cd D:/MediaCrawler && pip install -r requirements.txt

3. 配置 .env

cd $SKILL_DIR
cp .env.template .env

编辑 .env

# 必填:MediaCrawler 路径
MEDIACRAWLER_DIR=~/MediaCrawler

# 可选:输出目录(默认 ~/DouyinContentTracker)
OUTPUT_BASE_DIR=~/DouyinContentTracker

# 可选:Whisper 模型(推荐 small,更快更稳定)
WHISPER_MODEL=small

4. 添加目标账号

编辑 accounts.txt

博主名称 | https://www.douyin.com/user/MS4wLjABAAAA...

5. 获取 Cookie(三选一)

方法 A:扫码登录(生成新 Cookie)

cd $SKILL_DIR
python scripts/scrape_profile.py

方法 B:复制微信 Cookie(macOS)

cp ~/Library/Containers/com.tencent.xinWeChat/Data/Documents/xwechat_files/*/msg/file/*/.douyin_cookies.json \
   $SKILL_DIR/.douyin_cookies.json
chmod 600 $SKILL_DIR/.douyin_cookies.json

方法 C:使用已有 Cookie 确保 .douyin_cookies.json 在 skill 目录下。


日常使用

整理 + 转写(标准流程)

cd $SKILL_DIR

# 1. 整理(默认 3 条)
python scripts/track_latest.py

# 2. 清洗数据
python scripts/clean_data.py

# 3. 下载音频
python scripts/download_video.py

# 4. 语音识别(macOS 需要设置环境变量)
export KMP_DUPLICATE_LIB_OK=TRUE
python scripts/extract_subtitle.py

常用命令

# 整理指定数量
python scripts/track_latest.py --limit 5

# 使用自定义账号列表
python scripts/track_latest.py --accounts-file /path/to/accounts.txt

# 仅来源资料(不下载音频)
python scripts/track_latest.py --no-audio

# 仅转写(跳过下载)
export KMP_DUPLICATE_LIB_OK=TRUE
python scripts/extract_subtitle.py

故障排查

❌ 0 视频提取 / "未获取到视频 URL"

原因: Cookie 过期或无效,或抖音 API 封锁了 Playwright 请求

解决:

# 1. 检查 Cookie 文件
ls -la .douyin_cookies.json

# 2. 复制新 Cookie(方法 B)
cp ~/Library/Containers/com.tencent.xinWeChat/Data/Documents/xwechat_files/*/msg/file/*/.douyin_cookies.json \
   $SKILL_DIR/.douyin_cookies.json

# 3. 或重新扫码
python scripts/scrape_profile.py

# 4. 重试下载(Playwright 失败时自动切换 yt-dlp)
python scripts/download_video.py

❌ yt-dlp 也被拦截

# 带浏览器 Cookie 重试
yt-dlp -x --audio-format m4a --cookies-from-browser chrome <视频链接>

如果 Chrome Cookie 有效,在 download_video.pyytdlp_download_audio 函数中的 cmd 列表里加入:

"--cookies-from-browser", "chrome",

❌ Whisper 崩溃(SIGSEGV / OpenMP 错误)

原因: macOS OpenMP 运行时冲突

解决:

export KMP_DUPLICATE_LIB_OK=TRUE
WHISPER_MODEL=small python scripts/extract_subtitle.py

永久解决:.env 中设置 WHISPER_MODEL=small

❌ Playwright 浏览器缺失

python -m playwright install chromium

❌ Cookie 警告 "已 N 天未更新"

python scripts/scrape_profile.py  # 重新扫码

输出目录结构

~/DouyinContentTracker/
├── data/                           # 来源资料
│   ├── 周凯谈烘焙_20260321_083047.csv
│   └── cleaned_周凯谈烘焙_20260321_083047.csv
├── audio/                          # 音频文件
│   └── 周凯谈烘焙/
│       ├── 7559900409483300105.m4a    (96 KB)
│       ├── 7491508890513886505.m4a    (584 KB)
│       └── 7446734179963866379.m4a    (1,775 KB)
├── subtitles/                      # 语音转写文稿
│   └── 周凯谈烘焙/
│       ├── 7559900409483300105.md
│       ├── 7491508890513886505.md
│       └── 7446734179963866379.md
└── models/                         # Whisper 模型
    └── small.pt

执行报告模板

每一步完成后向用户报告进度:

步骤报告内容
整理博主名称、整理条数、失败原因
清洗有效数据条数、输出文件
音频成功数/总数、跳过条数
转写生成字幕数、输出路径
完成博主数、视频数、字幕数、输出目录

示例:

[步骤 1/4 整理] 博主「周凯谈烘焙」— 整理完成,共 345 条视频
[步骤 2/4 清洗] 有效数据 115 条 → data/cleaned_周凯谈烘焙_20260321_083047.csv
[步骤 3/4 音频] 下载完成 3/3 → audio/周凯谈烘焙/
[步骤 4/4 字幕] 生成 3 个字幕文件 → subtitles/周凯谈烘焙/
[完成] 1 位博主 · 3 条视频 · 3 个字幕,输出目录:~/DouyinContentTracker

技术细节

管道流程

accounts.txt
    ↓
scrape_profile.py → MediaCrawler (CDP) → data/*.csv
    ↓
clean_data.py → cleaned_*.csv
    ↓
download_video.py → Playwright + ffmpeg → audio/{blogger}/*.m4a
                 ↘ (Playwright 失败) yt-dlp ↗
    ↓
extract_subtitle.py → Whisper → subtitles/{blogger}/{video_id}.md

音频下载双重策略:

  • 主路径:Playwright 打开视频页拦截 aweme API 拿真实 URL → ffmpeg 提取 .m4a
  • 备用路径:Playwright 拿不到 URL 时,自动调用 yt-dlp -x --audio-format m4a,输出同样是 .m4a,Whisper 无需适配

Whisper 模型选择

模型大小速度准确度推荐场景
tiny75MB最快一般测试/快速预览
small461MB日常使用(推荐)
medium1.5GB很好高准确度需求
large3GB最慢最佳专业转写

参考文件

调试或扩展时加载:

  • references/pipeline.md — 脚本技术细节、数据格式、关键函数
  • references/troubleshooting.md — Cookie、MediaCrawler、ffmpeg、Whisper、数据错误修复

更新日志

2026-03-21(二次更新)

  • ✅ 新增 yt-dlp 作为音频下载备用方案(Playwright 被封锁时自动切换)
  • ✅ yt-dlp 输出保持 .m4a 格式,Whisper 管道无需改动
  • ✅ 新增 --cookies-from-browser chrome 故障排查说明

2026-03-21

  • ✅ 新增 macOS 微信 Cookie 复制方法
  • ✅ 新增 OpenMP 冲突解决方案(KMP_DUPLICATE_LIB_OK=TRUE
  • ✅ 推荐使用 small 模型(更快更稳定)
  • ✅ 新增一键完整流程示例
  • ✅ 新增输出目录结构示例
  • ✅ 新增执行报告模板

适合场景

01

OpenClaw 用户查找和安装 Skill 时

02

用户想查找某类 Agent Skill 时

03

需要根据任务场景推荐可安装能力包时

04

需要对比不同来源的安装命令和来源信息时

能力概览

能力 1

按任务关键词查找相关 Skills

能力 2

展示可复制的安装命令

能力 3

保留来源站点、仓库和原始说明,方便继续核验

能力 4

补充不同宿主或平台的使用分布数据

能力 5

展示第三方安全扫描或审计结果

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

OpenClaw

87.1%
按下载量换算847

安全审计

VirusTotal

未展示

ClawScan

可疑

Static analysis

通过

权限和风险

操作浏览器

该 Skill 可能涉及浏览器控制能力,使用时可能读取或操作网页内容,需要在受控环境中确认权限边界。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。来源安全扫描存在 warning/failed 结果,不能写成本站确认安全。当前只有一个来源,正式发布前建议补源仓库或其他目录站核验。

来源信息

继续浏览同类 Skills