chubbyskills

中文全渠道内容采集 14 个 AI Skill 合集:B站/抖音/小红书/公众号/X/播客转 Markdown 入 Obsidian 知识库,字幕优先免 GPU 转录 + 知识库 MCP server,完全本地。

📅 收录: 2026-09-16 🔄 更新: 2026-09-16

这是什么?适合谁?

Chubby Skills(MIT,Python,v0.11.0)是一套面向个人知识库和 AI Agent 的中文全渠道内容采集、整理、检索工具集——14 个 Agent Skill 把 B站、YouTube、抖音、TikTok、微博、知乎、小红书、微信公众号、X/Twitter、播客(小宇宙/喜马拉雅/RSS)等内容统一转成带 frontmatter 的 Markdown,入库 Obsidian vault,再通过内置 MCP server 让 Claude Code、Codex、OpenCode、OpenClaw、Hermes 等 Agent 直接检索和调用你的知识库。

它的定位是三层管道:

  1. 采集层tools/chubby_ingest.py 一条链接进来,自动识别平台,输出统一 Markdown(标题/平台/来源/作者/标签全在 frontmatter)。
  2. 知识层tools/vault_index.py 给 vault 建 SQLite 索引,支持全文搜索、语义检索、最近笔记、统计;vault_curator.py 自动归档、生成知识卡片。
  3. Agent 层knowledge-base-management/scripts/mcp_server.py 暴露 6 个 MCP 工具(search_vault / semantic_search_vault / read_kb_note / list_recent_notes / reindex_vault / vault_index_stats),Agent 带来源回答你知识库里的问题。

关键差异化是字幕优先转录策略:B站/YouTube 视频优先抓现成字幕,抓不到才落到 ffmpeg + FunASR/faster-whisper 音频转录——大部分场景零 GPU、零 API 费用。README 自称「中文 Agent 内容采集的事实标准」,在中文平台覆盖上确实没有同量级开源对手(feedgrab 7 平台、RSSHub 只管订阅源、Readwrite/NotebookLM 是云端订阅制)。

适合谁:中文内容创作者(把爆款笔记/视频/公众号沉淀成选题库);学习者(视频播客转文字做笔记闪卡);研究者(搭能被 Agent 检索的本地资料库);Agent 玩家(skill + CLI + MCP + vault 串工作流)。

不适合谁:要抓英文内容为主的用户(平台全部面向中文生态);商用批量爬取场景(README 明确禁止:仅限个人学习研究);不想碰命令行的用户。

使用前提:Python 3 环境;轻量模式(X 图文/小红书图文/公众号基础/知识库)零重依赖,视频转录才需要 ffmpeg + yt-dlp + funasr/torch。

准备工作

  1. 环境:Python 3;git;可选 ffmpeg/yt-dlp(视频转录)
  2. 获取git clone https://github.com/chubbyguan/chubbyskills.git(Gitee 镜像:gitee.com/chubbyguan/chubbyskills)
  3. 成本:MIT 免费;零依赖档位零 API 费用;内容加工(摘要/标签/翻译)可选 DEEPSEEK_API_KEY,语义检索默认零依赖 semantic-lite,真实向量可选 OPENAI_API_KEY 或本地 sentence-transformers
  4. 时间:clone + quickstart 约 10 分钟;配齐视频转录重依赖约 30-60 分钟
  5. 前置知识:会用命令行;有 Obsidian(或任意 Markdown 目录)当知识库载体;懂「Agent Skill / MCP」概念才能玩透 Agent 层
  6. 替代方案:feedgrab(采集面窄且只抓不存)、RSSHub(订阅源非正文采集)、Readwise/ima/NotebookLM(商业云端、覆盖差)、自写 yt-dlp + whisper 脚本(无统一协议无知识层)

快速上手(3 步)

第一步:克隆并跑离线首跑验收

git clone https://github.com/chubbyguan/chubbyskills.git
cd chubbyskills
python3 tools/chubby.py quickstart

quickstart离线首跑验收,不抓真实平台内容,只检查:配置与运行目录可写、X 链接 dry-run 路由正确、示例 Markdown 符合输出协议、平台定义完整、示例 vault 能索引和语义检索、MCP 依赖可用。

预期产出:一连串检查通过,证明环境健康。

第二步:分档安装依赖

bash setup.sh          # 默认 light:轻量能力(图文采集 + 知识库)
bash setup.sh video    # 视频转录重依赖
bash setup.sh podcast  # 播客转录
bash setup.sh wechat   # 公众号/PDF 处理
bash setup.sh all      # 全部
bash setup.sh doctor   # 只做环境体检

预期产出:按需装好对应档位依赖;doctor 输出体检报告。

第三个任务:采一条真实内容并入库

python3 tools/chubby_ingest.py "https://mp.weixin.qq.com/s/xxx" -o output/
python3 tools/chubby_ingest.py "https://www.bilibili.com/video/BVxxxx" --vault ~/Documents/Obsidian/Inbox

自动识别平台失败时显式指定:--skill youtube。批量场景把链接逐行放进 inbox/links.txt,然后 python3 tools/chubby.py run / status --failed / retry --all-failed 三连——每条 source 的状态、错误、输出路径、run_id 都记在 .chubby/runs.jsonl,每日运行报告落在 runs/YYYY-MM-DD.md

预期产出output/ 或 vault Inbox 里出现带完整 frontmatter 的 Markdown(title/platform/source/created/author/tags + schema v1 的 run_id/source_hash/captured_at 等字段)。

常见踩坑(症状 → 原因 → 解决)

  1. B站视频转录巨慢/卡死。原因:该视频无现成字幕,落到了 ffmpeg + FunASR 音频转录的 fallback 路径,首次还要下模型。解决:耐心等首跑;高频用户装 bash setup.sh video 预热依赖;只想快速拿文字时优先挑有字幕的视频。
  2. 小红书采集拿到空正文。原因:小红书对未登录请求返回不完整内容。解决:设置 XHS_COOKIE 环境变量带入自己账号的登录态(README 强调仅在自己账号和授权范围内使用);实在不行用 --fallback-text 手动粘贴正文。
  3. X/Twitter 链接抓不动。原因:风控、地区限制或链接过期。解决:图文档位零依赖本不该挂——先跑 python3 tools/platform_smoke.py --mode offline --check 分层定位(offline/fallback/live 三层 smoke 是显式设计);live smoke 需自己 export CHUBBY_SMOKE_X_SOURCE 指定链接。
  4. 语义检索结果不相关。原因:默认 semantic-lite 是零依赖的轻量方案,语义理解能力有限。解决:换真实向量——export OPENAI_API_KEYvault_index.py embed --provider openai,或 pip install sentence-transformers 走本地模型(--provider local),零 API 费。
  5. 公众号 PDF 转出来是乱码。原因:基础档只有 beautifulsoup4,PDF 增强需要 markitdown/pymupdf。解决:bash setup.sh wechat 装齐 PDF 档;复杂排版 PDF 建议保留原件用 --fallback-text
  6. MCP server 起来但 Agent 搜不到东西。原因:vault 没建索引或 VAULT_DIR 指错。解决:先 python3 tools/vault_index.py index <vault路径> 建索引;MCP 启动时 VAULT_DIR 环境变量必须指向同一 vault;跑官方 python3 tools/mcp_workflow_demo.py 用 fixtures 演练一遍「检索 → 读原文 → 带来源回答」。

初级用法

  • 采集后自动加工export DEEPSEEK_API_KEY 后加 --enrich 参数——content-enrich skill 自动补摘要、要点、标签、领域和价值判断,原文保留不动。
  • 爆款拆解:小红书 skill 支持「爆款拆解」和「衍生选题」模式,直接产出内容创作素材而非纯存档。
  • 每日情报雷达:industry-intelligence-radar skill 做多源情报扫描和趋势简报,配合 chubby.py 的批量队列就是每日自动简报管道。

高级玩法

  • MCP 闭环pip install mcpVAULT_DIR=<vault> python3 knowledge-base-management/scripts/mcp_server.py,在 Claude Code / Hermes 里直接问「我知识库里关于内容策略的笔记有哪些」——search_vault + read_kb_note 两个工具组合让 Agent 带来源回答。
  • 自动归档 + 知识卡片vault_curator.py 默认 dry-run,确认规则后 --apply 真正执行:00_Inbox 待处理 → 有 summary 和 processed 标签的进 20_Processed,其余按平台进 10_Sourcescard 子命令为单篇笔记生成带来源/标签/要点的知识卡片。
  • 贡献新平台:不要复制旧目录——platform_adapter.py new hacker-news --name "Hacker News" --sample-source ... --match news.ycombinator.com 生成最小可验证骨架,再跑 platform_health.py --check + platform_smoke.py --mode offline --check 验证。
  • 质量保障层validate_outputs.py --schema-v1 校验输出协议、golden_outputs.py 防示例输出结构被改坏、platform_health.py 校验平台定义与状态页新鲜度——把内容管道当软件工程做。
  • 学习笔记自动化:learning-notes-automation skill 从转录文本生成学习笔记、闪卡和知识图谱,接 Anki 类工具闭环。

小技巧

  1. 先跑 quickstart 再装重依赖——它是离线验收,30 秒内告诉你环境哪里有问题,比装完 2GB torch 才发现路径错误省太多时间。
  2. runs.jsonl 里每条 source 有 source_hash,重试按 hash 去重——批量队列里同一链接不会重复处理。
  3. 每个平台在 platforms/*.yaml 有状态定义(依赖/fallback/样例 source),采集失败先查这个文件而不是瞎猜。
  4. docs/platform-fallbacks.md 给了失败分型指南——「无字幕」「无 cookie」「链接过期」各有既定 fallback 路径,别自己发明。
  5. 在 Claude Code 等支持 Skill 的 Agent 里可以一句话装:「帮我安装这个 skill:https://github.com/chubbyguan/chubbyskills/tree/main/」。

常见问题 FAQ

Q1: 采集内容会不会侵权?

A: README 合规条款明确:仅限个人学习与研究,遵守目标平台服务条款、robots.txt 和法律法规,禁止批量抓取、商用爬取、二次分发;内容版权归原作者,引用转载需授权。工具本身中立,用途合规责任在使用者。

Q2: 和直接用 yt-dlp + whisper 自己写脚本有什么区别?

A: 三点:统一输出协议(所有平台同一套 frontmatter + schema v1 元数据,可校验可入库);知识层(SQLite 索引/语义检索/自动归档,自己写脚本没有这些);Agent 层(MCP server + 14 个 skill 可被主流 Agent 直接编排)。自己写脚本每个平台都是新项目,这里是统一管线。

Q3: 完全离线能用吗?

A: 图文采集 + 知识库 + semantic-lite 检索可以全离线(本地 vault + 零依赖检索)。视频转录需要在线抓视频流;content-enrich 需要 DeepSeek API;真实向量检索可选本地 sentence-transformers(模型下载后离线可用)。

Q4: 支持 Windows 吗?

A: 仓库以 Python + bash 脚本为主,setup.sh 需要 bash 环境(Windows 用 Git Bash/WSL 可跑);Python 部分跨平台。ffmpeg/funasr 等重依赖在 Windows 上装配较繁琐,视频转录建议 WSL。

Q5: 14 个 skill 能单独装吗?

A: 能。每个 skill 是独立目录(带 SKILL.md),README 明确「也可以只安装你需要的那个」;Agent 用户可以按单 skill URL 让 Agent 直接装。

Q6: 为什么叫「事实标准」?谁认定的?

A: 这是 README 的自我定位(生态位声明),依据是 Agent Skills 生态 140 万+ 技能包里泛化开发技能多、中文内容采集垂直领域无同量级开源对手。属于项目方主张,本站未独立核实其市场地位,但平台覆盖面(10 平台 vs feedgrab 7 平台)确为可查证优势。

免责声明

本文基于公开资料整理(GitHub README 中文全文与仓库 API 元数据,核验日期 2026-09-16),AI 辅助生成,未在本站环境实际安装运行或验证各平台采集成功率。平台可用性受 cookie、地区、风控影响可能随时变化;合规使用边界以项目 README 条款为准。仓库数据:GitHub API 实测 2026-09-16,★679/🔱91,MIT,v0.11.0,创建于 2026-06-08,最近 push 2026-08-19。

参考链接

📊 评分与标签

评分说明

总分 8.3/10 · P_优选

📊 可观测社区指标(采集日期:2026-09-16)

  • GitHub: chubbyguan/chubbyskills ★679, 🔱91(GitHub API 实时核验,2026-09-16;仓库创建 2026-06-08,约 3 个月)
  • License: MIT;Python;版本 v0.11.0;Gitee 镜像同步
  • 最近 push 2026-08-19(约 1 个月前,⚠️ 轻微放缓);5 open issues
  • 中文原生 README(附英文版);topics 含 claude-code/mcp/obsidian/knowledge-base 等 10 个
  • 作者公开身份:Chubby(X/即刻/小红书/公众号「关关不过」多平台内容创作者)

评分依据可追溯至公开来源,每项分数均有明确理由和数据支撑。

⚙️ 功能完整度 2.3/2.5

  • 三层完整闭环:采集层(14 skill 覆盖 B站/YouTube/抖音/TikTok/微博/知乎/播客/公众号/小红书/X 十大中文高频平台)+ 知识层(SQLite 索引/全文+语义检索/自动归档/知识卡片)+ Agent 层(MCP server 6 工具 + 5 大 Agent 兼容)
  • 管线工程化:批量队列 + 状态 + 重试 + 日报 + schema v1 元数据;质量保障层(输出协议校验/平台健康度/分层 smoke/golden outputs)
  • 字幕优先策略免 GPU 转录;content-enrich 自动加工;分档安装按需控依赖
  • 竞品对比 1(feedgrab):7 平台且只抓不存;Chubby Skills 10 平台 + 知识库 + MCP 闭环
  • 竞品对比 2(RSSHub):订阅源管理非正文采集,无知识层与 Agent 层
  • 限制:平台仅限中文生态(英文内容源需自行扩展);平台可用性受 cookie/风控影响 inherently 不稳定(官方以 fallback 机制缓解)

✨ 输出质量 2.1/2.5

  • 统一输出协议:所有平台同一套 frontmatter(title/platform/source/created/author/tags)+ schema v1(run_id/source_hash/captured_at/status/assets),validate_outputs.py --schema-v1 可机器校验——输出质量是协议保证的而非碰运气
  • golden outputs 防示例结构劣化;分层 smoke(offline/fallback/live)显式区分验证深度
  • 竞品对比 1(自写 yt-dlp 脚本):每平台输出格式随缘;Chubby Skills 全平台一致可入库可检索
  • 竞品对比 2(Readwise 等商业工具):封闭格式导出受限;本方案纯 Markdown 归用户所有
  • 限制:语义检索默认 semantic-lite 为零依赖轻量方案,相关性有限(可换 OpenAI/本地向量);content-enrich 质量依赖 DeepSeek;本站未实测各平台实际采集成功率

🖐️ 易用性 1.2/1.5

  • chubby.py quickstart 离线首跑验收(不抓真实内容,30 秒体检);setup.sh 六档位安装(light/video/podcast/wechat/all/doctor);单链接一行命令自动识别平台;批量三连(run/status/retry)语义直白
  • 支持在 Agent 里一句话装单个 skill;中文文档原生完整
  • 竞品对比 1(自配 whisper+yt-dlp 全家桶):环境地狱;本方案分档按需装
  • 竞品对比 2(英文采集工具链):中文用户读文档成本高;本方案中文原生
  • 限制:视频转录重依赖(torch/funasr)仍需折腾;setup.sh 需 bash(Windows 要 Git Bash/WSL);MCP 层要求理解 Agent 配置概念

💰 性价比 1.5/1.5

  • MIT 零费用;零依赖档位(X 图文/小红书图文/公众号基础/知识库/semantic-lite)完全零 API 费;付费点全可选(DeepSeek 加工便宜、OpenAI embedding 可换本地免费)
  • 竞品对比 1(Readwise/ima/NotebookLM):订阅制 + 数据在云端;本方案一次自持有
  • 竞品对比 2(API 转录服务):按分钟计费;字幕优先策略多数视频零成本

🔒 稳定性 0.6/1.0

  • 仓库 3 个月 ★679/🔱91 增长健康;但最近 push 2026-08-19(⚠️ 超 1 个月,节奏放缓);单人作者项目(Chubby 个人工作流开源),5 open issues 响应情况未验证
  • 质量保障层设计超出同体量个人项目(smoke/golden/健康度校验齐备);平台状态页 + 失败分型文档主动管理「平台会坏」的预期
  • 竞品对比 1(feedgrab 等同类):无系统化验收层;本方案把采集当软件工程做
  • 竞品对比 2(商业工具):有 SLA 但覆盖差收费;本方案免费但靠作者个人投入
  • 限制:平台风控变化是外部不可控风险(cookie 失效/接口变更),历史靠 fallback 与社区 issue 响应,长期维护持续性取决于作者

🛡️ 隐私安全 0.6/1.0

  • 完全本地运行:采集、索引、检索、知识库全在本机;X/小红书图文档位零依赖零外发;cookie 仅在自己账号授权范围内使用(README 合规条款明示)
  • 竞品对比 1(云端剪藏工具):内容过服务商;本方案数据不出本机(除显式配的 LLM/embedding API)
  • 竞品对比 2(商业爬虫 SaaS):账号风控风险转嫁第三方;本方案风险自担但可控
  • 限制:平台 cookie 是敏感凭据(泄漏即账号风险),仓库未提供加密存储机制;使用 DeepSeek/OpenAI API 时内容出网;合规边界依赖使用者自律(README 免责条款),爬虫行为本身处于平台 ToS 灰区——个人学习研究用途是明示前提

🏷️ 标签说明

  • 国产: 中文原生项目,全部平台面向中文内容生态(B站/抖音/小红书/公众号等),README 中文完整。来源:GitHub 仓库
  • MCP工具: 内置知识库 MCP server(6 工具:search/semantic_search/read/recent/reindex/stats),兼容 Claude Code/Codex/OpenCode/OpenClaw/Hermes。来源:GitHub README MCP
  • 知识管理: Obsidian vault 模板 + SQLite 索引 + 全文/语义检索 + 自动归档 + 知识卡片,完整个人知识库管道。来源:GitHub README
  • 内容采集: 10 平台内容转统一 Markdown,批量队列 + 重试 + 日报 + schema 元数据。来源:GitHub README
  • 开源免费: MIT License,零依赖档位零 API 费用。来源:GitHub 仓库

📋 来源核实

  • ✅ 已核验: GitHub 仓库 chubbyguan/chubbyskills — 2026-09-16 GitHub API 实时核验:★679、🔱91、MIT、v0.11.0、创建 2026-06-08、pushed_at 2026-08-19、Python
  • ✅ 已核验: README 中文全文 — 2026-09-16 抓取:14 skill 目录、10 平台能力表、六档安装、8 个常用工作流、质量保障层、输出协议、合规条款
  • ⚠️ 未验证: Gitee 镜像同步时效未核验;「事实标准」为 README 自我定位(生态位声明),本站未独立核实市场地位
  • ⚠️ 未实测:本站未安装运行,各平台采集成功率、转录质量、MCP 检索体验以官方文档与示例为准;平台可用性随 cookie/风控动态变化

同分类推荐

AI开发平台 分类下的其他工具

)}