watch-skill 快速入门
让 AI Agent 拥有「看视频」的能力——MCP + CLI + REST,场景感知帧分析、OCR、本地转录。
这是什么?适合谁?
watch-skill 是一个让 AI Agent 获得视频观看能力的工具。它提供了 MCP、CLI、REST 三种接口,AI Agent 可以对视频进行场景感知的帧分析、OCR 文字识别、本地转录。最有趣的功能是「自我纠错」——AI Agent 可以观看自己工作的录屏,然后发现并修复问题。
适合:需要 AI Agent 分析视频内容的场景、自动化视频 QA、Agent 自我纠错(观看录屏)、视频内容 OCR 提取。
准备工作
- Python 3.10+
- FFmpeg(用于视频处理)
- MCP 客户端(可选,用于 Agent 集成)
- 足够的磁盘空间(视频处理占用)
3 步快速上手
第 1 步:安装
pip install watch-skill
或从源码安装:
git clone https://github.com/oxbshw/watch-skill.git
cd watch-skill
pip install -e .
第 2 步:CLI 快速测试
# 分析视频中的场景
watch-skill analyze video.mp4 --mode scenes
# OCR 提取视频中的文字
watch-skill ocr video.mp4 --language chi_sim
# 转录视频音频
watch-skill transcribe video.mp4 --output transcript.txt
第 3 步:MCP 模式
在 MCP 配置中添加:
{
"mcpServers": {
"watch-skill": {
"command": "python",
"args": ["-m", "watch_skill.mcp_server"]
}
}
}
然后在 Claude Code 中:
请观看 screen-recording.mp4,分析我在操作过程中犯了什么错误
进阶用法
场景感知帧分析
watch-skill 不只是提取帧,而是理解场景上下文:
watch-skill analyze video.mp4 --mode scene-aware --detect "error,dialog,loading"
自我纠错
AI Agent 的操作录屏 → watch-skill 分析 → 发现错误 → Agent 修复:
1. 录制 Agent 操作: screen-recording.mp4
2. watch-skill analyze screen-recording.mp4 --mode self-review
3. watch-skill 输出: "在第 3:42 秒,Agent 点击了错误的按钮,应该点击 'Submit' 而非 'Cancel'"
4. Agent 根据分析结果修正行为
REST API 模式
watch-skill serve --port 8899
curl -X POST http://localhost:8899/analyze -F "video=@video.mp4" -F "mode=ocr"
常见问题 FAQ
Q1:支持哪些视频格式?
A:支持 FFmpeg 能处理的所有格式,包括 MP4、AVI、MOV、MKV、WebM 等。
Q2:OCR 支持中文吗?
A:支持。使用 --language chi_sim 参数指定简体中文。同时支持英文、日文、韩文等。
Q3:视频分析需要多长时间?
A:取决于视频长度和分辨率。10 分钟 1080p 视频通常需要 2-3 分钟处理时间。可以调整帧采样率加速。
Q4:和 Video-LLaMA 有什么区别?
A:Video-LLaMA 是一个视频理解模型,需要 GPU 推理。watch-skill 是一个 Agent 工具,使用传统 CV 和 OCR 技术,CPU 即可运行,更适合 Agent 集成。
参考链接
📊 评分与标签
评分说明
总分 7.6/10 · S_入选
📊 可观测社区指标(数据核验日期:2026-07-08)
- GitHub: oxbshw/watch-skill ★97, 🔱17
- 创建: 2026-07-05,最新更新 2026-07-05
⚙️ 功能完整度 1.8/2.5
- 视频分析+OCR+转录,MCP+CLI+REST 三接口
- 场景感知帧分析,自我纠错功能
- 来源:watch-skill GitHub
- 对比 Video-LLaMA(视频理解模型):watch-skill 是 Agent 工具 vs Video-LLaMA 是模型
- 对比 Gemini Vision(视频分析):watch-skill 开源本地 vs Gemini 云端 API
✨ 输出质量 1.8/2.5
- 场景感知帧分析,OCR 识别准确
- 本地转录,无需云端 API
- 来源:watch-skill GitHub
- 对比 Gemini Vision:Gemini 的 AI 理解更强,但 watch-skill 本地优先
- 对比 Video-LLaMA:watch-skill CPU 可运行,更实用
🖐️ 易用性 1.0/1.5
- pip install 安装,MCP/CLI 配置
- 需 FFmpeg 依赖
- 来源:watch-skill GitHub
- 对比 Gemini Vision(API 调用):watch-skill 本地部署更复杂
- 对比 Video-LLaMA(需 GPU):watch-skill CPU 运行更易部署
💰 性价比 1.5/1.5
- MIT 开源免费
- CPU 可运行,无需 GPU 投入
- 来源:watch-skill GitHub License
- 对比 Gemini Vision(API 按量付费):watch-skill 零成本
- 对比 Video-LLaMA(需 GPU):watch-skill 硬件成本更低
🔒 稳定性 0.6/1.0
- 2026-07-05 创建,3 天项目历史
- 97 Stars,17 forks,社区极早期
- 来源:watch-skill GitHub
- 对比 Gemini Vision(Google 出品):watch-skill 稳定性差距大
- 对比 Video-LLaMA(学术项目):两者成熟度相当
🛡️ 隐私安全 0.8/1.0
- 本地优先,视频数据不离开设备
- MCP 代理本地运行
- 来源:watch-skill GitHub
- 对比 Gemini Vision(云端处理):watch-skill 本地处理更安全
- 对比 Video-LLaMA(本地模型):安全性相当
🏷️ 标签说明
- 开源免费: MIT。来源: GitHub
- MCP: MCP Server。来源: GitHub
- 视频生成: 视频分析。来源: GitHub
- Agent: AI Agent 工具。来源: GitHub
📋 来源与核验记录
- ✅ 已核验: watch-skill GitHub — Stars 97,Forks 17,MIT
- ⚠️ 未验证(需安装): 视频分析实际效果 — 需 pip install 测试
- ⚠️ 未验证: 自我纠错功能 — 需 Agent 录屏测试
同分类推荐
AI编程 分类下的其他工具