watch-skill

让任何 AI Agent 拥有「看视频」的能力——MCP + CLI + REST,场景感知帧分析、OCR、本地转录

📅 收录: 2026-07-08 🔄 更新: 2026-07-08

watch-skill 快速入门

让 AI Agent 拥有「看视频」的能力——MCP + CLI + REST,场景感知帧分析、OCR、本地转录。

这是什么?适合谁?

watch-skill 是一个让 AI Agent 获得视频观看能力的工具。它提供了 MCP、CLI、REST 三种接口,AI Agent 可以对视频进行场景感知的帧分析、OCR 文字识别、本地转录。最有趣的功能是「自我纠错」——AI Agent 可以观看自己工作的录屏,然后发现并修复问题。

适合:需要 AI Agent 分析视频内容的场景、自动化视频 QA、Agent 自我纠错(观看录屏)、视频内容 OCR 提取。

准备工作

  • Python 3.10+
  • FFmpeg(用于视频处理)
  • MCP 客户端(可选,用于 Agent 集成)
  • 足够的磁盘空间(视频处理占用)

3 步快速上手

第 1 步:安装

pip install watch-skill

或从源码安装:

git clone https://github.com/oxbshw/watch-skill.git
cd watch-skill
pip install -e .

第 2 步:CLI 快速测试

# 分析视频中的场景
watch-skill analyze video.mp4 --mode scenes

# OCR 提取视频中的文字
watch-skill ocr video.mp4 --language chi_sim

# 转录视频音频
watch-skill transcribe video.mp4 --output transcript.txt

第 3 步:MCP 模式

在 MCP 配置中添加:

{
  "mcpServers": {
    "watch-skill": {
      "command": "python",
      "args": ["-m", "watch_skill.mcp_server"]
    }
  }
}

然后在 Claude Code 中:

请观看 screen-recording.mp4,分析我在操作过程中犯了什么错误

进阶用法

场景感知帧分析

watch-skill 不只是提取帧,而是理解场景上下文:

watch-skill analyze video.mp4 --mode scene-aware --detect "error,dialog,loading"

自我纠错

AI Agent 的操作录屏 → watch-skill 分析 → 发现错误 → Agent 修复:

1. 录制 Agent 操作: screen-recording.mp4
2. watch-skill analyze screen-recording.mp4 --mode self-review
3. watch-skill 输出: "在第 3:42 秒,Agent 点击了错误的按钮,应该点击 'Submit' 而非 'Cancel'"
4. Agent 根据分析结果修正行为

REST API 模式

watch-skill serve --port 8899
curl -X POST http://localhost:8899/analyze -F "video=@video.mp4" -F "mode=ocr"

常见问题 FAQ

Q1:支持哪些视频格式?

A:支持 FFmpeg 能处理的所有格式,包括 MP4、AVI、MOV、MKV、WebM 等。

Q2:OCR 支持中文吗?

A:支持。使用 --language chi_sim 参数指定简体中文。同时支持英文、日文、韩文等。

Q3:视频分析需要多长时间?

A:取决于视频长度和分辨率。10 分钟 1080p 视频通常需要 2-3 分钟处理时间。可以调整帧采样率加速。

Q4:和 Video-LLaMA 有什么区别?

A:Video-LLaMA 是一个视频理解模型,需要 GPU 推理。watch-skill 是一个 Agent 工具,使用传统 CV 和 OCR 技术,CPU 即可运行,更适合 Agent 集成。

参考链接

📊 评分与标签

评分说明

总分 7.6/10 · S_入选

📊 可观测社区指标(数据核验日期:2026-07-08)

⚙️ 功能完整度 1.8/2.5

  • 视频分析+OCR+转录,MCP+CLI+REST 三接口
  • 场景感知帧分析,自我纠错功能
  • 来源:watch-skill GitHub
  • 对比 Video-LLaMA(视频理解模型):watch-skill 是 Agent 工具 vs Video-LLaMA 是模型
  • 对比 Gemini Vision(视频分析):watch-skill 开源本地 vs Gemini 云端 API

✨ 输出质量 1.8/2.5

  • 场景感知帧分析,OCR 识别准确
  • 本地转录,无需云端 API
  • 来源:watch-skill GitHub
  • 对比 Gemini Vision:Gemini 的 AI 理解更强,但 watch-skill 本地优先
  • 对比 Video-LLaMA:watch-skill CPU 可运行,更实用

🖐️ 易用性 1.0/1.5

  • pip install 安装,MCP/CLI 配置
  • 需 FFmpeg 依赖
  • 来源:watch-skill GitHub
  • 对比 Gemini Vision(API 调用):watch-skill 本地部署更复杂
  • 对比 Video-LLaMA(需 GPU):watch-skill CPU 运行更易部署

💰 性价比 1.5/1.5

  • MIT 开源免费
  • CPU 可运行,无需 GPU 投入
  • 来源:watch-skill GitHub License
  • 对比 Gemini Vision(API 按量付费):watch-skill 零成本
  • 对比 Video-LLaMA(需 GPU):watch-skill 硬件成本更低

🔒 稳定性 0.6/1.0

  • 2026-07-05 创建,3 天项目历史
  • 97 Stars,17 forks,社区极早期
  • 来源:watch-skill GitHub
  • 对比 Gemini Vision(Google 出品):watch-skill 稳定性差距大
  • 对比 Video-LLaMA(学术项目):两者成熟度相当

🛡️ 隐私安全 0.8/1.0

  • 本地优先,视频数据不离开设备
  • MCP 代理本地运行
  • 来源:watch-skill GitHub
  • 对比 Gemini Vision(云端处理):watch-skill 本地处理更安全
  • 对比 Video-LLaMA(本地模型):安全性相当

🏷️ 标签说明

  • 开源免费: MIT。来源: GitHub
  • MCP: MCP Server。来源: GitHub
  • 视频生成: 视频分析。来源: GitHub
  • Agent: AI Agent 工具。来源: GitHub

📋 来源与核验记录

  • ✅ 已核验: watch-skill GitHub — Stars 97,Forks 17,MIT
  • ⚠️ 未验证(需安装): 视频分析实际效果 — 需 pip install 测试
  • ⚠️ 未验证: 自我纠错功能 — 需 Agent 录屏测试

同分类推荐

AI编程 分类下的其他工具

)}