vox-director

Vox Director:一句话主题变 Vox 风格纸拼贴讲解/广告片——脚本、拼贴关键帧、动效、配音、配乐、字幕全自动流水线(Atlas Cloud API + 本地 ffmpeg)。Agent Skill,Claude Code / Codex 均可用。MIT。

📊 评分明细

📦 打包完整度
2.1 2.1 / 2.5
🎯 实用性
2.1 2.1 / 2.5
📖 文档清晰度
1.6 1.6 / 2
👥 社区影响力
1.2 1.2 / 1.5
🔗 集成度
1.2 1.2 / 1.5

🎯 适用场景

AI视频生成Claude技能Agent工作流英文优先

这是什么?适合谁?

Vox Director(MIT,Python + ffmpeg)是一个 Agent Skill(编码代理技能):你给它一行主题(“给我做一个介绍墨西哥街头美食的 Vox 风格拼贴视频,英文,16:9,15 秒”),它产出一条成品 final.mp4——剧本、纸拼贴关键帧、动效、旁白、配乐、字幕,全程自动化,跑在 Atlas Cloud API + 本地 ffmpeg 上,任何编码 Agent(Claude Code、Codex 等)都能用。

视觉风格是 Vox 解释视频带火的那种现代编辑部纸拼贴(paper-collage):手剪纸片、撕裂边缘、胶带、半调网点、报纸剪报、每拍一记大字标题——再用动效、旁白、音乐和字幕活起来。

适合谁

  • 用 Claude Code / Codex 的创作者,要批量产出”Vox 风”知识讲解视频、产品广告片、社交媒体短内容
  • 内容团队想要一条可复现、可改参数的视频生成流水线,而不是每次手搓 Sora/Veo 抽卡
  • 研究”Agent Skill 工程化”的人——它是少数带双人工决策闸门(beat map 审批 + 风格盲选)的完整六阶段流水线范本

不适合谁

  • 想要真人实拍剪辑的(这是生成式拼贴动画,不是剪辑器;剪辑需求看 FableCut
  • 没有编码 Agent、不想办 API Key 的纯手动用户
  • 对视频里出现真实人脸/品牌有合规顾虑又不懂换模型路由的(默认路径外有专门路由,见踩坑 5)

使用前提:一个编码 Agent(Claude Code / Codex);Atlas Cloud API Key;ffmpeg + ffprobe;Python 3 + Pillow(字幕/水印覆盖层用)。

准备工作

  1. 环境:编码 Agent;Atlas Cloud 账号(console/api-keys);ffmpeg + ffprobe(brew install ffmpeg 或平台等价命令);Python 3 + pip install pillow
  2. 获取git clone https://github.com/Alisa0808/vox-director.git ~/.claude/skills/vox-director(或下载 vox-director.skill 包走 Claude 技能 UI 安装)
  3. 成本:Skill 本身 MIT 免费;运行成本 = Atlas Cloud API 调用(关键帧出图、图生视频、TTS、音乐生成,一条 30-60 秒视频要过 6 个模型多次调用——具体单价以 Atlas Cloud 定价 为准,本站未核验具体金额,用前自己看一眼)
  4. 时间:装技能 5 分钟;跑通第一条片(含两道人工闸门确认)约 20-40 分钟
  5. 前置知识:会用命令行和编码 Agent;懂”API Key 环境变量”;英文 prompt 表述(SKILL.md 为英文,中文入口在 SKILL.zh.md)
  6. 替代方案:手搓多模型管线(Sora/Veo + ElevenLabs + 剪辑,无闸门无流水线);Higgsfield 等拼贴广告商用工具(闭源模板);直接用剪映模板(非程序化)

快速上手(3 步)

第一步:安装技能

git clone https://github.com/Alisa0808/vox-director.git ~/.claude/skills/vox-director

或下载打包的 vox-director.skill 从 Claude 技能 UI 装。Claude Code 会自动发现它;Codex 等其他 Agent 从 AGENTS.mdSKILL.md 入口读。

然后设置 API Key:

export ATLASCLOUD_API_KEY="sk-..."

预期产出:Agent 技能列表里出现 vox-director。

第二步:一句话下单

对装好技能的编码 Agent 说:

“Make me a Vox-style collage video introducing Mexican street food — English, 16:9, 15 seconds.”

预期产出:Agent 先给你一份 beat map(叙事节拍图)草案等你审批——这是第一道人工闸门,你确认叙事结构后流水线才继续。

第三步:风格盲选,然后等片

beat map 过审后,技能会把同一拍渲染成 3-4 种主题风格让你凭眼缘挑(第二道人工闸门 GATE 2)。选定后全自动:关键帧(每拍一张拼贴海报)→ 动效(图生视频)→ 旁白 + 配乐 → ffmpeg 组装(拼接、音乐躲让旁白、烧字幕+水印),产出 out/<project>/final.mp4

预期产出:一条带旁白、配乐、字幕的成品拼贴视频。

流水线全景(为什么它比”抽卡”强)

一个主题每阶段一份脚本驱动,全部挂在每个项目一份 beats.json 上:

topic
  ├─ 1. beat map        选叙事弧 → 写 beats.json        ◀── GATE 1: 你审批节拍图
  ├─ 2. style bake-off  同一拍渲染 3-4 种主题            ◀── GATE 2: 你挑风格
  ├─ 3. keyframes       每拍一张拼贴海报 (nano-banana-2)
  ├─ 4. motion          海报动画化 (gemini-omni-flash i2v)
  ├─ 5. voice + music   旁白 (xai/tts) + BGM (minimax/music)
  └─ 6. assemble        ffmpeg: 拼接、音乐躲让、字幕水印
  → final.mp4

两条核心设计判断(README 原话):

  1. 风格诞生于出图那一步:每一拍是一张完成度完整的拼贴海报,所有拼贴 DNA(撕纸、剪纸、半调、标题字)都在那张图里——海报不够”拼贴”,下游救不回来。
  2. 动效是后加的:默认用 AI 视频模型整张动画化(“活海报”路径);要戏剧性的逐件拼装效果,可选本地关键帧引擎把海报切成零件逐帧驱动(无内容过滤、像素级精确——适合真人素材)。

除 B-roll(主题进、全生成)外还有两种输入模式复用同一引擎:

  • A-roll:你已有一条真人出镜口播视频——ASR 切成节拍后重风格化为拼贴风,保留真人脸、口型与手势逐帧不动gemini-omni-flash/video-edit,失败自动重试 seedance-2.0/reference-to-video)。
  • C-roll:你只有一张静态照片(自拍、产品图)——主体被抠成”照片贴纸”永不重绘,每拍海报围绕它生成(nano-banana-2/edit),旁白还能克隆成照片本人的声音。

常见踩坑(症状 → 原因 → 解决)

  1. 模型 ID 报错 / 调用 404。症状:脚本喊找不到 google/nano-banana-2/text-to-image。原因:README 明说 “Model IDs drift”。解决:这不是你的问题——技能在跑之前会先从 GET https://api.atlascloud.ai/api/v1/models 拉实时模型列表自动适配;如果仍失败,检查 API Key 与账户额度。
  2. 成片”不够 Vox”。症状:观感像普通幻灯片。原因:违反了它自己的第一设计律——风格诞生于出图那一步,关键帧海报本身拼贴元素不够(撕边/剪纸/半调/大标题缺项)。解决:回到 GATE 2 重选风格主题,或改 references/prompt-guide.md 里的 LOOK 层措辞强化拼贴词汇;别指望动效阶段补救。
  3. 真人/品牌内容被内容过滤拦。原因:默认动效走 gemini-omni-flash/image-to-video,真人/品牌有合规路由。解决:README 给了专门路由——真人/品牌动画化用 kwaivgi/kling-video-o3-pro/image-to-video,或走本地关键帧引擎(无内容过滤、逐件拼装路径,官方标注”great for real people”)。
  4. 烧字幕/水印步骤崩溃。症状:第 6 阶段 ffmpeg 或 Python 报错。原因:缺 Pillow 或 ffmpeg/ffprobe 不在 PATH。解决:pip install pillow + brew install ffmpeg(或平台等价);ffprobe 也必须装,别只装 ffmpeg。
  5. API 账单超预期。原因:一条片过 6 个模型多次调用(每拍一张海报 + 每拍一次 i2v + TTS 全文 + 音乐整曲),15 秒短片的调用次数没有想象中少。解决:先用 15 秒短主题试跑估算单条成本再批量;beat 数控制在叙事最低够用;beats.json 可手工编辑砍拍。
  6. 技能没被 Agent 发现。原因:clone 到了错误目录,或非 Claude Agent 没读到入口。解决:Claude Code 必须放 ~/.claude/skills/vox-director(自动发现);Codex 等其他 Agent 要从仓库根 AGENTS.md 引导到 SKILL.md——在首个 prompt 里显式点名技能。

初级用法

  • 改 beats.json 而不是重下prompt:每次生成后项目目录里的 beats.json 是唯一事实源——改叙事结构直接编辑它再续跑,不用从主题重头再来。
  • 先跑 examplesexamples/ 里有现成可跑的 beats.json(含 showcase 影片的节拍数据),先跑一条建立”节拍-时长-节奏”的直觉。
  • 限定时长与语言:prompt 里显式写 “English, 16:9, 15 seconds” 这类约束,比事后抱怨成片太长有效。

高级玩法

  • A-roll 真人改造流水线:拿一条库存口播视频批量转拼贴风——真人脸和口型逐帧保留,旧内容资产低成本翻新成新视觉风格。
  • C-roll 产品图变广告:一张产品静态图 → 照片贴纸嵌进每拍海报 + 声音克隆旁白,做电商投放素材的批量变体(不同节拍图 × 不同旁白文案)。
  • 本地关键帧引擎做逐件拼装references/local-engine.md 的进阶路径把海报切零件逐帧驱动——绕开内容过滤的同时拿到戏剧性的手工拼贴动画感,真人素材首选。
  • 读 references/ 学流水线设计prompt-guide.md(LOOK 层提示词结构与 9 套主题预设)、beat-layer.md(14 种叙事弧 + 钩子/节奏/镜头模式)、models-and-gotchas.md(把 API/ffmpeg 的坑预先踩平)、voices.md(按语言/语气挑 voice_id)——照这套结构给自己的领域写同构技能。

小技巧

  1. 两道闸门是省钱的:beat map 审批在你花一分钱出图之前;风格盲选只渲染一拍。别为了快跳过它们。
  2. 声音选择有清单:references/voices.md 按语言/语气给了 xai/tts 的 voice_id 名册,别用默认音色凑合。
  3. out/<project>/ 目录里中间产物(每拍海报、动效片段)都保留着——单拍不满意只重跑那一拍的脚本,不用整条重来。
  4. 音乐躲让(duck under VO)是 ffmpeg 阶段自动做的,但如果旁白密度特别高,在 beat map 阶段就少写几拍,别指望后期混音救。
  5. 中文用户读 SKILL.zh.md(仓库自带中文版技能定义),但注意 README 说中英入口内容同构,跑的脚本链是同一条。

常见问题 FAQ

Q1: 它和直接用 Sora / Veo 生成视频有什么区别?

A: 抽卡 vs 流水线。文生视频模型一次给一条不可分解的成品,改一拍要重抽整条;vox-director 把视频拆成节拍图驱动的六阶段流水线——叙事、风格、关键帧、动效、声音、组装各自独立可控可复跑,还有两道人工闸门卡住大方向。代价是要接一串模型 API 而不是一个输入框。

Q2: 不用 Claude Code 能跑吗?

A: 能。它是客户端中立的 Agent Skill:Codex 等任意能读工作流、跑脚本的编码 Agent 从 AGENTS.mdSKILL.md 入口接入;硬性依赖是 Atlas Cloud API Key 和本地 ffmpeg/Python 环境,不是特定 Agent 品牌。

Q3: 一定要 Atlas Cloud 吗?能不能换别家 API?

A: 官方验证过的模型路由全部是 Atlas Cloud 上的 ID(nano-banana-2 / gemini-omni-flash / kling-o3-pro / xai-tts / seed-audio / minimax-music),技能还会在运行前拉 Atlas 的实时模型列表自适配。换供应商等于自己改整条模型路由层——references/models-and-gotchas.md 把坑写平了,但工程量自负。

Q4: 一条视频大概多少钱?

A: 本站未核验具体单价:成本结构 = 每拍一次文生图 + 每拍一次图生视频 + 整篇 TTS + 整曲音乐生成,模型单价以 Atlas Cloud 控制台为准。建议先跑 15 秒短主题实测自己的单条成本再批量投产。

Q5: 生成的视频版权/商用怎么办?

A: Skill 代码 MIT;但成片内容的权利取决于底层生成模型(Google/Kling/MiniMax/xAI 等)的输出条款与你的 Atlas Cloud 订阅协议——商用前逐模型确认,特别是含真人克隆声音(bytedance/seed-audio-1.0)与真人形象改制的 A/C-roll 内容。

Q6: 为什么我的成片节奏感不如 showcase?

A: showcase 片的节拍数据在 examples/ 里可以直接对照——节奏差距多数出在 beat map 的叙事弧选择和钩子密度(references/beat-layer.md 的 14 弧 + 钩子/步调模式就是为此准备的),而不是出在生成模型。

免责声明

本文基于公开资料整理(GitHub README 英文全文与仓库 API 元数据,核验日期 2026-09-15),AI 辅助生成,未在本站环境实际运行该技能或生成视频。模型 ID、闸门行为、成本量级以官方 README 与 Atlas Cloud 实时接口为准;成片商用版权问题需逐模型自查,本文不构成法律意见。

参考链接

📊 评分与标签

评分说明

总分 8.2/10 · P_优选

📊 可观测社区指标(采集日期:2026-09-15)

  • GitHub: Alisa0808/vox-director ★1,896, 🔱293(GitHub API 实时核验,2026-09-15;仓库创建 2026-07-10,约 2 个月)
  • License: MIT;Python;SKILL.md 英文 + SKILL.zh.md 中文双语技能定义
  • 最近 push 2026-08-11(约 1 个月前)
  • showcase 成片:5 条主题片(文明演化 30s / 足球 60s / 墨西哥街头美食 60s / 货币简史 60s / 硅谷简史 60s),缩略图与视频链接在 README

评分依据可追溯至公开来源,每项分数均有明确理由和数据支撑。

📦 可安装性 2.2/2.5

  • 两条安装路径:git clone ... ~/.claude/skills/vox-director(Claude Code 自动发现)或下载 vox-director.skill 包走技能 UI;非 Claude Agent 从 AGENTS.md → SKILL.md 入口读,客户端中立
  • 依赖清单明确:编码 Agent + Atlas Cloud API Key + ffmpeg/ffprobe + Python 3 + Pillow,都是常规件;环境变量一行设 Key
  • 竞品对比 1(仅 SKILL.md 单文件的技能):无 scripts/references 分层;本技能六阶段各配独立脚本 + 参考资料
  • 竞品对比 2(闭源 SaaS 视频工具):零安装但零可审计;本技能全链路开源可改
  • 限制:强绑定 Atlas Cloud 单一 API 供应商(换供应商需自改整条模型路由);Windows 用户需自行解决 ffmpeg/Python 环境(文档以 macOS brew 为准)

🎯 实用性 2.2/2.5

  • 一行主题 → 成品 mp4 全自动(B-roll 全生成),三种输入模式复用同一引擎:B-roll 主题生成 / A-roll 真人口播视频改制(ASR 切拍、真人脸口型逐帧保留、失败自动降级重试)/ C-roll 静态照片嵌入(照片贴纸永不重绘 + 声音克隆);beats.json 单一事实源可手工编辑续跑
  • 双人工闸门(beat map 审批 + 风格盲选)把”方向错了烧全款”的风险截在出图之前;14 种叙事弧 + 9 套主题预设 + 声音名册按语言/语气可选
  • 竞品对比 1(Sora/Veo 抽卡):成品不可分解、改一拍重抽整条;本技能逐拍可重跑、中间产物保留
  • 竞品对比 2(Higgsfield 等拼贴广告商用工具):模板固定;本技能 LOOK 层提示词可自由改写
  • 限制:出片质量依赖底层生成模型(nano-banana-2/gemini-omni-flash 等)当日表现;API 成本随拍数线性增长且本站未核验单价

📖 文档质量 1.9/2.0

  • README 结构为范本级:What it is(风格定义)→ 流水线全景图(含闸门标注)→ 模型路由表(真人/品牌专门路由)→ Install → Quick start → Requirements → What’s in the box(每个文件干什么)→ Credits;中英双版(README + README.zh.md,SKILL.md + SKILL.zh.md)
  • references/ 四篇专题(prompt-guide / beat-layer / voices / models-and-gotchas)把提示词结构、叙事弧、音色、API 坑各自成册;“风格诞生于出图那一步 / 动效后加”两条设计律明示因果
  • 竞品对比 1(多数社区技能):一页说明;本技能文档成体系且含”已踩平的坑”
  • 竞品对比 2(商用产品文档):营销腔;本 README 直给技术事实
  • 限制:模型 ID 承认会漂移(靠运行时拉列表自适配),文档无版本化 changelog;示例成本数据未给

👥 社区活跃 1.0/1.5

  • ★1,896 / 🔱293(2 个月仓库,增速在同体量 agent skill 里突出);作者 @alisaqqt 公开维护并持续做 agent-skill 实验
    • 来源:GitHub API(采集日期 2026-09-15)
  • 最近 push 2026-08-11(⚠️ 约 1 个月未更新,节奏放缓);单人作者项目,长期持续性未知
  • 竞品对比 1(Anthropic 官方技能仓):组织背书多人维护;本项目个人作者
  • 竞品对比 2(同等星量的工具仓库):多为被动收集 issue;本项目 references 结构显示作者深度使用自身技能
  • 缓解:全链路开源 + 模型路由自适配接口,停更后社区可自行接手

🔗 兼容性 0.9/1.5

  • 客户端中立:Claude Code(自动发现)/ Codex(AGENTS.md 入口)/ 任意能读工作流跑脚本的编码 Agent;技能运行前拉 GET /api/v1/models 实时适配 Atlas Cloud 模型 ID 漂移
  • 竞品对比 1(绑定单一 Agent CLI 的技能):跨 Agent 成本高;本技能入口层已做多客户端适配
  • 竞品对比 2(纯本地视频生成工具):无外部 API 依赖;本技能强绑 Atlas Cloud 一家供应商,不可替换性是最大短板
  • 限制:换供应商需改整条模型路由(6 个模型 × 3 种输入模式);未见 Windows 环境官方验证;ffmpeg/Python 版本兼容边界未文档化

🏷️ 标签说明

  • AI视频生成: 定位一句话主题全自动生成成品视频(关键帧/动效/配音/配乐/组装六阶段)。来源:GitHub README
  • Claude技能: Claude Code 自动发现(~/.claude/skills/ 目录),SKILL.md 定义完整工作流。来源:GitHub README Install
  • Agent工作流: beats.json 驱动的六阶段流水线 + 双人工闸门,任意编码 Agent 经 AGENTS.md 入口可用。来源:GitHub README How it works
  • 英文优先: SKILL.md 与 README 主文为英文(附 SKILL.zh.md / README.zh.md 中文版),提示词与声音名册面向英文内容最优。来源:GitHub 仓库

📋 来源核实

  • ✅ 已核验: GitHub 仓库 Alisa0808/vox-director — 2026-09-15 GitHub API 实时核验:★1,896、🔱293、MIT、创建 2026-07-10、pushed_at 2026-08-11、Python、topics(ai-video/claude-skill/text-to-video/tts/ffmpeg 等 17 个)
  • ✅ 已核验: README 英文全文 — 2026-09-15 抓取:六阶段流水线(含两道闸门)、三种输入模式(B/A/C-roll)、模型路由表(nano-banana-2 / gemini-omni-flash / kling-o3-pro / xai-tts-v1 / seed-audio-1.0 / minimax-music-2.6)、安装双路径、requirements、目录结构(SKILL.md/references/scripts/examples/assets)、showcase 五片
  • ✅ 已核验: 中文版存在 — README.zh.md 与 SKILL.zh.md 可访问(2026-09-15 raw 抓取返回 144 行)
  • ⚠️ 未实测:本站未实际安装技能或生成视频;成片质量、闸门交互体验、单条成本以官方 showcase 与 Atlas Cloud 实际计费为准