vox-director
Vox Director:一句话主题变 Vox 风格纸拼贴讲解/广告片——脚本、拼贴关键帧、动效、配音、配乐、字幕全自动流水线(Atlas Cloud API + 本地 ffmpeg)。Agent Skill,Claude Code / Codex 均可用。MIT。
评分明细
适用场景
这是什么?适合谁?
Vox Director(MIT,Python + ffmpeg)是一个 Agent Skill(编码代理技能):你给它一行主题(“给我做一个介绍墨西哥街头美食的 Vox 风格拼贴视频,英文,16:9,15 秒”),它产出一条成品 final.mp4——剧本、纸拼贴关键帧、动效、旁白、配乐、字幕,全程自动化,跑在 Atlas Cloud API + 本地 ffmpeg 上,任何编码 Agent(Claude Code、Codex 等)都能用。
视觉风格是 Vox 解释视频带火的那种现代编辑部纸拼贴(paper-collage):手剪纸片、撕裂边缘、胶带、半调网点、报纸剪报、每拍一记大字标题——再用动效、旁白、音乐和字幕活起来。
适合谁:
- 用 Claude Code / Codex 的创作者,要批量产出”Vox 风”知识讲解视频、产品广告片、社交媒体短内容
- 内容团队想要一条可复现、可改参数的视频生成流水线,而不是每次手搓 Sora/Veo 抽卡
- 研究”Agent Skill 工程化”的人——它是少数带双人工决策闸门(beat map 审批 + 风格盲选)的完整六阶段流水线范本
不适合谁:
- 想要真人实拍剪辑的(这是生成式拼贴动画,不是剪辑器;剪辑需求看 FableCut)
- 没有编码 Agent、不想办 API Key 的纯手动用户
- 对视频里出现真实人脸/品牌有合规顾虑又不懂换模型路由的(默认路径外有专门路由,见踩坑 5)
使用前提:一个编码 Agent(Claude Code / Codex);Atlas Cloud API Key;ffmpeg + ffprobe;Python 3 + Pillow(字幕/水印覆盖层用)。
准备工作
- 环境:编码 Agent;Atlas Cloud 账号(console/api-keys);ffmpeg + ffprobe(
brew install ffmpeg或平台等价命令);Python 3 +pip install pillow - 获取:
git clone https://github.com/Alisa0808/vox-director.git ~/.claude/skills/vox-director(或下载vox-director.skill包走 Claude 技能 UI 安装) - 成本:Skill 本身 MIT 免费;运行成本 = Atlas Cloud API 调用(关键帧出图、图生视频、TTS、音乐生成,一条 30-60 秒视频要过 6 个模型多次调用——具体单价以 Atlas Cloud 定价 为准,本站未核验具体金额,用前自己看一眼)
- 时间:装技能 5 分钟;跑通第一条片(含两道人工闸门确认)约 20-40 分钟
- 前置知识:会用命令行和编码 Agent;懂”API Key 环境变量”;英文 prompt 表述(SKILL.md 为英文,中文入口在 SKILL.zh.md)
- 替代方案:手搓多模型管线(Sora/Veo + ElevenLabs + 剪辑,无闸门无流水线);Higgsfield 等拼贴广告商用工具(闭源模板);直接用剪映模板(非程序化)
快速上手(3 步)
第一步:安装技能
git clone https://github.com/Alisa0808/vox-director.git ~/.claude/skills/vox-director
或下载打包的 vox-director.skill 从 Claude 技能 UI 装。Claude Code 会自动发现它;Codex 等其他 Agent 从 AGENTS.md → SKILL.md 入口读。
然后设置 API Key:
export ATLASCLOUD_API_KEY="sk-..."
预期产出:Agent 技能列表里出现 vox-director。
第二步:一句话下单
对装好技能的编码 Agent 说:
“Make me a Vox-style collage video introducing Mexican street food — English, 16:9, 15 seconds.”
预期产出:Agent 先给你一份 beat map(叙事节拍图)草案等你审批——这是第一道人工闸门,你确认叙事结构后流水线才继续。
第三步:风格盲选,然后等片
beat map 过审后,技能会把同一拍渲染成 3-4 种主题风格让你凭眼缘挑(第二道人工闸门 GATE 2)。选定后全自动:关键帧(每拍一张拼贴海报)→ 动效(图生视频)→ 旁白 + 配乐 → ffmpeg 组装(拼接、音乐躲让旁白、烧字幕+水印),产出 out/<project>/final.mp4。
预期产出:一条带旁白、配乐、字幕的成品拼贴视频。
流水线全景(为什么它比”抽卡”强)
一个主题每阶段一份脚本驱动,全部挂在每个项目一份 beats.json 上:
topic
├─ 1. beat map 选叙事弧 → 写 beats.json ◀── GATE 1: 你审批节拍图
├─ 2. style bake-off 同一拍渲染 3-4 种主题 ◀── GATE 2: 你挑风格
├─ 3. keyframes 每拍一张拼贴海报 (nano-banana-2)
├─ 4. motion 海报动画化 (gemini-omni-flash i2v)
├─ 5. voice + music 旁白 (xai/tts) + BGM (minimax/music)
└─ 6. assemble ffmpeg: 拼接、音乐躲让、字幕水印
→ final.mp4
两条核心设计判断(README 原话):
- 风格诞生于出图那一步:每一拍是一张完成度完整的拼贴海报,所有拼贴 DNA(撕纸、剪纸、半调、标题字)都在那张图里——海报不够”拼贴”,下游救不回来。
- 动效是后加的:默认用 AI 视频模型整张动画化(“活海报”路径);要戏剧性的逐件拼装效果,可选本地关键帧引擎把海报切成零件逐帧驱动(无内容过滤、像素级精确——适合真人素材)。
除 B-roll(主题进、全生成)外还有两种输入模式复用同一引擎:
- A-roll:你已有一条真人出镜口播视频——ASR 切成节拍后重风格化为拼贴风,保留真人脸、口型与手势逐帧不动(
gemini-omni-flash/video-edit,失败自动重试seedance-2.0/reference-to-video)。 - C-roll:你只有一张静态照片(自拍、产品图)——主体被抠成”照片贴纸”永不重绘,每拍海报围绕它生成(
nano-banana-2/edit),旁白还能克隆成照片本人的声音。
常见踩坑(症状 → 原因 → 解决)
- 模型 ID 报错 / 调用 404。症状:脚本喊找不到
google/nano-banana-2/text-to-image。原因:README 明说 “Model IDs drift”。解决:这不是你的问题——技能在跑之前会先从GET https://api.atlascloud.ai/api/v1/models拉实时模型列表自动适配;如果仍失败,检查 API Key 与账户额度。 - 成片”不够 Vox”。症状:观感像普通幻灯片。原因:违反了它自己的第一设计律——风格诞生于出图那一步,关键帧海报本身拼贴元素不够(撕边/剪纸/半调/大标题缺项)。解决:回到 GATE 2 重选风格主题,或改
references/prompt-guide.md里的 LOOK 层措辞强化拼贴词汇;别指望动效阶段补救。 - 真人/品牌内容被内容过滤拦。原因:默认动效走
gemini-omni-flash/image-to-video,真人/品牌有合规路由。解决:README 给了专门路由——真人/品牌动画化用kwaivgi/kling-video-o3-pro/image-to-video,或走本地关键帧引擎(无内容过滤、逐件拼装路径,官方标注”great for real people”)。 - 烧字幕/水印步骤崩溃。症状:第 6 阶段 ffmpeg 或 Python 报错。原因:缺 Pillow 或 ffmpeg/ffprobe 不在 PATH。解决:
pip install pillow+brew install ffmpeg(或平台等价);ffprobe也必须装,别只装 ffmpeg。 - API 账单超预期。原因:一条片过 6 个模型多次调用(每拍一张海报 + 每拍一次 i2v + TTS 全文 + 音乐整曲),15 秒短片的调用次数没有想象中少。解决:先用 15 秒短主题试跑估算单条成本再批量;beat 数控制在叙事最低够用;
beats.json可手工编辑砍拍。 - 技能没被 Agent 发现。原因:clone 到了错误目录,或非 Claude Agent 没读到入口。解决:Claude Code 必须放
~/.claude/skills/vox-director(自动发现);Codex 等其他 Agent 要从仓库根AGENTS.md引导到SKILL.md——在首个 prompt 里显式点名技能。
初级用法
- 改 beats.json 而不是重下prompt:每次生成后项目目录里的
beats.json是唯一事实源——改叙事结构直接编辑它再续跑,不用从主题重头再来。 - 先跑 examples:
examples/里有现成可跑的beats.json(含 showcase 影片的节拍数据),先跑一条建立”节拍-时长-节奏”的直觉。 - 限定时长与语言:prompt 里显式写 “English, 16:9, 15 seconds” 这类约束,比事后抱怨成片太长有效。
高级玩法
- A-roll 真人改造流水线:拿一条库存口播视频批量转拼贴风——真人脸和口型逐帧保留,旧内容资产低成本翻新成新视觉风格。
- C-roll 产品图变广告:一张产品静态图 → 照片贴纸嵌进每拍海报 + 声音克隆旁白,做电商投放素材的批量变体(不同节拍图 × 不同旁白文案)。
- 本地关键帧引擎做逐件拼装:
references/local-engine.md的进阶路径把海报切零件逐帧驱动——绕开内容过滤的同时拿到戏剧性的手工拼贴动画感,真人素材首选。 - 读 references/ 学流水线设计:
prompt-guide.md(LOOK 层提示词结构与 9 套主题预设)、beat-layer.md(14 种叙事弧 + 钩子/节奏/镜头模式)、models-and-gotchas.md(把 API/ffmpeg 的坑预先踩平)、voices.md(按语言/语气挑 voice_id)——照这套结构给自己的领域写同构技能。
小技巧
- 两道闸门是省钱的:beat map 审批在你花一分钱出图之前;风格盲选只渲染一拍。别为了快跳过它们。
- 声音选择有清单:
references/voices.md按语言/语气给了 xai/tts 的 voice_id 名册,别用默认音色凑合。 out/<project>/目录里中间产物(每拍海报、动效片段)都保留着——单拍不满意只重跑那一拍的脚本,不用整条重来。- 音乐躲让(duck under VO)是 ffmpeg 阶段自动做的,但如果旁白密度特别高,在 beat map 阶段就少写几拍,别指望后期混音救。
- 中文用户读 SKILL.zh.md(仓库自带中文版技能定义),但注意 README 说中英入口内容同构,跑的脚本链是同一条。
常见问题 FAQ
Q1: 它和直接用 Sora / Veo 生成视频有什么区别?
A: 抽卡 vs 流水线。文生视频模型一次给一条不可分解的成品,改一拍要重抽整条;vox-director 把视频拆成节拍图驱动的六阶段流水线——叙事、风格、关键帧、动效、声音、组装各自独立可控可复跑,还有两道人工闸门卡住大方向。代价是要接一串模型 API 而不是一个输入框。
Q2: 不用 Claude Code 能跑吗?
A: 能。它是客户端中立的 Agent Skill:Codex 等任意能读工作流、跑脚本的编码 Agent 从 AGENTS.md → SKILL.md 入口接入;硬性依赖是 Atlas Cloud API Key 和本地 ffmpeg/Python 环境,不是特定 Agent 品牌。
Q3: 一定要 Atlas Cloud 吗?能不能换别家 API?
A: 官方验证过的模型路由全部是 Atlas Cloud 上的 ID(nano-banana-2 / gemini-omni-flash / kling-o3-pro / xai-tts / seed-audio / minimax-music),技能还会在运行前拉 Atlas 的实时模型列表自适配。换供应商等于自己改整条模型路由层——references/models-and-gotchas.md 把坑写平了,但工程量自负。
Q4: 一条视频大概多少钱?
A: 本站未核验具体单价:成本结构 = 每拍一次文生图 + 每拍一次图生视频 + 整篇 TTS + 整曲音乐生成,模型单价以 Atlas Cloud 控制台为准。建议先跑 15 秒短主题实测自己的单条成本再批量投产。
Q5: 生成的视频版权/商用怎么办?
A: Skill 代码 MIT;但成片内容的权利取决于底层生成模型(Google/Kling/MiniMax/xAI 等)的输出条款与你的 Atlas Cloud 订阅协议——商用前逐模型确认,特别是含真人克隆声音(bytedance/seed-audio-1.0)与真人形象改制的 A/C-roll 内容。
Q6: 为什么我的成片节奏感不如 showcase?
A: showcase 片的节拍数据在 examples/ 里可以直接对照——节奏差距多数出在 beat map 的叙事弧选择和钩子密度(references/beat-layer.md 的 14 弧 + 钩子/步调模式就是为此准备的),而不是出在生成模型。
免责声明
本文基于公开资料整理(GitHub README 英文全文与仓库 API 元数据,核验日期 2026-09-15),AI 辅助生成,未在本站环境实际运行该技能或生成视频。模型 ID、闸门行为、成本量级以官方 README 与 Atlas Cloud 实时接口为准;成片商用版权问题需逐模型自查,本文不构成法律意见。
参考链接
📊 评分与标签
评分说明
总分 8.2/10 · P_优选
📊 可观测社区指标(采集日期:2026-09-15)
- GitHub: Alisa0808/vox-director ★1,896, 🔱293(GitHub API 实时核验,2026-09-15;仓库创建 2026-07-10,约 2 个月)
- License: MIT;Python;SKILL.md 英文 + SKILL.zh.md 中文双语技能定义
- 最近 push 2026-08-11(约 1 个月前)
- showcase 成片:5 条主题片(文明演化 30s / 足球 60s / 墨西哥街头美食 60s / 货币简史 60s / 硅谷简史 60s),缩略图与视频链接在 README
评分依据可追溯至公开来源,每项分数均有明确理由和数据支撑。
📦 可安装性 2.2/2.5
- 两条安装路径:
git clone ... ~/.claude/skills/vox-director(Claude Code 自动发现)或下载vox-director.skill包走技能 UI;非 Claude Agent 从 AGENTS.md → SKILL.md 入口读,客户端中立 - 依赖清单明确:编码 Agent + Atlas Cloud API Key + ffmpeg/ffprobe + Python 3 + Pillow,都是常规件;环境变量一行设 Key
- 竞品对比 1(仅 SKILL.md 单文件的技能):无 scripts/references 分层;本技能六阶段各配独立脚本 + 参考资料
- 竞品对比 2(闭源 SaaS 视频工具):零安装但零可审计;本技能全链路开源可改
- 限制:强绑定 Atlas Cloud 单一 API 供应商(换供应商需自改整条模型路由);Windows 用户需自行解决 ffmpeg/Python 环境(文档以 macOS brew 为准)
🎯 实用性 2.2/2.5
- 一行主题 → 成品 mp4 全自动(B-roll 全生成),三种输入模式复用同一引擎:B-roll 主题生成 / A-roll 真人口播视频改制(ASR 切拍、真人脸口型逐帧保留、失败自动降级重试)/ C-roll 静态照片嵌入(照片贴纸永不重绘 + 声音克隆);beats.json 单一事实源可手工编辑续跑
- 双人工闸门(beat map 审批 + 风格盲选)把”方向错了烧全款”的风险截在出图之前;14 种叙事弧 + 9 套主题预设 + 声音名册按语言/语气可选
- 竞品对比 1(Sora/Veo 抽卡):成品不可分解、改一拍重抽整条;本技能逐拍可重跑、中间产物保留
- 竞品对比 2(Higgsfield 等拼贴广告商用工具):模板固定;本技能 LOOK 层提示词可自由改写
- 限制:出片质量依赖底层生成模型(nano-banana-2/gemini-omni-flash 等)当日表现;API 成本随拍数线性增长且本站未核验单价
📖 文档质量 1.9/2.0
- README 结构为范本级:What it is(风格定义)→ 流水线全景图(含闸门标注)→ 模型路由表(真人/品牌专门路由)→ Install → Quick start → Requirements → What’s in the box(每个文件干什么)→ Credits;中英双版(README + README.zh.md,SKILL.md + SKILL.zh.md)
- 来源:GitHub README(2026-09-15 抓取全文 144 行)
- references/ 四篇专题(prompt-guide / beat-layer / voices / models-and-gotchas)把提示词结构、叙事弧、音色、API 坑各自成册;“风格诞生于出图那一步 / 动效后加”两条设计律明示因果
- 竞品对比 1(多数社区技能):一页说明;本技能文档成体系且含”已踩平的坑”
- 竞品对比 2(商用产品文档):营销腔;本 README 直给技术事实
- 限制:模型 ID 承认会漂移(靠运行时拉列表自适配),文档无版本化 changelog;示例成本数据未给
👥 社区活跃 1.0/1.5
- ★1,896 / 🔱293(2 个月仓库,增速在同体量 agent skill 里突出);作者 @alisaqqt 公开维护并持续做 agent-skill 实验
- 来源:GitHub API(采集日期 2026-09-15)
- 最近 push 2026-08-11(⚠️ 约 1 个月未更新,节奏放缓);单人作者项目,长期持续性未知
- 竞品对比 1(Anthropic 官方技能仓):组织背书多人维护;本项目个人作者
- 竞品对比 2(同等星量的工具仓库):多为被动收集 issue;本项目 references 结构显示作者深度使用自身技能
- 缓解:全链路开源 + 模型路由自适配接口,停更后社区可自行接手
🔗 兼容性 0.9/1.5
- 客户端中立:Claude Code(自动发现)/ Codex(AGENTS.md 入口)/ 任意能读工作流跑脚本的编码 Agent;技能运行前拉
GET /api/v1/models实时适配 Atlas Cloud 模型 ID 漂移 - 竞品对比 1(绑定单一 Agent CLI 的技能):跨 Agent 成本高;本技能入口层已做多客户端适配
- 竞品对比 2(纯本地视频生成工具):无外部 API 依赖;本技能强绑 Atlas Cloud 一家供应商,不可替换性是最大短板
- 限制:换供应商需改整条模型路由(6 个模型 × 3 种输入模式);未见 Windows 环境官方验证;ffmpeg/Python 版本兼容边界未文档化
🏷️ 标签说明
- AI视频生成: 定位一句话主题全自动生成成品视频(关键帧/动效/配音/配乐/组装六阶段)。来源:GitHub README
- Claude技能: Claude Code 自动发现(~/.claude/skills/ 目录),SKILL.md 定义完整工作流。来源:GitHub README Install
- Agent工作流: beats.json 驱动的六阶段流水线 + 双人工闸门,任意编码 Agent 经 AGENTS.md 入口可用。来源:GitHub README How it works
- 英文优先: SKILL.md 与 README 主文为英文(附 SKILL.zh.md / README.zh.md 中文版),提示词与声音名册面向英文内容最优。来源:GitHub 仓库
📋 来源核实
- ✅ 已核验: GitHub 仓库 Alisa0808/vox-director — 2026-09-15 GitHub API 实时核验:★1,896、🔱293、MIT、创建 2026-07-10、pushed_at 2026-08-11、Python、topics(ai-video/claude-skill/text-to-video/tts/ffmpeg 等 17 个)
- ✅ 已核验: README 英文全文 — 2026-09-15 抓取:六阶段流水线(含两道闸门)、三种输入模式(B/A/C-roll)、模型路由表(nano-banana-2 / gemini-omni-flash / kling-o3-pro / xai-tts-v1 / seed-audio-1.0 / minimax-music-2.6)、安装双路径、requirements、目录结构(SKILL.md/references/scripts/examples/assets)、showcase 五片
- ✅ 已核验: 中文版存在 — README.zh.md 与 SKILL.zh.md 可访问(2026-09-15 raw 抓取返回 144 行)
- ⚠️ 未实测:本站未实际安装技能或生成视频;成片质量、闸门交互体验、单条成本以官方 showcase 与 Atlas Cloud 实际计费为准