Waoowaoo
📌 适用场景:AI影视生产全流程
首家工业级全流程AI影视生产平台,多agent协作管线,1.4万Stars,82分
📋 完整步骤
- 1
部署与初始化
Docker 一键启动或本地开发模式,首次必须初始化数据库表结构
首次必跑 npx prisma db push;测试版版本间数据库不兼容,升级需清旧数据 - 2
AI 剧本分析
在设置中心配置 AI 服务 Key,上传小说自动提取角色、场景与剧情
使用工具: deepseek目前推荐使用各服务商官方 API,第三方 OpenAI Compatible 格式尚不完善 - 3
角色与场景生成
AI 生成风格一致的人物立绘与场景图
使用工具: stable-diffusionmidjourneyliblibaicomfyui一致性是短剧成败关键,锁定同一风格与种子参数 - 4
分镜视频制作与 AI 配音
自动生成分镜头并合成视频,多角色语音合成
使用工具: klingjimengrunwayviduelevenlabsfish-audio逐镜头校验人物一致性与口型,配音选多角色模型 - 5
成片导出与质量检查
合成完整成片,检查一致性、字幕与音画同步后导出
使用工具: jianyingwondershare-bocao网页卡顿可装 Caddy 启用 HTTPS 提升并发
这是什么?适合谁?
Waoowaoo(https://github.com/waooAI/waoowaoo,13.8k+ Stars、3k+ Forks,2026 年 1 月创建)是一款开源的工业级全流程 AI 影视生产平台,主打「从小说到成片」:喂给它一篇小说或剧本,它能自动完成剧本分析、一致性角色/场景生成、分镜视频制作、多角色配音,最后合成一部完整短剧或漫画视频。它把传统上需要「编剧 + 美术 + 分镜 + 配音 + 剪辑」多个角色协作的影视流程,压缩成一条可自托管的 AI 管线。
技术栈是现代 Web 全家桶:Next.js 15 + React 19 前端,MySQL + Prisma ORM 数据层,Redis + BullMQ 做任务队列(视频生成是长任务,靠队列异步排队),Tailwind CSS v4 样式,NextAuth.js 认证。五个核心功能模块清晰对应影视生产链路:AI 剧本分析(自动解析小说、提取角色/场景/剧情)、角色 & 场景生成(一致性人物和场景图)、分镜视频制作(自动分镜并合成视频)、AI 配音(多角色语音)、多语言界面(中/英一键切换)。
横向对比,它的定位是「全流程」而非「单点」:Runway、Pika、Sora、可灵 AI、即梦 AI 都是单个镜头的视频生成工具——你得到的是片段,还需要自己组织成片;剪映 是剪辑工具——素材从哪来、角色一致性怎么保证,它不管;LTX Studio、Invideo 这类 AI 视频工作室更接近,但 waoowaoo 把「小说 → 分镜 → 一致性角色 → 分镜视频 → 配音 → 成片」整条链路开源了,且可完全私有化部署。
适合人群:短剧/MCN/自媒体团队(批量产出 AI 短剧、口播视频、漫画视频);小说 IP 改编团队(快速把网文转成可视化视频做测试);想自建 AI 影视生产管线的开发者(全栈 TypeScript 可二次开发);需要数据不出内网的影视制作团队。
不适合人群:追求逐帧精细控制、电影级调色混音的专业后期(它的生成是管线化、模板化,自由度有限);只需要生成单个视频镜头的普通用户(直接用 可灵 AI、即梦 AI 更直接);不接受频繁更新/测试版不稳定的生产环境(项目明确标注「测试初期、单人开发、更新频繁」)。
准备工作
- 运行环境:Docker Desktop(最简单,拉预构建镜像即用)或本地 Node.js 开发环境(需 npm install)。本地开发还需 MySQL、Redis、MinIO(用仓库的 docker-compose 起基础设施即可,映射到非标准端口 13306/16379/19000)。
- 账号与成本:平台本身开源免费、可自托管,但仓库 License 是
NOASSERTION(自定义许可,非标准开源协议),商用前务必确认授权条款。真实成本来自你接入的 AI 服务 Key(在「设置中心」配置,内置教程):视频生成如 可灵 AI(国内按会员/积分,海外版订阅制)、即梦 AI(按积分)、Runway(Standard 约 $12/月 起、含积分);配音如 ElevenLabs(免费层 + Starter $5/月)、Fish Audio(有免费额度)。以各服务商官网实时价格为准。 - 部署命令(最简单方式,免克隆仓库):
启动后访问curl -O https://raw.githubusercontent.com/saturndec/waoowaoo/main/docker-compose.yml docker compose up -dhttp://localhost:13000。本地开发模式则cp .env.example .env(填 AI Key)→npm install→npx prisma db push→npm run dev,访问http://localhost:3000。 - 前置知识:懂 Docker 和 Node.js 基础即可;要自己编排/二开,需熟悉 Next.js + Prisma。影视创作层面,懂分镜、角色一致性、配音这些概念能让成品质量上一个台阶。
- 替代方案:当 waoowaoo 测试版不稳定、或你需要更成熟的单点能力时,可用 剪映 + 可灵 AI / 即梦 AI 手动拼一条链路;或用 LTX Studio、Invideo 等 SaaS 视频工作室;纯代码路线也可用 ComfyUI 搭自定义视频工作流。
5 步核心流程
第 1 步:部署与初始化
Docker 方式跑 docker compose up -d 即可,首次启动自动完成数据库初始化,无需额外配置。本地开发模式必须先执行 npx prisma db push 再启动——否则所有表不存在,启动后报 The table 'tasks' does not exist。⚠️ 当前是测试版,版本间数据库不兼容,升级版本要先清旧数据再拉新镜像:
docker compose down -v
docker rmi ghcr.io/saturndec/waoowaoo:latest
curl -O https://raw.githubusercontent.com/saturndec/waoowaoo/main/docker-compose.yml
docker compose up -d
预期产出:浏览器打开 http://localhost:13000(Docker)或 http://localhost:3000(本地)能看到主界面,可中英文切换。
第 2 步:AI 剧本分析
进入「设置中心」配置 AI 服务的 API Key(内置各服务商配置教程),⚠️ 目前推荐只用官方 API,第三方 OpenAI Compatible 格式尚不完善。配置好后上传你的小说/剧本文本,平台会自动解析并提取角色、场景、剧情。
可复制的验证 Prompt(用来测试剧本分析质量):
把这段小说拆成 20 个分镜,每个分镜标注:出场角色、场景地点、画面内容、景别(特写/中景/远景)。
预期产出:系统生成结构化的剧本分析结果——角色清单、场景清单、剧情/分镜拆解,作为后续生成的一致性依据。
第 3 步:角色与场景生成
基于第 2 步提取的角色和场景,用 AI 生成风格一致的人物立绘和场景图。这一步是短剧质量的分水岭:同一角色在不同分镜里必须「长得一样」,否则观众瞬间出戏。生成时锁定统一的风格描述和种子参数(seed),并为每个角色建立固定的参考图。
预期产出:每个角色有稳定一致的立绘,每个场景有统一风格的背景图,可直接用于下一步分镜合成。
第 4 步:分镜视频制作与 AI 配音
平台自动把分镜脚本结合角色/场景图,生成分镜头视频并合成;同时用多角色语音合成完成 AI 配音。视频生成是长任务,靠 Redis + BullMQ 队列异步排队,耐心等待即可。逐镜头校验人物一致性、动作连贯性和口型(如有)。
预期产出:带配音的分镜视频片段序列,角色前后一致、音画基本同步。
第 5 步:成片导出与质量检查
把分镜序列合成为完整成片,做最终质检:检查跨镜头角色一致性、字幕准确度、配音与画面同步、转场流畅度。导出最终视频。若发现网页卡顿(HTTP 下浏览器限制并发连接),可装 Caddy 启用 HTTPS 提升并发,访问 https://localhost:1443。
预期产出:一部从小说自动生成的完整短剧/漫画视频成片,可直接发布或进入人工精修。
常见踩坑(6 条)
踩坑 1:本地启动报 tasks 表不存在
- 症状:
npm run dev后报错The table 'tasks' does not exist - 原因:跳过了
npx prisma db push,数据库表结构没初始化 - 解决:先跑
npx prisma db push再启动开发服务器(官方 README 明确标注为 WARNING)
踩坑 2:升级版本后数据异常 / 界面错乱
- 症状:升级镜像后旧数据打不开、功能异常
- 原因:测试版版本间数据库不兼容,schema 变了
- 解决:按官方流程
docker compose down -v清旧数据再拉新镜像;升级后清空浏览器缓存并重新登录
踩坑 3:AI 服务调用失败 / 生成报错
- 症状:配置了 Key 但生成一直失败
- 原因:用了第三方 OpenAI Compatible 中转格式,官方明确说该格式「尚不完善」
- 解决:改用各服务商的官方 API;Key 填写到「设置中心」并保存后重试
踩坑 4:角色在不同分镜里长得不一致
- 症状:同一角色每帧脸都不一样,成片「换脸」
- 原因:没锁定风格与种子、没为角色建固定参考图
- 解决:第 3 步就统一风格描述 + 固定 seed + 角色参考图,分镜生成全程复用
踩坑 5:视频生成任务卡住不返回
- 症状:提交生成后长时间无结果
- 原因:视频生成是长任务,靠 BullMQ 队列排队;Key 额度耗尽或任务失败也会卡
- 解决:先看队列/任务状态确认是否在排队;检查 AI 服务额度;失败的任务重试
踩坑 6:网页卡顿、并发上不去
- 症状:本地同时开多个生成任务时页面明显卡顿
- 原因:HTTP 模式下浏览器限制并发连接数
- 解决:装 Caddy 启用 HTTPS(
caddy run --config Caddyfile),访问https://localhost:1443
常见问题 FAQ
Q1:Waoowaoo 免费吗?可以商用吗?
A:项目开源、可自托管免费使用,但仓库 License 是 NOASSERTION(自定义许可),不是标准的 MIT/Apache,商用授权条款需到仓库 LICENSE 文件或官网确认。实际成本来自你接入的视频/图像/配音 API。来源:GitHub 仓库。
Q2:它和 Runway、可灵、即梦这些工具有什么区别? A:Runway、可灵 AI、即梦 AI、Sora 是「单镜头视频生成」工具,产出的是片段;waoowaoo 是「全流程影视生产平台」,从小说一路做到成片,并且开源、可私有化。简单说:前者是「摄影机」,后者是「整个剧组 + 制片流水线」。
Q3:必须自己部署吗?有在线版吗? A:可以不自部署——官网 waoowaoo.com 有网页版内测(加入候补即可)。但网页版可能需要排队/付费,自托管则完全免费、数据自有。追求省事用在线版,追求可控和免费用自托管。
Q4:适合做多长的视频?只能做短剧吗? A:目前定位是短剧/漫画视频,适合 1–5 分钟的分镜式内容;长视频、复杂剧情、精细镜头调度不是它的强项。官方描述也提到「从短片到实拍」的演进方向,但当前以短剧为主。
Q5:项目稳定吗?适合生产环境吗? A:谨慎。README 明确标注「测试初期、单人开发、更新非常频繁、版本间数据库不兼容」。适合尝鲜、原型验证、内部工具,不建议直接上关键生产;若必须生产用,固定镜像版本、做好数据备份,并跟进官方更新节奏。
参考链接
本文基于官方文档和公开资料整理,AI辅助生成,MagicNetWorld 尚未完成独立实测。
📊 评分与标签
评分说明
总分 8.2/10 · P_优选
📊 可观测社区指标(采集日期:2026-08-22)
- GitHub: waooAI/waoowaoo ★13,764 · 🔱3,038
- 最近 push:2026-08-13(9 天前,活跃);仓库创建:2026-01-22;许可证:自定义(非标准 SPDX 标识);主语言:TypeScript
- 官网:www.waoowaoo.com
- 数据来源:GitHub REST API
repos/waooAI/waoowaoo(2026-08-22 实时实测)
📋 流程完整性 2.5/3.0
- 端到端影视生产管线:AI 剧本分析(自动解析小说提取角色/场景/剧情)→ 角色 & 场景生成(一致性人物/场景图)→ 分镜视频制作(自动生成分镜头并合成视频)→ AI 配音(多角色语音合成)→ 多语言输出
- 定位覆盖从短剧到真人电影(From shorts to live-action with Hollywood-standard workflows),是全流程而非单点工具
- 来源:GitHub API 描述 + 官网
- 扣分点:README 明确标注”测试初期阶段,单人开发,存在部分 bug 和不完善之处”,且版本间数据库不兼容、升级需清空数据
- 竞品对比 1(Sora):OpenAI Sora 是单一文生视频模型,只做”文本→视频”一步;Waoowaoo 覆盖剧本→角色→分镜→配音→成片的完整生产管线
- 竞品对比 2(Runway / Pika):Runway、Pika 聚焦视频生成与局部编辑,缺少角色一致性管理、多角色配音、小说自动拆解的制片流程
🔄 可复用性 2.0/2.5
- 提供三种部署方式(预构建镜像 / 克隆+构建 / 本地开发),docker-compose 一键拉起 MySQL/Redis/MinIO,降低复用门槛
- 技术栈清晰:Next.js 15 + React 19、MySQL + Prisma ORM、Redis + BullMQ、Tailwind CSS v4、NextAuth.js,适合二次开发
- 扣分点:测试版数据库 schema 频繁变动、升级需 down -v 清库,短期复用/迁移成本高;外部 PR 不会被直接合并
- 竞品对比 1(ComfyUI):ComfyUI 作为节点式扩散工作流可任意组合模型,复用面更通用;Waoowaoo 复用锁定在影视生产垂直域
- 竞品对比 2(ShortGPT):ShortGPT 也是开源短剧生成框架,但已停更多时、生态不活跃;Waoowaoo 更新频繁(最近 push 2026-08-13)且社区规模更大
📖 文档清晰度 1.7/2.0
- README 中英双语,含功能特性、三种快速开始方式、API 配置说明、技术栈、页面预览截图与 Star History
- 关键坑点文档化到位:明确警告跳过
npx prisma db push会报The table 'tasks' does not exist,并给出 HTTP 卡顿→Caddy HTTPS 的解决方案 - 扣分点:无独立文档站(仅官网 + 内测候补),API Key 各服务商配置依赖”内置配置教程”,缺少体系化 API 文档
- 竞品对比 1(ComfyUI):ComfyUI 有完整 wiki + 海量社区教程,文档生态远更成熟;Waoowaoo 文档仍以 README 单文件为主
- 竞品对比 2(Sora / Runway):官方产品文档完善但闭源、不可自部署;Waoowaoo 开源文档虽薄但覆盖自部署全流程
🔧 工具集成 1.3/1.5
- 基础设施集成完整:MySQL + Prisma、Redis + BullMQ 队列、MinIO 对象存储、NextAuth 认证,生产化组件齐全
- 支持在”设置中心”配置多服务商 AI API Key(内置配置教程),面向多模型接入
- 扣分点:官方明确”仅推荐官方 API,第三方 OpenAI Compatible 格式尚不完善”,API 兼容面受限
- 竞品对比 1(ComfyUI):ComfyUI 通过自定义节点支持任意模型/API,集成面极广;Waoowaoo 的模型接入受限于 OpenAI Compatible 尚未完善
- 竞品对比 2(DiffSynth-Studio):DiffSynth 覆盖文生图/视频/音频多种模型管线,集成广度更大;Waoowaoo 集成更聚焦影视生产所需组件
💡 创新性 0.7/1.0
- 亮点:宣称”首家工业级全流程 AI 影视生产平台”,把小说→分镜→角色一致性→配音→成片整合为可自部署的开源管线,并引入多 Agent 协作
- 来源:GitHub README + 官网
- 上线约 7 个月即达 13.7k Stars、Trendshift 上榜(repositories/22585),验证了该定位的市场稀缺性
- 来源:GitHub README + GitHub API
- 扣分点:当前仍属”把已有 AIGC 能力串成管线”的工程创新,底层依赖外部文生图/视频模型,无自研基础模型
- 竞品对比 1(Sora):Sora 在基础模型能力上创新更强(自研视频模型),但缺少制片流程产品化;Waoowaoo 创新在流程编排而非模型
- 竞品对比 2(ShortGPT 等开源短剧工具):ShortGPT 同类开源方案多已沉寂,Waoowaoo 的全流程 + 多 Agent 协作 + 活跃维护构成差异化
评分依据可追溯至公开来源,每项分数均有明确理由和数据支撑。
🏷️ 标签说明
- AI视频生成: 从文本/小说自动生成分镜并合成完整视频。来源:GitHub README
- 多Agent: 平台采用多 Agent 协作管线完成剧本分析、角色生成、分镜、配音等分工。来源:GitHub API 描述
- 影视生产: 面向短剧/漫画视频/真人电影等影视制作场景。来源:GitHub README
- 协作管线: 剧本分析→角色场景→分镜→配音→成片是一条多环节协作的生产管线。来源:GitHub README
- 工业级: 官方定位”工业级全流程 AI 影视生产平台”,对标好莱坞标准工作流。来源:GitHub README
📋 来源核实
- ✅ 已核实(GitHub API 实时实测,2026-08-22): waooAI/waoowaoo — stars=13,764、forks=3,038、pushed_at=2026-08-13、license=自定义(NOASSERTION)、language=TypeScript
- ✅ 已核实: README — 功能特性、三种部署方式、API 配置、技术栈
- ⚠️ 未验证: 官网 www.waoowaoo.com 的在线内测候补流程未实际注册核验(以 README/API homepage 字段为准)
⚠️ 局限与未实测声明
- 本文社区指标于 2026-08-22 通过 GitHub API 实测;维度评分基于公开 README/API 描述评估,未在本地部署运行
- 项目为测试初期单人开发,功能与数据库 schema 频繁变动,上述功能细节可能随版本变化
- 许可证为自定义(NOASSERTION),商用前请自行确认许可条款