Video AI Talking
video-ai-talking:AI 真人口播视频本地生成器——上传真人出镜视频,写好文案与字幕,本机 TTS 配音并对口型,合成竖屏 9:16 MP4。密钥只留在浏览器本地,MIT 开源。
这是什么?适合谁?
video-ai-talking(作者 yizhi-chengzi,MIT 开源)是一个在本地浏览器里生成”真人口播”视频的工具:你上传一段真人出镜的视频素材(脸清楚就行,不用说话),写好要说的话,它会用本机 TTS 引擎配音、自动做唇形同步(lip-sync),再套上选定的字幕样式,直接合成竖屏 9:16 的 MP4 成片。项目最大的卖点是隐私:API 密钥只存在浏览器 localStorage 里,视频不上传到任何第三方服务器,生成过程在本地完成。
适合谁:想做真人口播内容又不想出镜念稿的自媒体作者;需要批量生产短视频口播内容的运营人员;对素材隐私敏感、不想把视频传到云端平台的创作者。
不适合谁:需要企业级数字人平台(多形象管理、团队协作、批量投放)的团队;需要横屏或复杂运镜视频的用户(本工具专注竖屏口播场景)。
使用前提:需要现代浏览器;TTS/LLM 能力需自备 API Key(密钥只留本地浏览器);对口型效果依赖上传视频的画面清晰度(正面近景、嘴部无遮挡最佳)。
准备工作
- 环境:现代浏览器(Chrome/Edge)。项目仓库提供 Docker 与本地部署两种方式
- 获取:
git clone https://github.com/yizhi-chengzi/video-ai-talking.git,按仓库 README 启动 - 成本:软件本身 MIT 免费开源;TTS 配音与文案生成消耗你自己 API Key 的费用(无服务器端计费)
- 时间:部署 10-20 分钟;产出第一条口播视频约 10 分钟
- 前置知识:无编程要求(Web 界面操作);需要知道如何申请并填入 TTS API Key
快速上手(3 步)
第一步:启动工具
按仓库 README 的方式启动(Docker 一条命令,或本地 npm install && npm run dev)。浏览器打开本地页面,进入工作台:左侧是”口播真人视频”与素材区,中间是配音、BGM 和文案区,右侧选皮肤(字幕样式)并预览。
预期产出:能看到三栏工作台界面,历史成片在”成片库”里预览、下载或删除。
第二步:上传视频 + 写文案
把一段真人出镜的视频(脸清楚即可,不用说话,时长建议 30 秒以内)放入”口播真人视频”区;在文案区写好要说的话,或用内置 AI 文案辅助生成。仓库 demos/ 目录自带演示素材 talking-head-cn.mp4(竖屏 9:16、东亚男性正面近景,来自 Pexels/cottonbro studio,可直接用来试对口型)。
预期产出:工作台出现你的视频画面与待合成文案。
第三步:配音、对口型、合成
选好字幕样式,点击生成。工具在本机调用 TTS 为文案配音,自动做唇形同步,把音频、视频、字幕合成竖屏 MP4。完成后在”成片库”预览,满意即下载。
预期产出:一条 9:16 竖屏 MP4 口播视频,嘴型与文案配音对齐,带所选字幕样式。
常见踩坑(症状 → 原因 → 解决)
- 对口型效果差、嘴型对不上。原因:上传视频非正面近景、嘴部有遮挡或画面过暗,唇形检测失败。解决:换正面近景素材,先用
demos/talking-head-cn.mp4验证管线本身正常。 - 生成的视频没有声音。原因:TTS API Key 未填或已过期,配音环节静默失败。解决:在设置里填入有效 Key(只存浏览器本地),先用一句短文案测试 TTS 是否出声。
- 生成过程卡住或极慢。原因:本地机器同时跑浏览器与合成管线,资源不足;或视频素材分辨率过大。解决:关闭其他占用 GPU/CPU 的程序,用仓库 demos 的小尺寸素材先跑通。
- 不想部署却直接打开页面。原因:仓库是前后端项目,不是纯静态页面。解决:按 README 用 Docker 或本地 npm 启动,不要直接双击 HTML。
- 担心密钥/素材泄露。原因:对云端数字人平台的隐私顾虑。解决:本项目设计上密钥只留在浏览器、素材本地处理;但仍建议不要把包含敏感内容的素材用于任何 AI 工具。
初级用法
- 零出镜做口播:一段 Pexels 免费真人素材 + 你的文案 = 一条口播视频,全程不用真人录制。
- 多语言配音:文案改语言 + TTS 换音色,同一段视频产出不同语言版本。
- 字幕皮肤切换:右侧皮肤区选不同字幕样式,预览后合成,适合平台差异化发布。
高级玩法
- BGM 混音:中间栏的 BGM 区给成片配背景音乐,控制口播与音乐音量比例。
- 文案管线:内置 AI 文案辅助改写口播稿,先让模型按你的选题写初稿,再人工润色。
- 素材库复用:多套真人出镜素材反复搭配不同文案,把”出镜”成本摊薄到零。
小技巧
- 先用 demos 自带素材跑通全流程,再换自己的视频,能快速定位问题在素材还是在环境。
- 文案口语化、短句化,TTS 配音自然度和对口型准确度都会更好。
- 竖屏 9:16 素材直接符合抖音/视频号/小红书格式,无需二次裁剪。
- API Key 填好后先用 5 秒短文案测试,避免长文案合成失败浪费时间。
- 历史成片在”成片库”可重复下载,生成前先确认文案最终稿。
常见问题 FAQ
Q1: 一定要自己部署吗?有在线版吗?
A: 仓库提供 Docker 与本地部署两种方式,按 README 启动即可。本站核验时未发现官方托管版;如需零部署可选云端数字人平台,但素材与密钥会离开本地。
Q2: 和 SaaS 数字人平台(如 HeyGen、万兴播爆)比怎么选?
A: 本工具免费开源、素材与密钥留在本地、专注竖屏口播单场景;SaaS 平台功能更全(形象库、协作、投放)但按订阅计费且素材上云。隐私敏感、单一场景选本工具,企业批量生产选 SaaS。
Q3: 对口型质量能达到商用数字人水平吗?
A: 本地唇形同步效果依赖素材质量,属于实用级而非商用数字人级。正式商用投放前建议先小范围测试成片效果。
Q4: 支持横屏视频吗?
A: 项目定位是竖屏 9:16 口播(适配短视频平台)。横屏需求需自行评估,非其核心场景。
Q5: 密钥安全吗?
A: 设计上密钥只存在浏览器本地(localStorage),不经服务器存储。但仍建议使用可承受泄露额度的 Key,并定期轮换。
免责声明
本文基于公开资料整理,AI 辅助生成,未实际运行该软件逐项验证功能效果。文中功能描述以官方仓库 README 为准,实际体验可能因部署环境、素材质量与 TTS 配置而异。
参考链接
📊 评分与标签
评分说明
总分 7.3/10 · S_入选
📊 可观测社区指标(采集日期:2026-09-11)
- GitHub: yizhi-chengzi/video-ai-talking ★360, 🔱54(GitHub 页面实时核验)
- License: MIT;默认分支 master;仓库创建 2026-08-31,最后提交 2026-09-03(“add video”,活跃 ✅)
- 传播度:已入选阮一峰科技爱好者周刊自荐(Issue #11449)
评分依据可追溯至公开来源,每项分数均有明确理由和数据支撑。
⚙️ 功能完整度 1.8/2.5
- 核心链路完整:真人视频上传 → 文案/字幕 → 本机 TTS 配音 → 自动对口型 → 竖屏 MP4 合成,工作台含素材区、配音/BGM/文案区、皮肤预览、成片库管理
- 自带演示素材
talking-head-cn.mp4(竖屏 9:16 正面近景,Pexels/cottonbro studio),开箱可试对口型- 来源:demos 目录
- 竞品对比 1(HeyGen 等 SaaS 数字人平台):平台功能矩阵更全(形象库、协作、API),但素材上云;本工具本地闭环
- 竞品对比 2(Wav2Lip 等开源 lip-sync 脚本):命令行管线需自行组合 TTS/字幕/合成;本工具提供 Web 工作台一站式完成
✨ 输出质量 1.8/2.5
- 竖屏 9:16 直接适配抖音/视频号/小红书;字幕皮肤可选;BGM 混音;口播-嘴型自动对齐
- 竞品对比 1(云端口播生成器):渲染质量稳定但风格模板化;本地生成可完全自定义素材
- 竞品对比 2(开源 lip-sync 管线):效果取决于 Wav2Lip 级别模型,同类局限——素材质量决定上限
- 限制:本站未实际运行该工具生成视频,对口型精度以官方演示为准
🖐️ 易用性 1.2/1.5
- Web 三栏工作台(素材/配音文案/皮肤预览),无编程操作;Docker 一条命令可起
- 竞品对比 1(纯命令行 lip-sync 项目):需写脚本拼管线;本工具图形界面零代码
- 竞品对比 2(SaaS 平台):注册即用更省事,但需上传素材到云端
- 限制:仍需自行部署(Docker/npm)+ 自备 TTS API Key,非纯开箱即用
💰 性价比 1.5/1.5
- MIT 开源免费;无服务器端订阅;仅 TTS/LLM API 走用户自己的 Key
- 来源:GitHub
- 竞品对比 1(HeyGen 免费档):月配额极少;本工具生成量只受本机与 Key 限制
- 竞品对比 2(万兴播爆等国内平台):按套餐计费;本工具零授权成本
🔒 稳定性 0.5/1.0
- ⚠️ 个人作者项目,仓库 2026-08-31 创建,截至采集日期 2026-09-11 提交数仅 7、最后提交 2026-09-03,长期维护持续性待观察
- 来源:GitHub 仓库页(采集日期 2026-09-11)
- 竞品对比 1(商业平台):SLA 与持续迭代有保障;本工具依赖个人节奏
- 竞品对比 2(成熟开源视频工具):社区贡献者多;本仓库目前单人维护
- 缓解:★360/🔱54 增长快(建仓约 11 天),社区关注度在上升通道
🛡️ 隐私安全 0.5/1.0
- 核心卖点即隐私:密钥只留在浏览器、视频素材本地处理、不经第三方服务器
- 竞品对比 1(云端数字人平台):素材与密钥必然上云;本工具本地闭环
- 竞品对比 2(自建 Wav2Lip 管线):同样本地,但密钥管理散落在脚本里;本工具密钥收敛在浏览器 localStorage
- 限制:本地处理属官方声明,本站未审计代码验证无外传行为;API Key 存 localStorage 属常规做法但非硬件级安全
🏷️ 标签说明
- 口播视频: 定位即”真人口播视频生成器”——上传真人视频+文案,配音对口型出 MP4。来源:GitHub README
- 开源免费: MIT License 开源。来源:GitHub
- 数字人口播: 输出为真人形象口播成片(非 3D 虚拟人)。来源:GitHub README
- 本地运行: 密钥只留在浏览器、生成在本地完成。来源:GitHub README
- 字幕配音: 支持字幕样式选择与本机 TTS 配音。来源:GitHub README
📋 来源核实
- ✅ 已核验: GitHub 仓库 — 2026-09-11 页面实时核验:★360、🔱54、7 commits、最后提交 2026-09-03 “add video”、MIT、默认分支 master、目录结构(demos/docs/public/server/src/templates)确认
- ✅ 已核验: 阮一峰周刊 Issue #11449 — 2026-09-11 搜索核验:作者自荐贴,含工作台三栏界面与成片库描述
- ✅ 已核验: demos 目录 — 2026-09-11 搜索结果核验:talking-head-cn.mp4 演示素材描述与 Pexels License 来源声明
- ⚠️ 未实测:本站未实际部署运行该工具,对口型效果、合成速度以官方 B 站演示视频为准
同分类推荐
AI视频生成 分类下的其他工具