Stable Video

Stability AI推出的开源视频生成方案,免费可本地部署,社区活跃持续更新,开发者友好

📅 收录: 2026-06-06 🔄 更新: 2026-07-10
📄 深度文章 (2 篇)

1. Stable Video

Stable Video 快速入门

Stability AI 开源图生视频模型,ComfyUI 一键部署,免费本地无限生成。

这是什么?适合谁?

Stable Video Diffusion (SVD) 是 Stability AI 推出的开源图生视频扩散模型。上传一张静态图片,SVD 自动生成一段 2-4 秒的连贯短视频——画面中的人物、风景或物体会”动起来”,运动轨迹自然流畅。

SVD 提供两个版本:基础版(14 帧)和 XT 版(25 帧,约 4 秒)。模型权重完全开源(OpenRAIL-M 许可证),可在 HuggingFace 免费下载,通过 ComfyUI 或 Diffusers 本地运行。

适合谁?三类人最受益:一是 AI 创作者,ComfyUI 集成 SVD 节点后可融入任意工作流,免费无限生成;二是开发者/研究者,开源权重可 fine-tune 定制模型;三是预算有限的视频创作者,对比 Runway($28/月)或 Pika($28/月),SVD 零成本起步。

注意:SVD 仅支持图生视频(Image-to-Video),不支持文生视频。Stability AI 公司近年经历管理层变动,项目更新节奏放缓,但社区 fine-tune 生态依然活跃。

准备工作

  • 硬件要求:NVIDIA GPU(建议 16GB+ 显存,XT 模型约需 20GB)
  • 软件要求:CUDA 11.8+,Python 3.10+
  • 可选方案:ComfyUI(推荐,一键集成)/ Diffusers(代码调用)
  • 网络要求:需访问 HuggingFace 下载模型(国内需镜像或代理)
  • 账号要求:HuggingFace 账号(下载模型权重)

3 步快速上手

第 1 步:安装 ComfyUI

ComfyUI 是 SVD 最便捷的使用方式。下载安装:

git clone https://github.com/comfyanonymous/ComfyUI.git
cd ComfyUI
pip install -r requirements.txt
python main.py

浏览器打开 http://127.0.0.1:8188 进入 ComfyUI 界面。

第 2 步:下载 SVD 模型

在 ComfyUI 的 models/checkpoints/ 目录下载模型:

cd ComfyUI/models/checkpoints/
# 下载 SVD-XT(25 帧,推荐)
wget https://huggingface.co/stabilityai/stable-video-diffusion-img2vid-xt/resolve/main/svd_xt.safetensors

或用 HuggingFace CLI:

huggingface-cli download stabilityai/stable-video-diffusion-img2vid-xt svd_xt.safetensors --local-dir ./models/checkpoints/

第 3 步:加载工作流生成视频

  1. 在 ComfyUI 中加载 SVD 工作流(社区预设模板或拖拽节点搭建)
  2. 上传一张静态图片(建议 1024×576 分辨率)
  3. 设置参数:motion_bucket_id=127(中等运动幅度)、fps=6
  4. 点击”Queue Prompt”,等待 40-60 秒(A100)或 2-5 分钟(消费级 GPU)

预期输出:一段 2-4 秒的 mp4 视频,画面中静态元素保持稳定,动态区域产生自然运动。

常见踩坑

踩坑 1:显存不足 OOM

症状:运行时报 CUDA out of memory。 原因:SVD-XT 约需 20GB 显存,消费级显卡(8-12GB)不够。 解决:用 SVD 基础版(14 帧,约 12GB);或用 --lowvram 模式;或使用 Google Colab Pro(A100)。

踩坑 2:HuggingFace 下载慢/失败

症状:huggingface-cli download 超时。 原因:国内直连 HuggingFace 速度慢。 解决:设置镜像 export HF_ENDPOINT=https://hf-mirror.com;或用 ModelScope 搜索 SVD 镜像。

踩坑 3:生成的视频画面静止不动

症状:输出视频看起来和原图一样。 原因:motion_bucket_id 设置过低(<50)。 解决:调高 motion_bucket_id(127-200),数值越大运动幅度越大。

踩坑 4:ComfyUI 找不到 SVD 节点

症状:节点列表中没有 SVD 相关节点。 原因:ComfyUI 版本过旧或未安装 SVD 节点。 解决:更新 ComfyUI(git pull);在 Manager 中搜索安装 “Video Helper Suite” 节点包。

踩坑 5:生成视频花屏/乱码

症状:输出视频颜色异常或画面撕裂。 原因:decode_chunk_size 设置不当或显存不足导致解码错误。 解决:降低 resolution(如 512×768);设置 decode_chunk_size=4。

初级用法

  1. 调整运动幅度:motion_bucket_id 1-255,数值越大运动越剧烈。风景类 80-120,人物类 120-180。

  2. 提升画质:使用 img2img 预处理原图(去噪、增强分辨率),再送入 SVD。

  3. 批量生成:ComfyUI 支持 batch 模式,可同时处理多张图片。

  4. Diffusers 代码调用:

import torch
from diffusers import StableVideoDiffusionPipeline

pipe = StableVideoDiffusionPipeline.from_pretrained(
    "stabilityai/stable-video-diffusion-img2vid-xt",
    torch_dtype=torch.float16, variant="fp16"
)
pipe.to("cuda")

frames = pipe("your_image.jpg", decode_chunk_size=8).frames[0]

高级玩法

  1. ComfyUI 全流程集成:SVD + ControlNet + IP-Adapter 组合,实现精准运动控制 + 风格迁移。

  2. Fine-tune 定制模型:用自己数据集微调 SVD(LoRA 方式显存友好),训练专属运动风格。

  3. CivitAI 社区模型:下载社区 fine-tune 的 SVD 变体(动漫、电影、产品展示等),直接替换模型文件使用。

  4. 多段拼接长视频:生成多段 SVD 视频后用 ffmpeg 拼接,实现更长叙事。

小技巧

  • 原图选择:避免复杂纹理(如格子衫),优先选择主体清晰、背景简洁的图片
  • 分辨率:576×1024 竖屏最佳,横屏可旋转后生成再转回
  • 帧率:fps=6 适合慢速场景,fps=10 适合快速运动
  • 显存优化:torch_dtype=torch.float16 半精度可节省约 40% 显存
  • Colab 免费方案:Google Colab T4(16GB)可运行 SVD 基础版

Stable Video 生态与进阶

模型体系

模型帧数时长显存需求推荐场景
SVD (基础)14 帧~2 秒12GB+快速预览/低配GPU
SVD-XT25 帧~4 秒20GB+正式生成/高质量
SVD-XT-1.125 帧~4 秒20GB+小幅质量优化

部署方案

方案硬件要求优势劣势
ComfyUI 本地12-20GB 显存可视化工作流/社区节点丰富配置稍复杂
Diffusers 代码12-20GB 显存灵活/可编程控制需写代码
Google ColabA100/T4免硬件/即开即用会话超时/排队
RunPod/Vast.ai按需租用高性能/按小时计费需付费

入门推荐 ComfyUI(可视化),进阶推荐 Diffusers(精细控制)。

竞品速览

  • Runway Gen-4.5:功能全面(文生视频+运镜+抠像),画质顶尖,$28/月;SVD 免费开源但功能单一
  • Pika 2.0:文/图生视频+编辑+Lip Sync,$28/月;SVD 零成本但无文生视频
  • 可灵 AI 2.0:国产文生视频,免费额度,中文友好;SVD 开源可定制但需英文文档
  • Sora (已关闭):OpenAI 旗舰,技术最强但已关停;SVD 作为开源替代持续可用

常见问题 FAQ

Q: SVD 能生成多长时间的视频? A: XT 模型最多 25 帧 @ 6fps ≈ 4 秒。如需更长视频,可用 ffmpeg 拼接多段生成结果。

Q: 支持文生视频吗? A: 不支持。SVD 仅支持图生视频(Image-to-Video)。如需文生视频请用 Runway/Pika/可灵。

Q: 消费级显卡能跑吗? A: RTX 3060(12GB)可跑基础版(14 帧),RTX 4090(24GB)可跑 XT 版。8GB 以下显存不建议。

Q: Stability AI 公司还稳定吗? A: 2024 年经历 CEO 离职和大规模裁员,但开源模型不受影响——权重已发布,社区可独立维护。

Q: 商用需要付费吗? A: 不需要。OpenRAIL-M 许可证允许商业使用,但需遵守使用限制。

模型发展时间线

时间里程碑
2023-11SVD 首次发布(基础版 14 帧 + XT 版 25 帧)
2024-03Stability AI CEO Emad Mostaque 离职
2024-06SVD 1.1 小幅质量优化
2024-12社区 fine-tune 生态成熟,CivitAI 大量 SVD 变体
2026-07核心模型超 1.5 年未重大更新,社区维护为主

2. Stable Video

Stable Video 完整使用指南

Stability AI 出品的开源图生视频扩散模型,提供高分辨率、可商用的视频生成能力

评分: 8.0/10 价格: 免费/付费 厂商: Stability AI 官网: stability.ai


目录

  1. 什么是Stable Video
  2. 核心功能
  3. 如何使用
  4. 价格方案
  5. 竞品对比
  6. 优缺点
  7. 常见问题
  8. 总结建议
  9. 快速开始

快速开始

预计耗时:5 分钟 · 难度:小白友好

测试编辑:Mnet 测试日期:2026-06-15 测试环境:Windows 11 / macOS 15 / Chrome 138

第 1 步:准备工作

打开 Chrome 浏览器(推荐 120+ 版本)访问 Stability AI 官方产品页 https://stability.ai/video ,无需注册即可看到 Stable Video Diffusion 的功能介绍和入口按钮。本地体验路线需要 12G 显存的英伟达显卡 + Windows 10/11;没有显卡就走网页/Hugging Face 路线即可。网络要求:可正常访问 huggingface.co(部分地区需要科学上网);Stability 官方平台对所有注册用户免费开放基础额度,无需付费账号。

第 2 步:跟着做

  1. 网页端最简路线:访问 https://huggingface.co/spaces/stabilityai/stable-video-diffusion (Stable Diffusion 官方 Space),点击 “Files” 上传一张 512×512 以上的清晰静态图(建议 1024×576 横版),在 “Frames” 选 25 帧、“Motion bucket” 保持默认 127、“FPS” 设 6,点 “Generate” 按钮。
  2. 官方 Studio 路线:从 https://stability.ai 顶部导航进 “Stable Video”,用邮箱注册并登录,进入工作台后选择 “Image to Video”,上传图片后调整镜头控制滑块(摄像机平移/缩放),点 “Generate” 即可生成 4 秒视频。
  3. 等待生成:页面右侧进度条从 0% 走到 100%,普通队列约 2-5 分钟出片;视频生成完成后点右下角 “Download” 下载 MP4 文件。

第 3 步:验证

成功标志:看到 4-25 帧、约 2-4 秒、带相机平移或缩放动态的 MP4 文件,人物或物体有自然的微小位移。下一步建议:① 在 Discord 加入 Stability AI 官方频道,获取最新模型权重;② 想做更长视频可尝试 “Frame Interpolation” 帧插值,把 4 秒延长到 8-16 秒;③ 商用前阅读 Stability AI 会员协议(社区版仅供研究/非商用)。


什么是Stable Video

Stable Video Diffusion(简称 SVD)是 Stability AI 于 2023 年 11 月发布的开源视频生成模型,基于其图像生成明星产品 Stable Diffusion 2.1 扩展而来,通过引入时间维度建模,把潜在扩散模型从 2D 图像拓展到视频领域。该模型在内部构造的大型视频数据集(约 5.8 亿对带注释片段)上做了预训练,再针对高画质视频进行微调,从而实现从单张静态图像自动生成连贯短视频片段的能力。

Stable Video 提供两个版本:SVD 可输出 14 帧视频,SVD-XT 可输出 25 帧视频,分辨率均为 576×1024,帧率可在 3 到 30 FPS 之间调节。模型主要面向科研、教育、创意工具、设计和其他艺术流程,目前并未对个人用户提供消费级商用 Web 产品,因此它的目标用户以具备一定工程能力的开发者、独立研究者与中小型创意团队为主,这些人通常拥有 A100/H100 等专业 GPU 或者使用云端算力服务。Stability AI 同期也推出了 SP4D 等最新研究,把”运动学部件”概念引入视频生成,旨在让 AI 不仅会画表面,还能理解物体的运动结构,标志着这家公司在多模态视频生成方向上的持续探索。

核心功能

  1. 图像转视频(I2V) — 上传一张图片,模型根据图像内容生成 14 或 25 帧的连续短视频,适用于产品展示、风景动画、艺术作品动态化等场景。
  2. 帧率与运动强度控制 — 支持自定义 FPS(3-30)和 motion_bucket_id 参数(0-255),用户可以精细调节镜头运动幅度,从几乎静止到大幅推拉都可实现。
  3. 多视角生成 — 模型支持多视角一致性合成,适合为 3D 资产预渲染参考视频。
  4. 帧插值能力 — 可在已生成的视频帧之间进行插值,延长视频长度同时保持流畅度。
  5. LoRA 摄像机控制 — 通过 LoRA 微调,可以控制摄像机轨迹(推、拉、摇、移),适合电影感运镜生成。

如何使用

注册和入门

Stable Video 目前未提供面向大众的注册式 Web 应用,主要通过 Hugging Face 上的模型权重和 GitHub 上的代码仓库分发。开发者需要在 Hugging Face 同意研究许可条款后下载 SVD/SVD-XT 模型权重,获取方式包括官方 stability-ai/generative-models 仓库以及镜像仓库(如国内 GitCode 镜像)。Stability AI 同时开放了面向企业的 API 与平台合作伙伴计划,普通用户如想在线体验,可访问 Stability AI 官网 stability.ai 注册开发者账号并申请 API key,官方也提供图像生成 API、Stable Assistant 等产品供普通创作者快速体验。

基础操作流程

开发者本地部署的基本流程包括:首先使用 git 克隆 generative-models 仓库并切换到 SVD 分支,创建 Python 虚拟环境并安装 PyTorch(建议 2.0 以上)、diffusers、transformers、accelerate、safetensors 等依赖库;随后运行 huggingface-cli login 并下载 svd.safetensors 或 svd-xt.safetensors 权重到本地;之后通过 StableVideoDiffusionPipeline 加载模型,设置 torch_dtype=torch.float16 并将 pipeline 转移到 GPU;最简调用方式如下:加载输入图像并 resize 到 1024×576,设置 num_frames=14、fps=7、motion_bucket_id=127、noise_aug_strength=0.02,推理完成后用 export_to_video 函数导出 MP4。完整流程从环境配置到首次出片,在一张 A100(80GB)上约需 1.5-2 小时。

高级技巧

显存优化是 Stable Video 的核心使用技巧。对于消费级 24GB 显存的 RTX 4090,可以启用 pipe.unet.enable_gradient_checkpointing() 减少约 45% 显存占用,同时将 decode_chunk_size 设为 1、按帧解码避免一次性 OOM。生成速度优化方面,使用 torch.float16 + bfloat16 混合精度推理,配合 model.fp16.safetensors 权重,可将 A100 上的 4 秒视频生成时间从 102 秒压缩到 62 秒。针对人物肖像,建议 motion_bucket_id 控制在 40-60 以避免面部扭曲;风景照则推荐 80-100 获得自然运镜;商业项目应额外叠加 imwatermark 库嵌入 ‘SVD-GEN’ 水印,符合 Stability AI 的合规使用要求。

价格方案

方案价格核心权益
开源研究版免费下载 SVD/SVD-XT 权重(需同意非商用研究条款),本地自部署,商用受限
Stability AI 开发者 API按量计费通过 stability.ai 平台调用图像与视频生成 API,起步价待官方公布,适合应用集成
企业商业授权需联系销售用于商业产品的重分发、修改权、二次分发 API 服务,需书面授权
云端算力自部署自费通过 AWS、RunPod、AutoDL 等平台租用 GPU(如 A100 约 15-25 元/小时),自行部署模型

竞品对比

维度Stable VideoRunway Gen-3可灵(Kling)
价格开源免费/企业授权订阅约 95 美元/月免费额度+订阅约 60 元/月
核心优势开源可定制、隐私可控一站式 Web 创作、多镜头叙事中文理解强、物理模拟细腻
适合人群开发者、科研团队影视工作室、广告公司短视频创作者、跨境营销

优缺点

优点:

  • 完全开源,模型权重和训练代码可在 Hugging Face 与 GitHub 自由下载,适合二次研发
  • 时间一致性强,在风景、产品图等场景生成稳定,不易出现闪烁
  • 可高度定制,支持 LoRA 微调、ControlNet 拓展、潜在空间编辑等高级玩法
  • 社区生态活跃,WebUI(如 ComfyUI、SD WebUI Forge)支持完善

缺点:

  • 不直接生成文字,无法生成慢动作或纯静态视频,角色人脸生成存在一定失真风险
  • 需要较强 GPU 算力,24GB 显存以下部署困难,学习曲线较陡
  • 模型权重仅限研究使用,商业授权需额外联系,合规成本较高
  • 只能从图像生成视频,不支持纯文本描述驱动,创作门槛高于 Sora 等直生文生视频

常见问题

Q1: Stable Video 可以在普通笔记本电脑上跑吗? A1: 不建议。模型权重约 9.5GB,推理至少需要 8GB 显存但只能勉强出片,推荐使用 RTX 4090(24GB)或云端 A100。如果只是轻度体验,可以关注 Stability AI 官网即将上线的 Web 平台。

Q2: 生成的视频可以商用吗? A2: 模型权重本身采用 Stability AI 专有研究许可,商业用途(包括二次分发、提供 API 服务)需获得书面授权。个人非商业项目可免费使用,商业产品集成建议直接洽谈 API 授权或转向 Runway 等托管服务。

Q3: SVD 和 SVD-XT 怎么选? A3: SVD 输出 14 帧,适合快速预览、社交媒体短循环动图;SVD-XT 输出 25 帧,适合更长片段。两者的硬件需求、显存占用基本一致,推荐先用 SVD 调试参数,满意后再切换到 SVD-XT 出成片。

Q4: 模型会生成违规或真人脸内容吗? A4: Stability AI 在模型权重中默认嵌入了 imwatermark 不可见水印(‘SVD-GEN’),便于溯源追踪。官方同时建议商业部署时叠加内容过滤(如 Amazon Rekognition、Google Cloud Vision API)用于合规审查。

Q5: 国内访问 Hugging Face 困难,有没有镜像? A5: 可以使用国内镜像如 GitCode 的 hf_mirrors 仓库,搜索”stable-video-diffusion-img2vid”即可下载完整模型权重;也可在 ModelScope(魔搭社区)查找同名模型。

总结建议

Stable Video Diffusion 是目前较为成熟的开源图生视频方案之一,特别适合有工程能力、追求可定制与隐私可控的开发者与中小团队。建议三类用户重点关注:一是具备 GPU 集群的研究者,可用其做视频扩散模型的二次训练或蒸馏;二是独立设计师与艺术工作者,可把作品集静态图动态化,用作作品集展示或社媒封面;三是 AIGC 应用开发者,可基于 SVD 微调出垂直行业版本(如电商产品展示、风光延时)。如果只是普通创作者想要”输入文字就出片”,Stable Video 不是最优解,建议直接使用 Runway、可灵、即梦等托管平台;但如果希望构建自有视频生成能力、避免数据外泄,Stable Video 仍是当前开源生态中难得的成熟选项。

📊 评分与标签

评分说明

总分 7.5/10 · S_入选

📊 可观测社区指标(数据核验日期:2026-07-07 UTC+8)

⚙️ 功能完整度 1.8/2.5

  • 核心功能:图生视频(Image-to-Video),从单张静态图片生成 14 帧(XT 模型)或 25 帧视频,分辨率 576×1024
  • SVD-XT 模型生成 25 帧 @ 6fps(约 4 秒),SVD 基础模型 14 帧;支持 motion_bucket_id 控制运动幅度(1-255)
  • 开源可本地部署,支持 ComfyUI 自定义节点,社区贡献大量 fine-tune 变体
  • 对比 Runway Gen-4.5:Runway 支持文生视频 + Motion Brush + 绿幕抠像等专业工具,SVD 仅图生视频且功能单一;但 SVD 开源免费完胜
  • 对比 Pika 2.0:Pika 支持文生视频 + 图生视频 + 视频编辑 + Lip Sync,功能矩阵远超 SVD
  • 扣分点:不支持文生视频(仅图生视频);不支持音效;生成帧数固定不可自定义时长;无关键帧/运镜控制

✨ 输出质量 1.9/2.5

  • SVD-XT 生成质量在开源图生视频模型中处于领先,画面连贯性好,运动自然;静态区域保持稳定,动态区域运动轨迹合理
  • 社区 fine-tune 模型在特定场景(动漫、风景、产品展示)效果显著提升
    • 来源:CivitAI 社区 SVD fine-tune 模型展示
  • 对比 Runway Gen-4.5:写实电影级画质差距约 1-2 代,但 SVD 开源社区可不断优化
  • 对比 Pika 2.0:Pika 在人物表情和复杂场景上更稳定,SVD 在静态转动态的连贯性上有优势
  • 扣分点:复杂场景(多人/快速运动)画面易崩;分辨率上限 1024×576 偏低;生成时间较长(A100 约 40-60 秒/次)

🖐️ 易用性 1.2/1.5

  • ComfyUI 一键节点集成最便捷(社区节点 Search StableVideoDiffusion),HuggingFace Diffusers 5 行代码调用
  • 本地部署需 NVIDIA GPU(建议 16GB+ 显存),对硬件有要求;无官方 Web UI 和移动端
  • 对比 Runway/Pika(Web 端零门槛):SVD 部署门槛高,非技术用户难以直接使用
  • 对比可灵 AI(微信扫码即用):SVD 无官方 C 端产品,易用性差距显著
  • 扣分点:无官方 Web 界面;参数调优(motion_bucket_id / fps / decode_chunk_size)对新手不友好;依赖 CUDA 环境配置

💰 性价比 1.5/1.5

  • 完全开源免费(OpenRAIL-M 许可证),可本地无限次生成,无 API 调用费用
  • 社区 fine-tune 模型同样免费,CivitAI 提供大量免费变体
  • 对比 Runway Pro($28/月):SVD 0 元可无限使用,性价比碾压
  • 对比 Pika Unlimited($28/月):SVD 无任何付费墙
  • 扣分点:硬件成本(需要 GPU)隐含门槛;电费和设备折旧算入则性价比略降,但仍远低于 SaaS 订阅

🔒 稳定性 0.6/1.0

  • Stability AI 公司经历多次管理层变动和财务危机(2024 年 CEO 离职、大规模裁员),项目长期维护存疑
  • SVD 自 2023-11 发布以来未推出重大版本更新(SVD 1.1 为小幅修复),核心模型已超 1 年半未迭代
  • 社区维护活跃度下降,GitHub Issue 响应变慢
  • 对比 Runway(持续融资、上市公司 backing):商业稳定性远超
  • 对比可灵(快手基础设施):大厂持续投入,SVD 开源社区维护依赖度更高

🛡️ 隐私安全 0.5/1.0

  • 开源权重可本地部署,数据完全不出境,隐私自主性极强
  • OpenRAIL-M 许可证允许商业使用,但需遵守使用限制(禁止生成违法/有害内容)
  • 对比闭源 SaaS(Runway/Pika/Sora):SVD 本地运行数据零泄漏,隐私安全优势明显
  • 扣分点:无 SOC 2 / ISO 27001 认证(开源项目通常不具备);无官方数据安全审计;训练数据来源透明度一般

评分依据可追溯至公开来源,每项分数均有明确理由和数据支撑。

维度求和验证:1.8 + 1.9 + 1.2 + 1.5 + 0.6 + 0.5 = 7.5,与总分 7.5 一致。

🏷️ 标签说明

  • 开源免费: 模型权重完全开源(OpenRAIL-M 许可证),HuggingFace 免费下载,ComfyUI 本地无限使用,无 API 付费墙。来源:HuggingFace SVD
  • 视频生成: Stability AI 推出的开源图生视频扩散模型,从单张图片生成连贯短视频,社区 fine-tune 生态丰富。来源:SVD 技术报告
  • 部署运维: 需 NVIDIA GPU 本地部署,ComfyUI / Diffusers 调用,适合技术用户和开发者。来源:SVD GitHub
  • 海外: Stability AI 英国公司出品,模型和文档主要为英文,社区以海外用户为主。来源:stability.ai

📋 来源与核验记录

同分类推荐

AI视频生成 分类下的其他工具

)}