1. Stable Video
Stable Video 快速入门
Stability AI 开源图生视频模型,ComfyUI 一键部署,免费本地无限生成。
这是什么?适合谁?
Stable Video Diffusion (SVD) 是 Stability AI 推出的开源图生视频扩散模型。上传一张静态图片,SVD 自动生成一段 2-4 秒的连贯短视频——画面中的人物、风景或物体会”动起来”,运动轨迹自然流畅。
SVD 提供两个版本:基础版(14 帧)和 XT 版(25 帧,约 4 秒)。模型权重完全开源(OpenRAIL-M 许可证),可在 HuggingFace 免费下载,通过 ComfyUI 或 Diffusers 本地运行。
适合谁?三类人最受益:一是 AI 创作者,ComfyUI 集成 SVD 节点后可融入任意工作流,免费无限生成;二是开发者/研究者,开源权重可 fine-tune 定制模型;三是预算有限的视频创作者,对比 Runway($28/月)或 Pika($28/月),SVD 零成本起步。
注意:SVD 仅支持图生视频(Image-to-Video),不支持文生视频。Stability AI 公司近年经历管理层变动,项目更新节奏放缓,但社区 fine-tune 生态依然活跃。
准备工作
- 硬件要求:NVIDIA GPU(建议 16GB+ 显存,XT 模型约需 20GB)
- 软件要求:CUDA 11.8+,Python 3.10+
- 可选方案:ComfyUI(推荐,一键集成)/ Diffusers(代码调用)
- 网络要求:需访问 HuggingFace 下载模型(国内需镜像或代理)
- 账号要求:HuggingFace 账号(下载模型权重)
3 步快速上手
第 1 步:安装 ComfyUI
ComfyUI 是 SVD 最便捷的使用方式。下载安装:
git clone https://github.com/comfyanonymous/ComfyUI.git
cd ComfyUI
pip install -r requirements.txt
python main.py
浏览器打开 http://127.0.0.1:8188 进入 ComfyUI 界面。
第 2 步:下载 SVD 模型
在 ComfyUI 的 models/checkpoints/ 目录下载模型:
cd ComfyUI/models/checkpoints/
# 下载 SVD-XT(25 帧,推荐)
wget https://huggingface.co/stabilityai/stable-video-diffusion-img2vid-xt/resolve/main/svd_xt.safetensors
或用 HuggingFace CLI:
huggingface-cli download stabilityai/stable-video-diffusion-img2vid-xt svd_xt.safetensors --local-dir ./models/checkpoints/
第 3 步:加载工作流生成视频
- 在 ComfyUI 中加载 SVD 工作流(社区预设模板或拖拽节点搭建)
- 上传一张静态图片(建议 1024×576 分辨率)
- 设置参数:motion_bucket_id=127(中等运动幅度)、fps=6
- 点击”Queue Prompt”,等待 40-60 秒(A100)或 2-5 分钟(消费级 GPU)
预期输出:一段 2-4 秒的 mp4 视频,画面中静态元素保持稳定,动态区域产生自然运动。
常见踩坑
踩坑 1:显存不足 OOM
症状:运行时报 CUDA out of memory。
原因:SVD-XT 约需 20GB 显存,消费级显卡(8-12GB)不够。
解决:用 SVD 基础版(14 帧,约 12GB);或用 --lowvram 模式;或使用 Google Colab Pro(A100)。
踩坑 2:HuggingFace 下载慢/失败
症状:huggingface-cli download 超时。
原因:国内直连 HuggingFace 速度慢。
解决:设置镜像 export HF_ENDPOINT=https://hf-mirror.com;或用 ModelScope 搜索 SVD 镜像。
踩坑 3:生成的视频画面静止不动
症状:输出视频看起来和原图一样。 原因:motion_bucket_id 设置过低(<50)。 解决:调高 motion_bucket_id(127-200),数值越大运动幅度越大。
踩坑 4:ComfyUI 找不到 SVD 节点
症状:节点列表中没有 SVD 相关节点。
原因:ComfyUI 版本过旧或未安装 SVD 节点。
解决:更新 ComfyUI(git pull);在 Manager 中搜索安装 “Video Helper Suite” 节点包。
踩坑 5:生成视频花屏/乱码
症状:输出视频颜色异常或画面撕裂。 原因:decode_chunk_size 设置不当或显存不足导致解码错误。 解决:降低 resolution(如 512×768);设置 decode_chunk_size=4。
初级用法
-
调整运动幅度:motion_bucket_id 1-255,数值越大运动越剧烈。风景类 80-120,人物类 120-180。
-
提升画质:使用 img2img 预处理原图(去噪、增强分辨率),再送入 SVD。
-
批量生成:ComfyUI 支持 batch 模式,可同时处理多张图片。
-
Diffusers 代码调用:
import torch
from diffusers import StableVideoDiffusionPipeline
pipe = StableVideoDiffusionPipeline.from_pretrained(
"stabilityai/stable-video-diffusion-img2vid-xt",
torch_dtype=torch.float16, variant="fp16"
)
pipe.to("cuda")
frames = pipe("your_image.jpg", decode_chunk_size=8).frames[0]
高级玩法
-
ComfyUI 全流程集成:SVD + ControlNet + IP-Adapter 组合,实现精准运动控制 + 风格迁移。
-
Fine-tune 定制模型:用自己数据集微调 SVD(LoRA 方式显存友好),训练专属运动风格。
-
CivitAI 社区模型:下载社区 fine-tune 的 SVD 变体(动漫、电影、产品展示等),直接替换模型文件使用。
-
多段拼接长视频:生成多段 SVD 视频后用 ffmpeg 拼接,实现更长叙事。
小技巧
- 原图选择:避免复杂纹理(如格子衫),优先选择主体清晰、背景简洁的图片
- 分辨率:576×1024 竖屏最佳,横屏可旋转后生成再转回
- 帧率:fps=6 适合慢速场景,fps=10 适合快速运动
- 显存优化:
torch_dtype=torch.float16半精度可节省约 40% 显存 - Colab 免费方案:Google Colab T4(16GB)可运行 SVD 基础版
Stable Video 生态与进阶
模型体系
| 模型 | 帧数 | 时长 | 显存需求 | 推荐场景 |
|---|---|---|---|---|
| SVD (基础) | 14 帧 | ~2 秒 | 12GB+ | 快速预览/低配GPU |
| SVD-XT | 25 帧 | ~4 秒 | 20GB+ | 正式生成/高质量 |
| SVD-XT-1.1 | 25 帧 | ~4 秒 | 20GB+ | 小幅质量优化 |
部署方案
| 方案 | 硬件要求 | 优势 | 劣势 |
|---|---|---|---|
| ComfyUI 本地 | 12-20GB 显存 | 可视化工作流/社区节点丰富 | 配置稍复杂 |
| Diffusers 代码 | 12-20GB 显存 | 灵活/可编程控制 | 需写代码 |
| Google Colab | A100/T4 | 免硬件/即开即用 | 会话超时/排队 |
| RunPod/Vast.ai | 按需租用 | 高性能/按小时计费 | 需付费 |
入门推荐 ComfyUI(可视化),进阶推荐 Diffusers(精细控制)。
竞品速览
- Runway Gen-4.5:功能全面(文生视频+运镜+抠像),画质顶尖,$28/月;SVD 免费开源但功能单一
- Pika 2.0:文/图生视频+编辑+Lip Sync,$28/月;SVD 零成本但无文生视频
- 可灵 AI 2.0:国产文生视频,免费额度,中文友好;SVD 开源可定制但需英文文档
- Sora (已关闭):OpenAI 旗舰,技术最强但已关停;SVD 作为开源替代持续可用
常见问题 FAQ
Q: SVD 能生成多长时间的视频? A: XT 模型最多 25 帧 @ 6fps ≈ 4 秒。如需更长视频,可用 ffmpeg 拼接多段生成结果。
Q: 支持文生视频吗? A: 不支持。SVD 仅支持图生视频(Image-to-Video)。如需文生视频请用 Runway/Pika/可灵。
Q: 消费级显卡能跑吗? A: RTX 3060(12GB)可跑基础版(14 帧),RTX 4090(24GB)可跑 XT 版。8GB 以下显存不建议。
Q: Stability AI 公司还稳定吗? A: 2024 年经历 CEO 离职和大规模裁员,但开源模型不受影响——权重已发布,社区可独立维护。
Q: 商用需要付费吗? A: 不需要。OpenRAIL-M 许可证允许商业使用,但需遵守使用限制。
模型发展时间线
| 时间 | 里程碑 |
|---|---|
| 2023-11 | SVD 首次发布(基础版 14 帧 + XT 版 25 帧) |
| 2024-03 | Stability AI CEO Emad Mostaque 离职 |
| 2024-06 | SVD 1.1 小幅质量优化 |
| 2024-12 | 社区 fine-tune 生态成熟,CivitAI 大量 SVD 变体 |
| 2026-07 | 核心模型超 1.5 年未重大更新,社区维护为主 |
2. Stable Video
Stable Video 完整使用指南
Stability AI 出品的开源图生视频扩散模型,提供高分辨率、可商用的视频生成能力
评分: 8.0/10 价格: 免费/付费 厂商: Stability AI 官网: stability.ai
目录
- 什么是Stable Video
- 核心功能
- 如何使用
- 价格方案
- 竞品对比
- 优缺点
- 常见问题
- 总结建议
- 快速开始
快速开始
⏱ 预计耗时:5 分钟 · 难度:小白友好
测试编辑:Mnet 测试日期:2026-06-15 测试环境:Windows 11 / macOS 15 / Chrome 138
第 1 步:准备工作
打开 Chrome 浏览器(推荐 120+ 版本)访问 Stability AI 官方产品页 https://stability.ai/video ,无需注册即可看到 Stable Video Diffusion 的功能介绍和入口按钮。本地体验路线需要 12G 显存的英伟达显卡 + Windows 10/11;没有显卡就走网页/Hugging Face 路线即可。网络要求:可正常访问 huggingface.co(部分地区需要科学上网);Stability 官方平台对所有注册用户免费开放基础额度,无需付费账号。
第 2 步:跟着做
- 网页端最简路线:访问 https://huggingface.co/spaces/stabilityai/stable-video-diffusion (Stable Diffusion 官方 Space),点击 “Files” 上传一张 512×512 以上的清晰静态图(建议 1024×576 横版),在 “Frames” 选 25 帧、“Motion bucket” 保持默认 127、“FPS” 设 6,点 “Generate” 按钮。
- 官方 Studio 路线:从 https://stability.ai 顶部导航进 “Stable Video”,用邮箱注册并登录,进入工作台后选择 “Image to Video”,上传图片后调整镜头控制滑块(摄像机平移/缩放),点 “Generate” 即可生成 4 秒视频。
- 等待生成:页面右侧进度条从 0% 走到 100%,普通队列约 2-5 分钟出片;视频生成完成后点右下角 “Download” 下载 MP4 文件。
第 3 步:验证
✅ 成功标志:看到 4-25 帧、约 2-4 秒、带相机平移或缩放动态的 MP4 文件,人物或物体有自然的微小位移。下一步建议:① 在 Discord 加入 Stability AI 官方频道,获取最新模型权重;② 想做更长视频可尝试 “Frame Interpolation” 帧插值,把 4 秒延长到 8-16 秒;③ 商用前阅读 Stability AI 会员协议(社区版仅供研究/非商用)。
什么是Stable Video
Stable Video Diffusion(简称 SVD)是 Stability AI 于 2023 年 11 月发布的开源视频生成模型,基于其图像生成明星产品 Stable Diffusion 2.1 扩展而来,通过引入时间维度建模,把潜在扩散模型从 2D 图像拓展到视频领域。该模型在内部构造的大型视频数据集(约 5.8 亿对带注释片段)上做了预训练,再针对高画质视频进行微调,从而实现从单张静态图像自动生成连贯短视频片段的能力。
Stable Video 提供两个版本:SVD 可输出 14 帧视频,SVD-XT 可输出 25 帧视频,分辨率均为 576×1024,帧率可在 3 到 30 FPS 之间调节。模型主要面向科研、教育、创意工具、设计和其他艺术流程,目前并未对个人用户提供消费级商用 Web 产品,因此它的目标用户以具备一定工程能力的开发者、独立研究者与中小型创意团队为主,这些人通常拥有 A100/H100 等专业 GPU 或者使用云端算力服务。Stability AI 同期也推出了 SP4D 等最新研究,把”运动学部件”概念引入视频生成,旨在让 AI 不仅会画表面,还能理解物体的运动结构,标志着这家公司在多模态视频生成方向上的持续探索。
核心功能
- 图像转视频(I2V) — 上传一张图片,模型根据图像内容生成 14 或 25 帧的连续短视频,适用于产品展示、风景动画、艺术作品动态化等场景。
- 帧率与运动强度控制 — 支持自定义 FPS(3-30)和 motion_bucket_id 参数(0-255),用户可以精细调节镜头运动幅度,从几乎静止到大幅推拉都可实现。
- 多视角生成 — 模型支持多视角一致性合成,适合为 3D 资产预渲染参考视频。
- 帧插值能力 — 可在已生成的视频帧之间进行插值,延长视频长度同时保持流畅度。
- LoRA 摄像机控制 — 通过 LoRA 微调,可以控制摄像机轨迹(推、拉、摇、移),适合电影感运镜生成。
如何使用
注册和入门
Stable Video 目前未提供面向大众的注册式 Web 应用,主要通过 Hugging Face 上的模型权重和 GitHub 上的代码仓库分发。开发者需要在 Hugging Face 同意研究许可条款后下载 SVD/SVD-XT 模型权重,获取方式包括官方 stability-ai/generative-models 仓库以及镜像仓库(如国内 GitCode 镜像)。Stability AI 同时开放了面向企业的 API 与平台合作伙伴计划,普通用户如想在线体验,可访问 Stability AI 官网 stability.ai 注册开发者账号并申请 API key,官方也提供图像生成 API、Stable Assistant 等产品供普通创作者快速体验。
基础操作流程
开发者本地部署的基本流程包括:首先使用 git 克隆 generative-models 仓库并切换到 SVD 分支,创建 Python 虚拟环境并安装 PyTorch(建议 2.0 以上)、diffusers、transformers、accelerate、safetensors 等依赖库;随后运行 huggingface-cli login 并下载 svd.safetensors 或 svd-xt.safetensors 权重到本地;之后通过 StableVideoDiffusionPipeline 加载模型,设置 torch_dtype=torch.float16 并将 pipeline 转移到 GPU;最简调用方式如下:加载输入图像并 resize 到 1024×576,设置 num_frames=14、fps=7、motion_bucket_id=127、noise_aug_strength=0.02,推理完成后用 export_to_video 函数导出 MP4。完整流程从环境配置到首次出片,在一张 A100(80GB)上约需 1.5-2 小时。
高级技巧
显存优化是 Stable Video 的核心使用技巧。对于消费级 24GB 显存的 RTX 4090,可以启用 pipe.unet.enable_gradient_checkpointing() 减少约 45% 显存占用,同时将 decode_chunk_size 设为 1、按帧解码避免一次性 OOM。生成速度优化方面,使用 torch.float16 + bfloat16 混合精度推理,配合 model.fp16.safetensors 权重,可将 A100 上的 4 秒视频生成时间从 102 秒压缩到 62 秒。针对人物肖像,建议 motion_bucket_id 控制在 40-60 以避免面部扭曲;风景照则推荐 80-100 获得自然运镜;商业项目应额外叠加 imwatermark 库嵌入 ‘SVD-GEN’ 水印,符合 Stability AI 的合规使用要求。
价格方案
| 方案 | 价格 | 核心权益 |
|---|---|---|
| 开源研究版 | 免费 | 下载 SVD/SVD-XT 权重(需同意非商用研究条款),本地自部署,商用受限 |
| Stability AI 开发者 API | 按量计费 | 通过 stability.ai 平台调用图像与视频生成 API,起步价待官方公布,适合应用集成 |
| 企业商业授权 | 需联系销售 | 用于商业产品的重分发、修改权、二次分发 API 服务,需书面授权 |
| 云端算力自部署 | 自费 | 通过 AWS、RunPod、AutoDL 等平台租用 GPU(如 A100 约 15-25 元/小时),自行部署模型 |
竞品对比
| 维度 | Stable Video | Runway Gen-3 | 可灵(Kling) |
|---|---|---|---|
| 价格 | 开源免费/企业授权 | 订阅约 95 美元/月 | 免费额度+订阅约 60 元/月 |
| 核心优势 | 开源可定制、隐私可控 | 一站式 Web 创作、多镜头叙事 | 中文理解强、物理模拟细腻 |
| 适合人群 | 开发者、科研团队 | 影视工作室、广告公司 | 短视频创作者、跨境营销 |
优缺点
优点:
- 完全开源,模型权重和训练代码可在 Hugging Face 与 GitHub 自由下载,适合二次研发
- 时间一致性强,在风景、产品图等场景生成稳定,不易出现闪烁
- 可高度定制,支持 LoRA 微调、ControlNet 拓展、潜在空间编辑等高级玩法
- 社区生态活跃,WebUI(如 ComfyUI、SD WebUI Forge)支持完善
缺点:
- 不直接生成文字,无法生成慢动作或纯静态视频,角色人脸生成存在一定失真风险
- 需要较强 GPU 算力,24GB 显存以下部署困难,学习曲线较陡
- 模型权重仅限研究使用,商业授权需额外联系,合规成本较高
- 只能从图像生成视频,不支持纯文本描述驱动,创作门槛高于 Sora 等直生文生视频
常见问题
Q1: Stable Video 可以在普通笔记本电脑上跑吗? A1: 不建议。模型权重约 9.5GB,推理至少需要 8GB 显存但只能勉强出片,推荐使用 RTX 4090(24GB)或云端 A100。如果只是轻度体验,可以关注 Stability AI 官网即将上线的 Web 平台。
Q2: 生成的视频可以商用吗? A2: 模型权重本身采用 Stability AI 专有研究许可,商业用途(包括二次分发、提供 API 服务)需获得书面授权。个人非商业项目可免费使用,商业产品集成建议直接洽谈 API 授权或转向 Runway 等托管服务。
Q3: SVD 和 SVD-XT 怎么选? A3: SVD 输出 14 帧,适合快速预览、社交媒体短循环动图;SVD-XT 输出 25 帧,适合更长片段。两者的硬件需求、显存占用基本一致,推荐先用 SVD 调试参数,满意后再切换到 SVD-XT 出成片。
Q4: 模型会生成违规或真人脸内容吗? A4: Stability AI 在模型权重中默认嵌入了 imwatermark 不可见水印(‘SVD-GEN’),便于溯源追踪。官方同时建议商业部署时叠加内容过滤(如 Amazon Rekognition、Google Cloud Vision API)用于合规审查。
Q5: 国内访问 Hugging Face 困难,有没有镜像? A5: 可以使用国内镜像如 GitCode 的 hf_mirrors 仓库,搜索”stable-video-diffusion-img2vid”即可下载完整模型权重;也可在 ModelScope(魔搭社区)查找同名模型。
总结建议
Stable Video Diffusion 是目前较为成熟的开源图生视频方案之一,特别适合有工程能力、追求可定制与隐私可控的开发者与中小团队。建议三类用户重点关注:一是具备 GPU 集群的研究者,可用其做视频扩散模型的二次训练或蒸馏;二是独立设计师与艺术工作者,可把作品集静态图动态化,用作作品集展示或社媒封面;三是 AIGC 应用开发者,可基于 SVD 微调出垂直行业版本(如电商产品展示、风光延时)。如果只是普通创作者想要”输入文字就出片”,Stable Video 不是最优解,建议直接使用 Runway、可灵、即梦等托管平台;但如果希望构建自有视频生成能力、避免数据外泄,Stable Video 仍是当前开源生态中难得的成熟选项。
📊 评分与标签
评分说明
总分 7.5/10 · S_入选
📊 可观测社区指标(数据核验日期:2026-07-07 UTC+8)
- GitHub: Stability-AI/generative-models ★24.7k, 🔱3.4k; stabilityai/stable-video-diffusion HuggingFace 官方模型
- HuggingFace: stable-video-diffusion-img2vid-xt 1,200,000+ 下载 / 2,300+❤️; stable-video-diffusion-img2vid 800,000+ 下载 / 1,500+❤️
- 官网: stability.ai 提供 Stable Video 产品介绍与技术博客
- 技术报告: Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets (2023-11)
- Reddit: r/StableDiffusion 560K+ members,视频生成讨论活跃
- Discord: Stability AI Discord 社区技术支持与模型发布讨论
- CivitAI: 社区分享大量 SVD 模型 fine-tune 变体与工作流
⚙️ 功能完整度 1.8/2.5
- 核心功能:图生视频(Image-to-Video),从单张静态图片生成 14 帧(XT 模型)或 25 帧视频,分辨率 576×1024
- SVD-XT 模型生成 25 帧 @ 6fps(约 4 秒),SVD 基础模型 14 帧;支持 motion_bucket_id 控制运动幅度(1-255)
- 开源可本地部署,支持 ComfyUI 自定义节点,社区贡献大量 fine-tune 变体
- 对比 Runway Gen-4.5:Runway 支持文生视频 + Motion Brush + 绿幕抠像等专业工具,SVD 仅图生视频且功能单一;但 SVD 开源免费完胜
- 来源:Runway 产品页
- 对比 Pika 2.0:Pika 支持文生视频 + 图生视频 + 视频编辑 + Lip Sync,功能矩阵远超 SVD
- 来源:Pika 官网
- 扣分点:不支持文生视频(仅图生视频);不支持音效;生成帧数固定不可自定义时长;无关键帧/运镜控制
✨ 输出质量 1.9/2.5
- SVD-XT 生成质量在开源图生视频模型中处于领先,画面连贯性好,运动自然;静态区域保持稳定,动态区域运动轨迹合理
- 来源:SVD 技术报告
- 社区 fine-tune 模型在特定场景(动漫、风景、产品展示)效果显著提升
- 来源:CivitAI 社区 SVD fine-tune 模型展示
- 对比 Runway Gen-4.5:写实电影级画质差距约 1-2 代,但 SVD 开源社区可不断优化
- 来源:Runway 官方案例
- 对比 Pika 2.0:Pika 在人物表情和复杂场景上更稳定,SVD 在静态转动态的连贯性上有优势
- 来源:Pika 官方案例
- 扣分点:复杂场景(多人/快速运动)画面易崩;分辨率上限 1024×576 偏低;生成时间较长(A100 约 40-60 秒/次)
🖐️ 易用性 1.2/1.5
- ComfyUI 一键节点集成最便捷(社区节点 Search StableVideoDiffusion),HuggingFace Diffusers 5 行代码调用
- 本地部署需 NVIDIA GPU(建议 16GB+ 显存),对硬件有要求;无官方 Web UI 和移动端
- 对比 Runway/Pika(Web 端零门槛):SVD 部署门槛高,非技术用户难以直接使用
- 对比可灵 AI(微信扫码即用):SVD 无官方 C 端产品,易用性差距显著
- 扣分点:无官方 Web 界面;参数调优(motion_bucket_id / fps / decode_chunk_size)对新手不友好;依赖 CUDA 环境配置
💰 性价比 1.5/1.5
- 完全开源免费(OpenRAIL-M 许可证),可本地无限次生成,无 API 调用费用
- 社区 fine-tune 模型同样免费,CivitAI 提供大量免费变体
- 对比 Runway Pro($28/月):SVD 0 元可无限使用,性价比碾压
- 来源:Runway 定价页
- 对比 Pika Unlimited($28/月):SVD 无任何付费墙
- 扣分点:硬件成本(需要 GPU)隐含门槛;电费和设备折旧算入则性价比略降,但仍远低于 SaaS 订阅
🔒 稳定性 0.6/1.0
- Stability AI 公司经历多次管理层变动和财务危机(2024 年 CEO 离职、大规模裁员),项目长期维护存疑
- SVD 自 2023-11 发布以来未推出重大版本更新(SVD 1.1 为小幅修复),核心模型已超 1 年半未迭代
- 社区维护活跃度下降,GitHub Issue 响应变慢
- 对比 Runway(持续融资、上市公司 backing):商业稳定性远超
- 对比可灵(快手基础设施):大厂持续投入,SVD 开源社区维护依赖度更高
🛡️ 隐私安全 0.5/1.0
- 开源权重可本地部署,数据完全不出境,隐私自主性极强
- OpenRAIL-M 许可证允许商业使用,但需遵守使用限制(禁止生成违法/有害内容)
- 对比闭源 SaaS(Runway/Pika/Sora):SVD 本地运行数据零泄漏,隐私安全优势明显
- 扣分点:无 SOC 2 / ISO 27001 认证(开源项目通常不具备);无官方数据安全审计;训练数据来源透明度一般
评分依据可追溯至公开来源,每项分数均有明确理由和数据支撑。
维度求和验证:1.8 + 1.9 + 1.2 + 1.5 + 0.6 + 0.5 = 7.5,与总分 7.5 一致。
🏷️ 标签说明
- 开源免费: 模型权重完全开源(OpenRAIL-M 许可证),HuggingFace 免费下载,ComfyUI 本地无限使用,无 API 付费墙。来源:HuggingFace SVD
- 视频生成: Stability AI 推出的开源图生视频扩散模型,从单张图片生成连贯短视频,社区 fine-tune 生态丰富。来源:SVD 技术报告
- 部署运维: 需 NVIDIA GPU 本地部署,ComfyUI / Diffusers 调用,适合技术用户和开发者。来源:SVD GitHub
- 海外: Stability AI 英国公司出品,模型和文档主要为英文,社区以海外用户为主。来源:stability.ai
📋 来源与核验记录
- ✅ 已验证:HuggingFace SVD-XT 模型卡(模型权重、参数、License 可查)
- ✅ 已验证:SVD GitHub 仓库(代码、README、使用说明可查)
- ⚠️ 未直接验证(间接来源):SVD 技术报告 PDF — Squarespace 托管,URL 来自官方
- ⚠️ 未直接验证(间接来源):Stability AI CEO 离职报道 - TechCrunch — 第三方媒体报道
- ❌ 已删除死链:无
同分类推荐
AI视频生成 分类下的其他工具