Stable Video

义项:Stability AI视频生成模型
Stable Video

Stable Video是英国人工智能公司Stability AI推出的视频生成产品与模型系列,建立在Stable Video Diffusion(SVD)基础模型之上。该基础模型于2023年11月以研究预览形式发布,可依据单张静态图像生成数秒短视频,并提供14帧与25帧两种版本,帧率可在每秒3至30帧之间调整。2024年2月,基于SVD 1.1版本的Stable Video公测服务对外开放,使该技术从研究用途转向面向公众的在线工具。

目录
  1. 定义
  2. 原理
  3. 发展历程
  4. 应用
  5. 局限
  6. 参见

定义

Stable Video是Stability AI开发的生成式视频产品,其底层模型称为Stable Video Diffusion(简称SVD),属于潜在视频扩散模型,支持文本到视频与图像到视频两类生成任务[1]。它是在图像生成模型Stable Diffusion的基础上发展而来的首个视频基础模型,目标是让同一套技术栈从静态图像扩展到运动画面[1]。

作为产品名称,Stable Video主要指Stability AI在2024年开放的在线视频生成服务;作为技术名称,它通常连带指代其背后的SVD系列模型权重与代码[2]。

原理

Stable Video Diffusion属于潜在扩散模型,其基本思路是先把图像压缩到低维潜在空间,再在该空间中逐步去噪还原出画面[3]。SVD系列模型以Stable Diffusion 2.1为基础结构,在原有二维图像生成网络上插入时间层,使模型在建模空间关系的同时也建模帧与帧之间的时间关系,从而生成连贯的视频序列[4]。

在训练流程上,Stability AI把视频潜在扩散模型的训练拆分为3个阶段:先在图像数据上完成文本到图像预训练,再进行视频预训练,最后用高质量视频做微调。研究团队构建了约含5.8亿对带注释视频片段的大规模数据集用于预训练,并用密集光流进行标注,借助光学字符识别剔除含有大量文字的片段,再用CLIP嵌入标注每个片段的首帧、中间帧与末帧,以提升数据质量[4]。

面向图像到视频的生成时,模型以一张静态图像作为条件帧输入,输出的视频在内容上延续该图像。SVD与SVD-XT采用相同架构,区别在于生成帧数不同[5]。发布时官方称,SVD生成一段视频约需100秒,SVD-XT约需180秒,均以单张A100 80GB显卡为测试条件。

发展历程

2023年11月22日前后,Stability AI发布Stable Video Diffusion,这是该公司首个生成式视频基础模型,同一时间模型代码在GitHub公开,运行所需的权重在Hugging Face发布,配套研究论文也已上线[1]。发布时该模型处于研究预览阶段,官方明确表示它当时不适用于现实场景或商业应用,用户需先加入等待名单才能试用[5]。

2024年2月,Stability AI更新了Stable Video Diffusion 1.1版本,并基于该版本开放名为Stable Video的公测服务,不再需要排队等待[2]。2024年3月,基于SVD构建的Stable Video 3D(SV3D)模型发布,其能力方向转为从单张图像生成三维网格[2]。此后Stability AI又推出Stable Video 4D系列,把生成对象从静态三维资产扩展到随时间变化的四维资产,并采用从三维到四维的渐进式训练策略[6]。

在开发者接入方面,Stable Video Diffusion被加入Stability AI的开发者平台接口,模型可生成包含25个生成帧与24帧插值帧的约2秒视频,平均耗时约41秒,并支持运动强度控制与多种分辨率布局[7]。

应用

Stable Video Diffusion以图像到视频生成为主要用途,可把静态图片转换为短动画,官方将其面向的行业列为广告、营销、电视、电影与游戏等[7]。模型还可在多视图数据集上微调,用于从单张图像合成物体的多个视角,进而服务于三维内容制作[1]。

在此基础上发展出的Stable Video 3D用于从单图生成三维网格[2]。Stable Video 4D 2.0则定位于从单一以物体为中心的视频生成动态四维资产,官方给出的用途包括为游戏角色制作精灵图,以及为影视和虚拟世界提供素材[6]。该版本采用包含3D注意力层的网络结构,以融合空间与时间特征,提升时空一致性[8]。

由于代码与权重公开,研究者与开发者可在自有环境中部署模型,并根据自身制作流程调整,但具体使用范围受相应许可条款约束[9]。

局限

官方模型卡列出了SVD图像到视频模型的多项限制:生成视频长度较短,不超过约4秒,且未达到完全的照片级真实感;模型可能生成几乎没有运动的画面,或仅有非常缓慢的镜头平移。模型不接受文本控制,也无法渲染可辨认的文字,人脸和人物整体上可能生成不正确,其自编码部分是有损的。

用途方面,该模型在发布时仅面向研究用途,其预期使用场景包含生成模型研究、艺术与设计创作、教育与创意工具等;官方说明模型并未被训练用于对人物或事件的事实性、真实性表达,因此生成此类内容属于其能力范围之外。发布初期,SVD与SVD-XT的对外定位也是研究预览,官方强调当时不适用于现实世界或商业应用[1]。

在后续的四维生成方向上,多视图生成本身仍具难度,原因在于从不可见视角推断三维物体存在固有歧义,当主体处于运动状态时尤为明显;官方的SV4D 2.0虽然提升了多角度输出的一致性,但在动态运动场景中仍可能偶发瑕疵[6]。

参见

参考资料

  1. Introducing Stable Video Diffusion — Stability AI . stability.ai [引用日期2026-10-08]
  2. Stable Video Diffusion - Stability AI发布的视频生成大模型 . baidu.com [引用日期2026-10-08]
  3. arxiv.org 上的网页 . arxiv.org [引用日期2026-10-08]
  4. Stable Video Diffusion来了,代码权重已上线 . zhihu.com [引用日期2026-10-08]
  5. Stability AI 推出 Stable Video Diffusion 模型,可根据图片生成视频 . ithome.com [引用日期2026-10-08]
  6. squarespace.com 上的网页 . squarespace.com [引用日期2026-10-08]
  7. introducing-stable-video-diffusion-api . squarespace.com [引用日期2026-10-08]
  8. thecvf.com 上的 PDF 文件 . thecvf.com [引用日期2026-10-08]
  9. Stable Video — Stability AI . stability.ai [引用日期2026-10-08]
词条评价
词条统计

浏览次数:3 次

阅读量:0 次 · 阅读完成量:0 次

最近更新:2026-10-08T12:27:34Z

历史版本

完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。

本条目引用的词条
Stability AI Stable Diffusion Stability AI Stable Diffusion 扩散模型 文本到视频生成 三维重建
红色的还不存在。红链不是错误——它标出"这个概念被引用了但还没人写"。