VideoGigaGAN
VideoGigaGAN是Adobe研究团队于2024年提出的一种生成式视频超分辨率(VSR)模型,能够在放大视频分辨率的同时补充高频细节并保持帧间的时间一致性。它在大规模图像放大模型GigaGAN的基础上扩展而来,支持8倍超分辨率,例如把128×128像素的视频放大到1024×1024像素。与基于扩散的同类方法不同,该模型单次前向传播即可生成结果,推理速度更快。
定义
VideoGigaGAN是一种生成式视频超分辨率模型,作用是把低分辨率视频放大为高分辨率视频,并使放大后的画面同时具备丰富的高频细节和稳定的帧间时间一致性[1]。论文给出形式化描述:模型把低分辨率视频 $\mathbf{v}$ 映射为高分辨率视频 $\mathbf{V}=\mathcal{G}(\mathbf{v})$,放大倍数为 $\alpha$ 时满足 $H=\alpha h,\ W=\alpha w$[2]。
它属于生成式对抗网络(GAN)路线,与传统以回归目标训练的视频超分辨率方法不同,其设计目标是恢复甚至生成低分辨率输入中并不存在的外观细节,而非仅做平滑插值[3]。
原理
模型以大规模图像放大模型GigaGAN为起点。GigaGAN在StyleGAN2结构上引入滤波器组和自注意力层,并基于海量图像训练,具有非对称U-Net结构,由3个下采样编码块和3+k个上采样解码块组成,并利用随机空间噪声 $\mathbf{z}$ 产生随机性,同分辨率的编码块与解码块之间通过跳连接相连[2]。VideoGigaGAN将其从二维图像模型扩展为三维视频模型,即在解码块的 spatial 自注意力之后加入一维时间卷积与时间自注意力,两者均使用残差连接,以控制显存开销[4]。
仅做这种时间模块膨胀仍会带来明显的闪烁与伪影,原因之一是时间注意力的空间窗口有限。为此模型加入光流引导的特征传播,用双向循环网络在帧间聚合时序感知特征,并借助光流做后向扭曲对齐,使超出局部感受野的大幅运动也能被建模[4]。
针对编码器下采样造成的混叠闪烁,模型把步长卷积替换为先做步长为1的卷积、再经低通滤波(BlurPool)与降采样;同时在每个分辨率层级把特征拆成低频与高频两部分,让高频成分经跳连接直接送入解码块,即所谓高频穿梭机制,从而在抑制闪烁的同时保留细节[4]。
由于这类方法不依赖迭代去噪,模型只需一次前向传播即可输出结果,推理速度快于需要反复去噪的扩散式视频超分辨率模型[4]。
发展历程
相关论文于2024年4月发布在预印本平台,作者为Yiran Xu、Taesung Park、Richard Zhang、Yang Zhou、Eli Shechtman、Feng Liu、Jia-Bin Huang、Difan Liu,均来自Adobe研究团队[5]。同期有报道称,Adobe公开了可将低分辨率视频放大的演示,示例包括把128×128像素的视频提升到1024×1024像素[6]。
该工作在IEEE/CVF计算机视觉与模式识别会议(CVPR)2025上发表,收录于会议论文集第2139至2149页[3]。研究团队表示,VideoGigaGAN是在图像放大模型GigaGAN基础上提出的首个大规模基于GAN的视频超分辨率模型[7]。
应用
VideoGigaGAN的用途是视频超分辨率和视频画质增强,论文展示了8倍放大效果,并提到模型可处理一般的实拍场景[3]。
研究阶段以公开数据集进行评估,包括REDS4、Vimeo-90K-T、Vid4和UDM10,在LPIPS指标上均取得优于对比方法的结果,其中REDS4上的LPIPS为0.1582[7]。有报道指出该模型属于研究预览性质,Adobe并未确认是否会将其作为产品功能提供给用户[8]。
局限
模型在感知指标上表现突出,但在PSNR等保真度指标上并不占优。在REDS4数据集4倍放大设置下,其PSNR为30.46,低于BasicVSR++的32.39和RVRT的32.74,说明画面更锐利的同时像素级还原误差更大[7]。
作为GAN类方法,它的生成多样性不及扩散模型;训练成本较高,论文中使用了32块A100图形处理器[7]。此外,光流估计的准确程度会直接影响最终输出质量,目前展示的放大倍数限于4倍和8倍,更高倍数的效果尚未验证[7]。
参见
参考资料
- VideoGigaGAN: Towards Detail-rich Video Super-Resolution . adobe.com [引用日期2026-10-08]
- arxiv.org 上的网页 . arxiv.org [引用日期2026-10-08]
- VideoGigaGAN: Towards Detail-rich Video Super-Resolution . thecvf.com [引用日期2026-10-08]
- thecvf.com 上的 PDF 文件 . thecvf.com [引用日期2026-10-08]
- VideoGigaGAN: Towards Detail-rich Video Super-Resolution . harvard.edu [引用日期2026-10-08]
- 20240425-adobe-videogigagan-video-upsampling-ai . gigazine.net [引用日期2026-10-08]
- title: > . githubusercontent.com [引用日期2026-10-08]
- gov.in 上的网页 . gov.in [引用日期2026-10-08]
浏览次数:3 次
阅读量:0 次 · 阅读完成量:0 次
最近更新:2026-10-08T12:27:30Z
完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。