文字生视频
定义
文字生视频指以自然语言描述作为输入条件、由机器学习模型生成与输入文本相关视频的技术,其英文名称为 Text-to-Video,通常缩写为 T2V[1]。它的输出不是单张静态画面,而是一系列在空间与时间两个维度上都保持一致的图像帧,因此要求模型同时处理画面内的物体关系与帧与帧之间的运动逻辑[4]。
这一任务在形式上与文生图接近,但在难度上高出许多:文生图只需在一个二维平面上满足文本约束,文字生视频还要额外保证时序对齐、内容一致与动作连贯[2]。业界把具备这种能力的系统称为文本到视频生成模型[1]。
原理
当前主流方案以扩散模型为生成核心,思路是先把干净的画面逐级加噪,直至变成随机噪声,再训练模型学习反向过程,从噪声出发一步步去噪还原出符合提示词的画面[5]。视频版本在这一框架上增加时间维度,把连续若干帧作为一个整体处理,使去噪过程同时受到文本条件和帧间关系的约束[6]。
为控制计算成本,多数模型并不直接在像素空间运算,而是先用编码器把视频压缩到低维潜在空间,在其中完成去噪后再由解码器还原为可见画面[7]。在潜在空间里,视频被切成同时包含位置与时间信息的小块,这类表示在开放人工智能研究中心的 Sora 中被称为时空潜在块,作用类似于语言模型中的词元[8]。
条件控制环节负责把用户文本转化为模型可用的指令。常见做法是先用语言模型扩写提示词、补充细节,再借助文本与图像的联合对齐模型把文字语义与视觉特征关联起来,从而让生成结果与描述保持一致[7]。
骨干网络方面,早期方案多沿用图像生成中的三维 U 型网络配合时间注意力,把二维结构扩展到时间轴[6]。此后扩散变换器逐渐成为主流,它用自注意力机制同时刻画同一帧内的空间关系与不同帧之间的时间关系,被认为在扩大训练规模时表现出更好的可扩展性[8][9]。
发展历程
文字生视频是一项相对年轻的计算机视觉任务。最早的研究采用生成对抗网络与变分自编码器,以自回归方式逐帧生成画面,但受限于分辨率低、片段短、运动简单,实用范围很小[2]。
2022 年成为该领域加速的起点。谷歌当年 4 月提出视频扩散模型,把二维图像生成中的 U 型网络改造为可做时序建模的三维结构,被视为扩散式文本生成视频的首批尝试之一[6]。同年 9 月,Meta 发布 Make-A-Video,通过在图生图模型上叠加时间层并采用级联式超分辨率模块提升分辨率与帧率[6]。同年 10 月,谷歌的 Imagen Video 把级联结构进一步扩展为多个子模型协同工作[6]。中国的 CogVideo 也是最早开发的文本到视频模型之一,拥有 94 亿参数,其开源演示版本于 2022 年在 GitHub 上发布[1]。
2023 年,相关研究数量从上一年的十余篇增至上百篇,Runway 的 Gen-1 与 Gen-2、微软 NUWA-XL、字节跳动的 MagicVideo 等相继出现,开源模型也开始入场[10]。这一时期模型生成的视频长度普遍在数秒到十余秒之间[11]。
2024 年 2 月,OpenAI 发布 Sora,采用扩散变换器架构,可生成长达 60 秒、分辨率最高 1920×1080 像素的视频,并能处理多镜头与部分视频编辑任务,把可生成时长的上限明显推高。同年,快手把可灵扩展到国际用户,字节跳动通过子公司在中国发布即梦,MiniMax 推出 video-01,谷歌则在 2025 年为 YouTube Shorts 规划了名为 Veo 的生成工具[1]。
2026 年,模型开始向音视频一体化与更长时长演进。字节跳动于 2 月发布 Seedance 2.0,采用统一的多模态音视频联合生成架构,支持文字、图片、音频、视频四种模态输入,可输出 15 秒的多镜头音视频并具备双声道音频能力[12]。同月,该模型上线即梦与豆包等平台[13]。4 月,阿里巴巴发布万相 2.7 系列,包含文生视频、图生视频、参考生视频和视频编辑四个模型,输出时长可在 2 至 15 秒之间指定[14]。
应用
影视与短剧制作是较早落地的一类场景。万兴科技旗下的漫剧创作平台接入 Seedance 2.0 后,打通了参考图生视频、视频生视频、音频生视频与视频编辑等工作流,用于批量生成 2K 分镜视频[15]。火山引擎披露,巨日禄接入该模型后将中高水准 AI 剧的制作效率提升近 10 倍,九州文化、麦芽传媒等客户在剧本创作到剪辑的全流程中提效 80% 至 90%[16]。
广告与营销领域利用其低成本生成多版本素材的能力。筷子科技基于 Seedance 2.0 为玛氏旗下多个品牌提供多版本营销视频[16]。在机器人与自动驾驶研发中,生成模型被用于合成训练数据:多家企业用它生成机器人作业、室内行走等具身交互数据,以及暴雨、大雾、降雪和存在碰撞风险的场景数据,用于模型训练与仿真评测[16]。
视频点播平台也把文字生视频封装为通用能力。火山引擎的文字成片功能可根据一段文本自动生成约 30 秒、含 AI 绘画、智能配音与字幕的短视频,并列出教育科普、小说推广、内容创作等适用场景。学术界则提出把这类模型作为世界模拟器使用,用于物理、化学乃至社会实验方向的模拟研究。
局限
生成时长的上限是该技术最直接的约束之一。研究指出,视频生成模型通常在很短的片段上训练,生成长视频需要依靠计算量大、速度慢的滑动窗口方法,在上下文一致性与长度上都受限[2]。有分析把模型规模、生成时长与推理速度称为该领域的「不可能三角」,认为三者难以同时满足:追求电影级画质意味着单次生成费用较高、等待时间较长,而缩小参数规模换取速度又会牺牲细节[3]。
长程漂移是另一类突出问题。模型在生成过程中依赖已生成的历史画面,早期出现的细微瑕疵会被逐步累积放大,表现为人物面部特征无法保持、肢体结构突变、背景扭曲与动作违背物理逻辑[3]。洛桑联邦理工学院的研究人员把这一现象归因于模型训练时只见过完美数据,实际生成时却必须处理自身产生的误差[17]。
物理一致性方面,这类模型并不真正理解物理定律。有研究观察到物体凭空出现的幻觉在多个模型中普遍存在,例如处理火柴落入水中的提示时,模型会生成蜡烛出现并被点燃的画面,虽然单帧画质逼真,但时序上不可能发生[18]。浙江大学研究人员也指出,生成玻璃瓶破碎等场景时,碎片的速度、方向与分布可能与现实存在偏差,因为模型缺乏对物理定律的深入理解,难以提供工程仿真、电影特效所需的物理交互细节[19]。
训练与部署的成本同样构成门槛。保障帧间空间与时间一致性会带来长期依赖和高额计算开销,多数研究机构难以负担此类模型的训练费用[2]。此外,用于训练的多模态数据集数量少、标注稀疏,视频字幕的写法尚无统一标准,这些因素都限制了模型对复杂运动语义的学习[2]。厂商自身也承认生成结果仍存在诸多瑕疵[12]。
参考资料
- 文本到視頻生成模型 . wikipedia.org [引用日期2026-10-08]
- 深入理解文生视频模型 - 文生视频: 任务、挑战及现状 . huggingface.co [引用日期2026-10-08]
- 字节跳动试图打破Seedance 2.0的“不可能三角” . c114.net.cn [引用日期2026-10-08]
- 文生视频: 任务、挑战及现状 . baai.ac.cn [引用日期2026-10-08]
- Sora 炸场之后:AI 是如何凭空“捏造”出物理世界的? . kepuchina.cn [引用日期2026-10-08]
- 视频生成领域的发展概述:从多级扩散到LLM . aliyun.com [引用日期2026-10-08]
- 揭秘Sora的技术黑箱:从像素到视频的生成魔法 . csdn.net [引用日期2026-10-08]
- How to order - 間でトレーニングされ、その後、この圧縮された潜在空間内で動画を生成する . google.com [引用日期2026-10-08]
- AI视频新趋势:告别剪辑,迈向模拟时代 . 36kr.com [引用日期2026-10-08]
- 【东吴证券】互联网传媒行业深度报告:多模态技术加速,AI商业宏图正启-2023-12-17(PDF) . idigital.com.cn [引用日期2026-10-08]
- Sora视频生成技术突破与传媒行业应用ROI分析 . tencent.com.cn [引用日期2026-10-08]
- 字节跳动:Seedance 2.0 正式发布,音视频生成质量和可控性达专业生产场景要求 . c114.net.cn [引用日期2026-10-08]
- 字节跳动带来新一代视频创作模型Seedance 2.0正式发布 . expreview.com [引用日期2026-10-08]
- 从“演”迈向“导”,阿里发布Wan2.7-Video视频生成系列模型 . haiwainet.cn [引用日期2026-10-08]
- 万兴科技:万兴剧厂焕新 Seedance2.0首批全能力上线 . xinhuanet.com [引用日期2026-10-08]
- 火山引擎:Seedance 2.0API服务全面开放 . stdaily.com [引用日期2026-10-08]
- Une IA repousse la limite temporelle des vidéos génératives . epfl.ch [引用日期2026-10-08]
- Do video models understand physical principles . thecvf.com [引用日期2026-10-08]
- Sora视频穿帮,只因一大瓶颈 . qq.com [引用日期2026-10-08]
浏览次数:4 次
阅读量:0 次 · 阅读完成量:0 次
最近更新:2026-10-08T12:36:07Z
完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。