Gemini Omni Flash 1.1发布:四大视频能力升级详解

Gemini Omni Flash 1.1 正式登场
谷歌近日通过官方推特宣布,Gemini Omni Flash 1.1 正式面向全球用户发布。这是对其"万物输入、万物输出"(anything in, anything out)世界模型的一次重要更新。与传统的单模态或双模态模型不同,Omni Flash 系列的定位是一个通用型的世界模型——它试图打通文本、图像、视频等多种模态之间的边界,让内容的生成与转换更加自由灵活。
Gemini Omni Flash 1.1 并非凭空出现,而是谷歌多模态 AI 战略的最新产物。谷歌在 2023 年底发布了 Gemini 系列模型,采用了从训练之初就原生支持多模态的架构设计,区别于此前将文本模型和视觉模型拼接的方案。Gemini 家族包括 Ultra、Pro、Flash 等不同规格,其中 Flash 系列主打推理速度与成本效率,面向需要大规模调用的应用场景。"Omni" 后缀则标志着该模型具备全模态输入输出能力,这与 OpenAI 将 GPT-4o 中的 "o" 定义为 "omni" 的命名策略异曲同工。谷歌在多模态领域的积累可以追溯到更早期的研究——其 DeepMind 团队在 2022 年发布的 Flamingo 模型开创了视觉-语言模型的少样本学习范式,而 Imagen 和 Phenaki 等项目则分别在文本到图像和文本到视频生成上奠定了技术基础。
此次 1.1 版本的核心升级集中在视频生成与处理能力上,标志着谷歌在多模态视频模型领域正在快速迭代。对于内容创作者、AI 应用开发者以及研究者而言,这些更新意味着更高的画质、更长的视频上下文以及更强的可控性。
什么是"世界模型"
所谓世界模型(World Model),指的是能够理解并模拟真实世界运行规律的 AI 系统。它不仅仅是对像素或文字的简单拼接,而是尝试对物理规律、时间连续性、空间关系等底层结构进行建模。
这一概念在 AI 研究中有着深厚的学术渊源。早在 2018 年,David Ha 与 Jürgen Schmidhuber 就提出了"World Models"框架,用变分自编码器(VAE)和循环神经网络(RNN)构建环境的内部表示,让智能体在"想象"中规划行动。具体来说,该框架由三个核心组件构成:一个 VAE 负责将高维的视觉输入压缩为低维的潜在表示(latent representation),本质上是学习一个关于环境外观的紧凑编码;一个基于 MDN-RNN(混合密度网络-循环神经网络)的时序模型负责预测潜在状态的未来演变,即学习环境的动态规律;以及一个控制器在这个压缩后的"想象空间"中做出决策。这种架构的革命性在于,智能体可以完全在"梦境"中进行训练和规划,而无需与真实环境反复交互,大幅提升了训练效率,也深刻影响了后续的视频预测和视频生成研究。
Meta 首席 AI 科学家 Yann LeCun 则在其提出的 JEPA(Joint Embedding Predictive Architecture)框架中进一步阐述了世界模型的愿景——他认为下一代 AI 系统应该像人类一样,先在内心建立对世界的抽象模型,再基于这个模型进行推理和预测,而非仅仅依赖大规模的模式匹配。JEPA 的核心思想是:在抽象的表征空间(而非像素空间)中进行预测,模型不需要预测每一个像素的精确值,而是预测抽象特征的变化趋势,从而自然地过滤掉不可预测的噪声,聚焦于环境的本质结构。Meta 已经发布了 V-JEPA 等早期实现,展示了在视频理解任务中无需标注数据即可学习有意义表征的能力。这一学术争论的背景是理解 Gemini Omni Flash 定位的重要参考——谷歌选择的路线更接近"在统一架构中做端到端的多模态生成",而非 LeCun 所倡导的"先理解再生成"。
世界模型与传统生成模型的本质区别在于:前者试图学习环境的因果结构和状态转移规律(比如一个杯子从桌边滑落后会摔碎),后者更多是在统计层面捕捉数据分布的相关性。
Gemini Omni Flash 以"anything in, anything out"为设计哲学,意味着无论输入的是文字、静态图像还是视频片段,模型都能输出对应模态的结果,甚至进行跨模态转换。谷歌选择将世界模型与多模态统一架构相结合,其技术动机在于:如果一个模型真正理解了世界的运行方式,那么它理应能够用任何模态来表达这种理解。这种统一架构是当前多模态 AI 发展的重要方向,也是谷歌与 OpenAI、Meta 等巨头在技术路线上的核心分歧之一。

Gemini Omni Flash 1.1 的四大核心升级
根据官方公布的更新说明,Gemini Omni Flash 1.1 主要带来了以下几项关键能力提升:
1. 360p 草稿与 4K 上采样
新版本支持先以 360p 分辨率生成"草稿"(drafts),再通过 4K 上采样器(up samplers)将画面提升至超高清质量。这种"先草稿后精修"的两阶段工作流设计相当务实。
从技术角度看,这背后涉及的是超分辨率(Super Resolution)技术的深度应用。超分辨率技术经历了从传统双三次插值(Bicubic Interpolation)到基于深度学习方法的多代演进:2017 年的 SRGAN 首次将生成对抗网络引入超分辨率领域,随后 ESRGAN、Real-ESRGAN 等模型进一步提升了真实场景下的放大质量。近两年,基于扩散模型(Diffusion Model)的上采样方法成为新趋势,它们不仅放大像素,还能在放大过程中"补全"高频细节,生成在视觉上更真实的纹理和边缘。
扩散模型是当前图像和视频生成领域的主导技术范式,理解其原理有助于理解本文提到的多项技术升级。扩散模型的核心思想来自热力学中的扩散过程:在前向过程中,逐步向原始数据添加高斯噪声,直到数据完全变为纯噪声;在反向过程中,训练一个神经网络学习如何逐步去除噪声,从而从纯噪声中"恢复"出有意义的内容。2020 年 DDPM(Denoising Diffusion Probabilistic Models)论文奠定了现代扩散模型的基础,此后 Latent Diffusion Models(潜在扩散模型,Stable Diffusion 的基础)通过在压缩后的潜在空间而非原始像素空间中执行扩散过程,大幅降低了计算成本。在视频生成中,扩散模型需要额外处理时间维度——通常通过在 U-Net 或 Transformer 架构中引入时序注意力层来建模帧间关系,使得去噪过程不仅在空间上连贯,在时间上也保持一致。
这种两阶段流水线在工业界已有成熟先例——NVIDIA 的 DLSS(Deep Learning Super Sampling)和 AMD 的 FSR(FidelityFX Super Resolution)在游戏渲染领域采用了类似思路:先以较低分辨率渲染画面,再用 AI 模型上采样至目标分辨率,从而在画质与性能之间取得平衡。
低分辨率草稿意味着更快的生成速度和更低的算力消耗。以视频生成为例,从 360p 到 4K(2160p)的像素量差距达到 36 倍,这意味着在草稿阶段,模型需要处理的计算量可能降低一个数量级以上。创作者可以快速预览多个方案、确定构图与动态效果,再对满意的结果进行高清渲染。这种分层生成策略既照顾了迭代效率,又保证了最终产出的画质,是工程化落地的典型思路。
2. 长达 10 秒的视频上下文
在进行视频扩展(extending)时,Omni Flash 1.1 现在支持最多 10 秒的视频上下文。视频上下文的长度直接决定了模型对时间连续性的理解能力——上下文越长,模型越能保持画面中人物动作、场景元素和运动轨迹的一致性。
对于 AI 视频生成模型而言,"时间一致性"一直是行业公认的难点。要理解这个问题的技术深度,需要了解当前视频生成模型的底层架构。主流方案基于 Transformer 或扩散模型(Diffusion Model),它们在处理视频时需要在时间维度上建立帧与帧之间的依赖关系。时序注意力机制(Temporal Attention)是解决这一问题的核心技术之一——它让模型在生成当前帧时,能够"看到"并参考前后帧的信息,从而保持运动的连贯性。光流估计(Optical Flow)则从另一个角度提供辅助,通过计算相邻帧之间像素的位移向量来建模运动轨迹,帮助模型理解物体"从哪里来、往哪里去"。
然而,扩大上下文窗口并非易事。基于 Transformer 的架构面临自注意力机制的二次方复杂度问题(O(n²)),即上下文长度每翻一倍,计算量增长约四倍。对于视频这种每秒包含 24-30 帧、每帧包含数十万像素 token 的数据类型,10 秒的上下文可能意味着数十万甚至上百万个 token 的注意力计算。为解决这一瓶颈,研究者提出了多种高效注意力机制:滑动窗口注意力(Sliding Window Attention)限制每个 token 只关注其局部邻域,将复杂度降至 O(n·w);稀疏注意力(Sparse Attention)通过预设或学习得到的稀疏模式,只计算部分 token 对之间的注意力;Flash Attention 则从硬件层面优化,通过重新组织计算顺序减少 GPU 高带宽内存(HBM)的读写次数,在不改变计算结果的前提下实现 2-4 倍的速度提升。在视频生成中,时空分离注意力(Spatial-Temporal Factorized Attention)也被广泛使用——它将空间维度和时间维度的注意力解耦,分别计算后再融合,大幅降低了长视频建模的计算开销。谷歌能将上下文扩展到 10 秒,背后大概率综合应用了上述多种高效注意力机制。
10 秒的上下文窗口让模型在续写视频时,能够参考更充分的前序帧信息,从而减少画面漂移(drift)、物体突变(flickering)、身份不一致(identity loss)等常见问题。
3. 以 10 秒为增量的视频扩展
新版本支持以 10 秒为单位的视频扩展(video extensions in 10 second increments)。用户可以在已有片段的基础上,分段、渐进式地延长视频时长。
这种增量式扩展的意义在于突破了单次生成的时长限制。当前绝大多数 AI 视频生成模型受限于显存和计算资源,单次生成通常只能产出 2-6 秒的片段。通过反复调用扩展功能,创作者可以将短片段逐步拼接成更长的完整视频,同时借助上下文机制保持整体连贯。这实际上是一种自回归式(Autoregressive)的视频生成策略——类似于大语言模型逐 token 生成文本,视频模型逐段生成画面,每一段都以前一段作为条件输入。
值得注意的是,增量扩展面临的一个核心挑战是误差累积(error accumulation)。随着扩展次数增加,每一步引入的微小偏差可能逐渐放大,导致后期生成的画面与前期出现明显的风格或内容偏移。误差累积是所有自回归式生成系统的固有挑战,其根本原因在于每次扩展时模型以上一段生成结果作为输入条件,而生成结果本身包含了模型的预测误差,这些误差在多次迭代后不断叠加。学术界已提出多种缓解策略:重采样引导(Resampling Guidance)在每步扩展时引入额外的约束信号;关键帧锚定(Keyframe Anchoring)让模型定期回溯到原始参考帧进行校正;FIFO-Diffusion 等方法则通过维护一个先进先出的帧队列,在生成新帧的同时持续精炼已有帧,从而在一定程度上抵消累积误差。
10 秒的上下文窗口在这里起到了关键的"锚定"作用,它让每次扩展都能参考足够长的前序内容,在一定程度上抑制了误差的累积速度。这为 AI 长视频生成打开了新的可能性。
4. 视频参考能力
第四项更新是视频参考(video references)。这一功能允许模型在生成过程中参考已有的视频素材,从而让输出结果在风格、动态或内容上与参考视频保持一致。
从技术实现的角度看,视频参考属于条件生成(Conditional Generation)的范畴。这一领域近年来发展迅速:在图像生成侧,ControlNet 通过向扩散模型注入边缘图、深度图、姿态骨架等控制信号,实现了对生成结果的精细控制。ControlNet 由斯坦福大学的 Lvmin Zhang 等人在 2023 年提出,其核心创新在于将预训练扩散模型的编码器复制一份作为"可训练副本",通过零卷积(Zero Convolution)层将控制信号注入到模型的中间特征中。零卷积的初始权重为零,训练开始时控制分支不会影响原模型的输出,从而保护了预训练模型的生成能力,随着训练进行逐渐学习控制信号的影响。这种"即插即用"的设计范式深刻影响了后续的视频可控生成研究。
IP-Adapter 则通过图像提示(Image Prompt)机制,让模型能够参考一张图片的风格或内容进行生成。在视频领域,VideoComposer、AnimateDiff 等工作将类似的条件注入机制扩展到了时序维度。视频参考的底层机制通常依赖特征注入(Feature Injection)和交叉注意力(Cross Attention)——模型先通过编码器提取参考视频的语义特征和风格特征,然后在生成过程中通过交叉注意力层将这些特征"注入"到每一帧的生成流程中,从而让输出与参考在视觉语义上保持对齐。
视频参考在实际创作中价值巨大——比如保持角色形象一致、复用某种运镜风格(如手持跟拍、航拍推进),或是在特定视觉基调下批量生成系列内容(如品牌广告的统一视觉语言)。它让 AI 视频生成从"随机产出"走向"可控创作",是专业应用场景中不可或缺的能力。对于商业制作而言,这种可控性直接决定了 AI 工具能否真正融入现有的影视和广告制作流水线。
这次更新对 AI 视频生成意味着什么
从整体来看,Gemini Omni Flash 1.1 的升级方向非常清晰:围绕视频生成的画质、时长、连续性和可控性做深度打磨。这四个维度恰恰是当前 AI 视频模型走向实用化必须攻克的核心问题。
说个细节,谷歌将这些能力整合在一个统一的"世界模型"框架之下,而非单独推出一个视频专用模型。这体现了其"通用多模态"的技术路线——用一个底层模型覆盖尽可能多的输入输出组合。这种路线一旦成熟,将大幅降低开发者在不同任务间切换模型的成本。从架构层面来看,统一模型意味着文本理解、图像感知和视频生成共享底层的表征空间(Representation Space),不同模态之间的知识可以相互迁移——例如模型从海量文本中学到的物理常识,可以直接增强其视频生成中的物理真实性。
统一表征空间是多模态模型区别于单模态模型的核心技术特征。在传统方案中,文本、图像、视频各有独立的编码器和特征空间,跨模态交互需要额外的对齐模块(如 CLIP 通过对比学习将文本和图像映射到同一空间)。而真正的统一表征空间意味着所有模态的信息在模型内部共享同一组神经元和参数,不同模态的语义自然地交织在一起。这种设计的优势在于跨模态迁移学习——模型从文本语料中学到的概念知识可以直接增强视频生成的合理性,而从视频中学到的运动模式也能反哺其对文本描述的理解。谷歌的 Gemini 系列从训练之初就采用了多模态原生训练策略,所有模态的数据混合在一起进行端到端训练,这与先训练文本模型再"外挂"视觉能力的方案有本质区别。这种架构选择的代价是训练难度和数据工程的复杂度显著增加,但长期来看可能带来更强的泛化能力。
与 Sora、Runway 等竞品的差异化定位
在 AI 视频生成赛道上,竞争格局日趋激烈,各家的技术路线也呈现出明显分化。OpenAI 的 Sora 采用了 DiT(Diffusion Transformer)架构,将 Transformer 的强大序列建模能力与扩散模型的高质量生成相结合,追求的是"一步到位"的长视频高质量生成。DiT 是将 Transformer 架构引入扩散模型的标志性工作,由 William Peebles 和 Saining Xie 在 2023 年提出——传统扩散模型主要使用 U-Net 作为去噪网络的骨干架构,而 DiT 用标准的 Transformer 替换了 U-Net,将图像切分为 patch,每个 patch 作为一个 token 输入 Transformer。实验表明,随着模型规模的增大,DiT 的生成质量呈现出类似大语言模型的 Scaling Law(缩放定律),即模型越大、训练数据越多,生成质量越好,且没有出现明显的性能天花板。这一发现意味着视频生成模型可以像 LLM 一样通过"堆算力"持续提升,这也是 OpenAI 选择 DiT 作为 Sora 基础架构的核心原因。
Runway 的 Gen-3 Alpha 则走多阶段训练路线,强调生成质量与编辑灵活性的平衡,并已经在影视后期制作中获得了大量实际应用案例;Pika 以"编辑优先"的产品策略切入市场,让用户能够对已有视频进行局部修改和特效添加,降低了使用门槛;在国内市场,快手的可灵(Kling)和字节的即梦等产品也在快速迭代,其中可灵以较高的运动幅度和人物一致性在用户社区中获得了不错的口碑。
谷歌以 Gemini Omni Flash 的"万物输入输出"定位切入,强调的是模态的统一性和世界建模能力,而非单纯的视频生成效果。这一策略有其深层逻辑:当其他竞品聚焦于"视频生成"这个单一功能时,谷歌试图构建的是一个能够理解和生成所有模态内容的通用基础模型。分层草稿渲染、长上下文扩展、视频参考等功能,都指向一个更工程化、更贴近生产环境的产品思路——它不是为了在 demo 视频中惊艳观众,而是为了在真实工作流中稳定、高效地运行。
对于关注 AI 应用落地的开发者而言,这类更新的实际价值往往比参数规模更值得留意——因为它们直接影响创作效率和成品质量。一个支持草稿预览、增量扩展和风格参考的模型,在实际生产中的可用性,可能远超一个画质更高但不可控、生成时间极长的模型。
小结
Gemini Omni Flash 1.1 虽然只是一次小版本迭代,但其在视频能力上的四项升级都切中要害。360p 草稿加 4K 上采样兼顾了效率与画质,10 秒视频上下文与增量扩展提升了长视频的连贯性,视频参考则增强了创作的可控性。
随着世界模型概念的持续演进,未来版本在物理真实性(如更准确的流体模拟、刚体碰撞)、更长时序建模(从分钟级迈向小时级叙事)和更丰富模态支持(如 3D、音频的深度融合)上的进一步突破值得期待。对于内容创作者和 AI 从业者来说,Gemini Omni Flash 无疑是一个值得持续关注的技术方向。
注:本文基于谷歌官方推特发布的更新说明整理,具体功能表现以实际使用体验为准。
相关推荐

LynnReal-Omni:32B统一视频扩散模型开源,四步生成多任务全覆盖
LynnReal-Omni 是基于 MiniMax H3 架构的 32B 统一视频扩散模型,支持文生视频、图生视频、姿态引导、视频修复等多任务,四步快速生成,Flash 版单张 H100 上 377ms 完成 540p 视频,权重与 ComfyUI 节点已开源。

Anthropic联合创始人:AI"紧急停止开关"或应强制立法
Anthropic联合创始人向BBC表示,AI系统的"紧急停止开关"(kill switch)可能需要通过法律强制推行。本文分析这一呼吁背后的产业逻辑、技术挑战以及监管与创新之间的张力。

AI数据中心建设热潮,正冲击工业创伤深重的城市
AI数据中心建设热潮正与曾受重工业创伤的城市社区激烈碰撞。以费城为例,全国性反对声浪聚焦能耗、水资源与环境公平问题,揭示AI增长与地方利益的结构性冲突。