深度图与OpenPose提取工作流:AI视频可控生成实战指南

从一个足球梗图说起
最近一位Reddit创作者分享了自己搭建的深度图(Depth Map)与OpenPose姿态提取工作流。故事的起点颇为有趣:作者是挪威球星哈兰德的粉丝,算法持续推送相关AI梗图,他干脆自己动手做了一个。
这个看似随意的创作背后,揭示了AI视频生成领域一个日益重要的趋势——如何通过结构化参考信息,精确控制生成视频的运镜与人物姿态。作者将这套工作流开源分享,任何人只需将视频导入,即可获得干净的深度视频和OpenPose姿态视频。
什么是Depth与OpenPose提取
深度图(Depth Map)
深度图以灰度值表示画面中每个像素到镜头的距离。在AI视频生成中,深度信息能够帮助模型理解三维空间结构与相机运动轨迹,确保生成画面保持一致的透视关系和运镜感。
深度图的生成技术经历了从硬件传感器到纯算法估计的深刻演进。早期深度信息主要依赖RGB-D相机(如Intel RealSense、微软Kinect)通过结构光或飞行时间(ToF)原理直接测量——结构光方案由红外发射器投射已知图案,通过形变程度计算距离;ToF方案则测量光脉冲往返时间。然而这类硬件方案成本高昂、受环境光干扰大,难以在后期制作中对已有视频素材进行深度提取。
在AI视频生成场景中,更常用的是基于**单目深度估计(Monocular Depth Estimation)**的算法方案——代表性模型包括Intel的MiDaS、Meta的DPT(Dense Prediction Transformer)以及近年表现突出的Depth Anything系列(由字节跳动与香港大学联合发布)。这类模型通过在数百万张图像上进行自监督或跨数据集联合训练,学会从单张RGB图像推断出像素级的相对深度关系,无需任何专用硬件。提取出的深度图在视频生成中扮演「空间锚点」的角色:生成模型通过解读灰度梯度理解前景与背景的层次关系,进而在合成新帧时保持一致的透视变形、景深虚化和镜头推拉节奏,有效避免物体「穿模」或镜头运动不自然等问题。
OpenPose姿态识别
OpenPose是主流的人体关键点检测方案,可识别骨骼节点、手部及面部关键点,并以线条骨架形式呈现。将其作为参考输入时,AI模型能够精确还原原视频中人物的动作与姿态,大幅提升人物动画的连贯性。
OpenPose由卡内基梅隆大学感知计算实验室于2017年前后提出,是首个能够实时检测多人体关键点的开源框架,其论文发表于CVPR 2017并迅速成为该领域的基准参考。其核心技术创新在于**「部位亲和场(Part Affinity Fields,PAF)」**——一种编码肢体方向与位置的二维向量场。传统的自顶向下方法需要先检测每个人的边界框再逐人分析,在人群密集场景中计算代价随人数线性增长;而PAF方案通过单次卷积神经网络前向传播,同时预测所有关键点的热力图与肢体连接的方向向量场,再通过二部图匹配算法将关键点组合成完整骨架,实现了计算效率与精度的双重突破。标准OpenPose模型可输出18至25个身体关键点(含颈部、肩膀、肘部、腕部、髋部、膝盖、踝部等),以及手部的21个关键点和面部的70个关键点。2023年ControlNet框架的广泛普及进一步确立了OpenPose骨骼图的地位——在这一框架中,生成模型不再需要理解复杂的人体纹理外观,而是直接从简洁的彩色骨架线条中提取动作信息,大幅降低了控制信号的视觉噪声干扰,使姿态引导生成的效果更加精准稳定。
两类信息结合使用,可同时锁定「相机怎么动」和「人物怎么动」,显著提升生成视频的整体可控性。
与Seedance 2的配合使用
作者特别指出,提取出的深度视频和OpenPose视频可直接作为Seedance 2的参考视频输入,能够有效保留原始视频的相机运动与人物姿态。
Seedance 2是字节跳动旗下的视频生成模型,属于当前「视频到视频(Video-to-Video)」引导生成范式的代表性产品。理解这一范式,需要先了解其底层的扩散模型(Diffusion Model)条件生成机制:扩散模型的训练过程分为「加噪」与「去噪」两个阶段——前者逐步向数据中添加高斯噪声直至完全随机,后者训练网络学习在给定条件下逆向预测每一步的噪声。在推理阶段,「条件」不再局限于文本提示,还可以引入额外的视觉信号(如参考视频、深度图、骨骼图)以约束去噪方向。参考视频(无论是原始视频、深度视频还是姿态视频)在技术层面充当了**「结构先验(Structural Prior)」**的角色——它以显式的空间几何或运动信息告知模型「三维关系应当如何」或「运动轨迹应当如何」,而纹理细节、光照风格、人物外貌等高频信息则由文本提示词和模型自身在预训练中积累的视觉知识自由填充。这种「结构约束 + 风格自由」的生成方式,正是结构化参考视频相比纯文本描述的核心优势所在。
Seedance 2支持通过参考素材引导生成方向。相比纯文本提示难以描述复杂运镜的局限,结构化参考视频提供了一种「视觉化约束」,让生成结果更加稳定可控。
「提取结构信息 → 作为参考输入 → 引导生成」这一工作流,正在成为AI视频创作的主流范式。相比早期完全依赖文字提示的「盲盒式」生成,创作者对最终画面的掌控力大幅提升。
工作流的实际价值
降低创作门槛
从零搭建深度提取与姿态识别的完整流程并不容易,涉及多个模型节点的串联与参数调试。ComfyUI等节点式工作流编辑器极大降低了这一门槛——创作者无需编写代码,通过拖拽节点即可将深度估计模型、姿态检测模型、视频预处理节点串联成完整pipeline,并以JSON格式打包分享。作者将工作流打包分享后,使用者只需导入视频,即可一键获得两类干净的参考素材,省去繁琐的搭建过程。
保持运镜与姿态一致性
AI视频创作中最常见的痛点之一是帧间不一致(Temporal Inconsistency)——人物动作跳跃、镜头运动混乱。这一问题的技术根源在于早期图像扩散模型以单帧为独立处理单元,缺乏对时间维度连续性的显式建模:每帧的去噪过程互相独立,导致相邻帧在人物姿态和背景纹理上出现难以察觉却累积明显的偏差。主流解决方案沿两条技术路径并行演进:架构层面,通过在U-Net或Transformer中插入时序注意力层(Temporal Attention)或将2D卷积扩展为3D卷积,使模型在生成每帧时能够感知相邻帧的特征;推理层面,则通过引入外部结构信号提供显式的运动约束——这正是深度图和OpenPose参考视频发挥作用的切入点。深度图序列为模型提供了帧间一致的空间层次参照,在抑制镜头抖动和透视突变方面效果显著;而连续的OpenPose骨架序列则主要约束人体各关节在时间维度上的运动轨迹合理性,防止出现肢体错位、关节角度突变或动作「鬼影」(即运动模糊与残影叠加的典型瑕疵)等问题。两者协同作用,使生成视频在时间维度上明显更加连贯自然。
开源共享的社区价值
一个由追星兴趣驱动的小项目,以工具形式惠及更广泛的创作者群体,正是AI开源社区自下而上创新的典型缩影。这种「可复现工作流」的分享文化催生了大量垂直场景的专用工具,Reddit的r/StableDiffusion、r/ComfyUI等社区以及Civitai平台,成为此类工作流传播的主要渠道,使个人创作者的技术积累能够快速惠及全球社区,并在迭代反馈中持续优化。
从「生成」走向「控制」
这个案例折射出AI视频生成技术的演进方向:创作者的关注点正从「能不能生成」转向「能不能按我的想法生成」。
深度图与OpenPose提取工作流,本质上是将参考视频「翻译」成模型更易理解的结构化语言,再交由生成模型填充细节。这一过程与传统影视制作中的**「分镜预览(Animatic)」**理念高度一致——动画师先以粗略的线稿序列确定镜头调度、角色动作和节奏节拍,再进入精细化制作阶段。深度图对应的是分镜中的空间构图与镜头运动设计,OpenPose骨架序列对应的则是角色的动作编排,生成模型最终扮演的是「将分镜稿渲染为成片」的角色。随着更多中间层工具出现,AI视频创作将愈发接近传统影视制作——有分镜、有调度、有精确的动作设计,而非随机抽卡。
想要上手尝试的读者,可以选取一段运镜和人物动作清晰的短视频,通过此类工作流提取参考信息,再输入Seedance 2等支持参考视频的模型,亲身体验「可控生成」带来的效率提升。
核心要点
核心要点
核心要点
相关推荐

WorkBuddy安装MCP连接器与Skill技能同步完整教程
详解WorkBuddy安装本地MCP连接器,通过AI对话实现Skill技能在Cursor等多个AI工作台间一键迁移与自动同步的完整操作流程。

激光雷达揭秘古城:LiDAR如何重写失落文明史
探索LiDAR激光雷达技术如何穿透沙漠与丛林,揭示约旦塞拉古城的地下水窖系统和太平洋南马都尔水上巨城的隐藏建筑,重新书写失落文明的历史。

阿波罗计划的灾难与荣耀:重返月球前必须回望的历史
从阿波罗1号的致命火灾到阿波罗8号的绕月冒险,再到阿波罗11号的成功登月,回顾阿波罗计划中那些鲜为人知的灾难、恐惧与妥协,以及对当下重返月球的深刻启示。