🎞️ 一帧亮一帧暗地闪
逐帧独立估深度的典型症状。换用带时序一致性的模型(本工具内置的 Video-Depth-Anything 就是),别拿单图深度模型逐帧硬跑。
「白膜视频」在 AI 生成圈里出现得越来越频繁,但真正讲清怎么做的很少。 这篇不谈理论,只解决四件事:白膜视频到底是什么、怎么生成、参数怎么调、 以及怎么接进 AI 生成的工作流里当控制信号。
先说结论:白膜视频就是「去掉材质、只留形体结构」的视频。 它把画面里的颜色、贴图、光照全部剥掉,只保留物体长什么样、在哪里、前后关系如何。 影视和动画行业管这个叫白模,AI 生成圈更常写白膜 —— 两种写法指的是同一个东西, 英文里叫 clay render(黏土渲染)或 white model。
它本来是个制作环节里的「半成品」:三维模型做完还没上材质时,先渲一版白的看看比例对不对、 形体顺不顺。但这两年它变成了一个独立的东西 —— AI 视频生成的控制信号。
用 AI 生成视频时,最头疼的问题和出图时一模一样:画面不受控。 你描述「一个人跳舞」,模型给你一段跳舞的视频,但动作、机位、空间关系全是它自己编的。 想让生成结果严格跟着一段真人视频的动作和构图走,就得给它一个控制信号。
控制信号的选择逻辑很简单:你希望生成结果忠于原视频的哪一部分,就给哪一部分。 想保住人物的动作和空间关系,但把形象、服装、材质、风格全部换掉 —— 这时候需要的就是一个「只有结构、没有外观」的东西。白膜视频正好是这个东西。
它比原视频「干净」的地方在于:原视频里人物的长相、衣服的颜色、场景的材质, 都会把生成模型往原样复制上带;白膜把这些全部抹掉, 模型只能从白膜里读到「形体在这里、朝这个方向、离镜头这么远」, 剩下的全按提示词去发挥。这就是白膜视频控制工作流的全部逻辑。
| 画面类型 | 保留了信息 | 丢掉了信息 | 当控制信号的强项 |
|---|---|---|---|
| 原视频 | 颜色、材质、光照、形体、动作 | 无 | 最全,但模型会照着复制,换不动形象 |
| 白膜视频 | 形体、动作、空间关系 | 颜色、材质、光照 | 换形象换风格、保住动作与空间结构 |
| 灰度深度图 | 每个像素到镜头的距离 | 颜色、材质、光照、表面朝向 | 保透视与遮挡关系,最稳的构图控制 |
| 人体骨架 | 17 个关节点的位置 | 环境、背景、体型、空间 | 只关心人物动作时最干净 |
搜「白膜渲染怎么做」,得到的答案往往是 Blender 教程。但那条路不是唯一的路, 而且对「只想拿它当控制信号」的人来说,它是最费劲的一条。
| 路线 | 原理 | 优点 | 门槛 |
|---|---|---|---|
| 3D 白模渲染 | 建出三维几何体,给一个纯色黏土材质,开光照渲染 | 真正的几何与光照,曲面起伏最清晰,可以直接当成品展示图 | 最高:要建模或做视频重建,还要追踪相机 |
| 法线图 | 估计每个像素的表面朝向,用 RGB 三通道表示法线方向 | 能表达曲面朝向,衣褶、五官起伏比深度图清楚 | 中:需要法线估计模型,对材质和纹理比较敏感 |
| 深度图 | 估计每个像素到镜头的距离,映射成灰度亮度 | 不需要建模、不需要追踪、一键出、带时序一致性 | 最低:拖进视频点一下就行 |
这三条路线的差别,本质上是「你愿意为几何精度付多少成本」。 如果你要的是给客户看形体的成品白模渲染,那就得老老实实建模, 因为只有真几何才有正确的光照和曲面 —— 深度图给不了这些。 但如果你的目的是当 AI 生成的控制信号,那深度图几乎总是更划算的选择: 控制模型读的是「远近关系」,它并不需要知道表面朝哪个方向。
下面这套流程走的是深度图路线,从一段真人视频开始,到拿到可以喂给工作流的白膜视频为止。 全程在本机完成,视频不上传。
下载深度视频转换器,Windows 10 / 11 双击安装。 模型权重随安装包一起带上,装完就能离线用,不需要另外配 Python、CUDA 或 ffmpeg。 有独立显卡会走 GPU,没有就自动回退 CPU。
把真人视频拖进窗口。素材质量直接决定白膜质量,选素材有几条经验: 人物在画面里占比大一点、运动清晰一点、避免大面积玻璃和镜面、 避免高速运动造成的严重糊帧。手机拍的视频完全够用,不需要专业设备。
素材自查:先用「转换时长」只转 10 秒,用「与原图并排对比」样式扫一眼。 如果关键区域的前后关系明显不对,换素材比调参数有效得多。
六种模式里,灰度深度图是视觉上最接近白模的一种 —— 越近越亮、越远越暗,去掉材质后剩下的就是形体轮廓。 如果嫌曲面起伏不够明显,打开输出设置里的「深度细节增强」, 边缘会更利落一些。
不要选「颜色深度」或伪彩样式去做控制信号。伪彩热力图看着漂亮, 但控制模型是在灰度图上训练的,喂彩色会干扰它。
三件事必须对上:帧率保持与原视频一致(改了帧率动作就会快慢错位)、 处理分辨率按控制精度选(512 够用,要求高就上 768 或 1024)、 输出格式按工作流选(ComfyUI 用 mp4 省事,训练数据集用 PNG 序列更准)。 详细取舍见下面参数一节。
转换完成后先预览,确认人物比背景亮 —— 这是绝大多数控制模型期望的方向(近处亮、远处暗)。确认无误再下载, 然后接进下一步的工作流。
深度、姿态、面部关键点会按「视频指纹 + 分辨率」缓存。 想同时要一份 mp4 和一份 PNG 序列,第二次不用重新跑推理。
同一份深度结果,可以按四种样式呈现。选错样式不会让数据变差, 但会让你的工作流效果打折扣 —— 因为控制模型只认其中一种。
| 显示样式 | 看起来像什么 | 该用在哪 |
|---|---|---|
| 灰度 | 黑白灰,越近越亮 | 唯一推荐给控制工作流用的样式。ControlNet depth 等控制模型就是在灰度深度图上训练的,人眼校对也最直观 |
| 伪彩(Inferno) | 热力图,近处暖色远处冷色 | 给人看、做演示、检查深度层次。好看,但不要直接当控制信号 |
| 肤色渐变 | 偏肤色的柔和渐变 | 做人像相关内容的展示素材,观感比灰度友好 |
| 与原图并排对比 | 左原图右深度 | 调参和排查专用。判断深度方向对不对、主体有没有被背景吞掉,看这个最快 |
参数没有一套「万能最优值」,取决于你是要接工作流、做数据集,还是只是看看效果。 下面按用途给建议。
| 参数 | 接 AI 生成工作流 | 做训练数据集 | 只试效果 |
|---|---|---|---|
| 帧率 | 与原视频一致(必须) | 与原视频一致,或统一降到一个固定值 | 无所谓 |
| 处理分辨率 | 512 起,追求精度上 768 / 1024 | 按训练模型的输入尺寸定 | 512,快 |
| 输出格式 | mp4(体积小、好加载) | PNG 序列(无损,不会有编码块效应) | mp4 |
| 显示样式 | 灰度 | 灰度 | 伪彩或并排对比 |
| 深度细节增强 | 建议开,边缘更利落 | 建议开,标签更清晰 | 开 |
| 转换时长 / 起始时间 | 按需要的片段截取 | 用分段时长切规整片段 | 先截 10 秒 |
拿到白膜视频之后怎么用,是整件事里最容易被讲糊的一段。这里给一条能直接照做的链路。
原视频 → 深度视频转换器 → 白膜视频(灰度深度序列) → 控制模型(ControlNet depth / 视频生成模型的深度分支)→ 生成结果
关键在中间那一环:白膜视频本身不是成品,它是一个「约束」。 生成模型同时读两样东西 —— 提示词告诉它要生成什么, 白膜视频告诉它形体和动作要长成什么样。 两者配合,才能既换掉形象、又保住动作。
| 接到哪 | 怎么接 | 关键设置 |
|---|---|---|
| ComfyUI · 图像工作流 | 用视频加载节点读入白膜 mp4(或 Load Image 读序列帧),接到 ControlNet Apply 的 depth 输入 | 预处理器选 depth 且「不重新估算」(直接用我们给的深度);控制强度 0.6 到 1.0 |
| ComfyUI · 视频工作流 | 白膜视频作为控制视频,与噪声潜变量一起进采样器 | 控制强度随时间递减(前段强、后段弱)能让画面更自然 |
| SD WebUI · ControlNet 插件 | 上传深度图当控制图,模型选 depth 那一档 | Preprocessor 选 none,否则会把你的深度图再估一遍,白白损失精度 |
| 视频生成模型(深度分支) | 把白膜视频当控制视频,配合参考图或提示词描述目标形象 | 控制强度别一次拉满,先 0.5 试一版看动作跟不跟得住 |
这一点反直觉但很重要:提示词里不要描述原视频的内容。 白膜视频已经把形体和动作交代清楚了,提示词的作用是描述你想要的最终画面 —— 角色是什么样、穿什么、什么材质、什么风格、什么光线。 如果你还在提示词里写原视频人物的穿着,模型会倾向于往原样复制, 那就白费了白膜「去材质」的意义。
白膜视频出问题,绝大多数不是工具的问题,而是素材或参数。按下面顺序排查最快。
逐帧独立估深度的典型症状。换用带时序一致性的模型(本工具内置的 Video-Depth-Anything 就是),别拿单图深度模型逐帧硬跑。
先查帧率是否一致,再查有没有用起始时间截取。截取之后时间轴从零开始,接工作流时要用对应的那一段。
多半是白膜分辨率太低,或控制强度设得太低。先把处理分辨率提到 768,再把控制强度往上调一档试试。
素材本身前景背景太接近,或存在大面积无纹理区域。换一段主体与背景层次更清楚的素材,比调参数有效。
反射和折射会彻底打乱深度线索,这是单目深度估计的公认短板。这类画面建议人工避开或后期遮盖。
控制强度太高,或者提示词里描述了原视频的内容。降一档控制强度,提示词只写你想要的最终画面。
安装包约 2.6 GB,模型权重已内置,装完即可离线使用,视频不上传。 试用版全部功能都能用,只是单段最长 10 秒 —— 正好够验证一条白膜视频出来是什么样。