白膜视频专题 · 适用 v1.8.7 及以上 · Windows 本地运行

白膜视频怎么生成:
不用 3D 建模的白膜视频制作与控制工作流

「白膜视频」在 AI 生成圈里出现得越来越频繁,但真正讲清怎么做的很少。 这篇不谈理论,只解决四件事:白膜视频到底是什么、怎么生成、参数怎么调、 以及怎么接进 AI 生成的工作流里当控制信号。

  • 阅读约 9 分钟
  • 三条技术路线逐项对比
  • 不需要建模,不需要命令行

一、白膜视频是什么,为什么大家都在做

先说结论:白膜视频就是「去掉材质、只留形体结构」的视频。 它把画面里的颜色、贴图、光照全部剥掉,只保留物体长什么样、在哪里、前后关系如何。 影视和动画行业管这个叫白模,AI 生成圈更常写白膜 —— 两种写法指的是同一个东西, 英文里叫 clay render(黏土渲染)或 white model。

它本来是个制作环节里的「半成品」:三维模型做完还没上材质时,先渲一版白的看看比例对不对、 形体顺不顺。但这两年它变成了一个独立的东西 —— AI 视频生成的控制信号。

为什么 AI 生成需要白膜视频

用 AI 生成视频时,最头疼的问题和出图时一模一样:画面不受控。 你描述「一个人跳舞」,模型给你一段跳舞的视频,但动作、机位、空间关系全是它自己编的。 想让生成结果严格跟着一段真人视频的动作和构图走,就得给它一个控制信号。

控制信号的选择逻辑很简单:你希望生成结果忠于原视频的哪一部分,就给哪一部分。 想保住人物的动作和空间关系,但把形象、服装、材质、风格全部换掉 —— 这时候需要的就是一个「只有结构、没有外观」的东西。白膜视频正好是这个东西。

它比原视频「干净」的地方在于:原视频里人物的长相、衣服的颜色、场景的材质, 都会把生成模型往原样复制上带;白膜把这些全部抹掉, 模型只能从白膜里读到「形体在这里、朝这个方向、离镜头这么远」, 剩下的全按提示词去发挥。这就是白膜视频控制工作流的全部逻辑。

画面类型保留了信息丢掉了信息当控制信号的强项
原视频 颜色、材质、光照、形体、动作 无 最全,但模型会照着复制,换不动形象
白膜视频 形体、动作、空间关系 颜色、材质、光照 换形象换风格、保住动作与空间结构
灰度深度图 每个像素到镜头的距离 颜色、材质、光照、表面朝向 保透视与遮挡关系,最稳的构图控制
人体骨架 17 个关节点的位置 环境、背景、体型、空间 只关心人物动作时最干净
一句话区分:白膜视频管「形体长什么样」,骨架管「关节在哪」, 深度图管「谁离镜头更近」。三者的信息量是包含关系 —— 白膜最全,深度图次之,骨架最精简。选哪个取决于你想让生成模型自由到什么程度。

二、三条生成路线:白模渲染 / 法线图 / 深度图

搜「白膜渲染怎么做」,得到的答案往往是 Blender 教程。但那条路不是唯一的路, 而且对「只想拿它当控制信号」的人来说,它是最费劲的一条。

路线原理优点门槛
3D 白模渲染 建出三维几何体,给一个纯色黏土材质,开光照渲染 真正的几何与光照,曲面起伏最清晰,可以直接当成品展示图 最高:要建模或做视频重建,还要追踪相机
法线图 估计每个像素的表面朝向,用 RGB 三通道表示法线方向 能表达曲面朝向,衣褶、五官起伏比深度图清楚 中:需要法线估计模型,对材质和纹理比较敏感
深度图 估计每个像素到镜头的距离,映射成灰度亮度 不需要建模、不需要追踪、一键出、带时序一致性 最低:拖进视频点一下就行

这三条路线的差别,本质上是「你愿意为几何精度付多少成本」。 如果你要的是给客户看形体的成品白模渲染,那就得老老实实建模, 因为只有真几何才有正确的光照和曲面 —— 深度图给不了这些。 但如果你的目的是当 AI 生成的控制信号,那深度图几乎总是更划算的选择: 控制模型读的是「远近关系」,它并不需要知道表面朝哪个方向。

怎么选:要成品白模渲染图 → 走 Blender / UE 那条路。 要接进 AI 生成工作流当控制信号 → 走深度图这条路,也就是本文后半部分讲的做法。 介于两者之间、想要曲面起伏更明显 → 可以试法线图,但要接受它对反光和纹理的不稳定。 法线图和深度图都能拿视频直接转,本文用的工具目前做的是深度图这条线。

三、白膜视频怎么生成:不用建模的五步

下面这套流程走的是深度图路线,从一段真人视频开始,到拿到可以喂给工作流的白膜视频为止。 全程在本机完成,视频不上传。

1

装好工具

下载深度视频转换器,Windows 10 / 11 双击安装。 模型权重随安装包一起带上,装完就能离线用,不需要另外配 Python、CUDA 或 ffmpeg。 有独立显卡会走 GPU,没有就自动回退 CPU。

2

拖入原始视频

把真人视频拖进窗口。素材质量直接决定白膜质量,选素材有几条经验: 人物在画面里占比大一点、运动清晰一点、避免大面积玻璃和镜面、 避免高速运动造成的严重糊帧。手机拍的视频完全够用,不需要专业设备。

素材自查:先用「转换时长」只转 10 秒,用「与原图并排对比」样式扫一眼。 如果关键区域的前后关系明显不对,换素材比调参数有效得多。

3

选「灰度深度图」模式

六种模式里,灰度深度图是视觉上最接近白模的一种 —— 越近越亮、越远越暗,去掉材质后剩下的就是形体轮廓。 如果嫌曲面起伏不够明显,打开输出设置里的「深度细节增强」, 边缘会更利落一些。

不要选「颜色深度」或伪彩样式去做控制信号。伪彩热力图看着漂亮, 但控制模型是在灰度图上训练的,喂彩色会干扰它。

4

调输出参数

三件事必须对上:帧率保持与原视频一致(改了帧率动作就会快慢错位)、 处理分辨率按控制精度选(512 够用,要求高就上 768 或 1024)、 输出格式按工作流选(ComfyUI 用 mp4 省事,训练数据集用 PNG 序列更准)。 详细取舍见下面参数一节。

5

导出并确认深度方向

转换完成后先预览,确认人物比背景亮 —— 这是绝大多数控制模型期望的方向(近处亮、远处暗)。确认无误再下载, 然后接进下一步的工作流。

深度、姿态、面部关键点会按「视频指纹 + 分辨率」缓存。 想同时要一份 mp4 和一份 PNG 序列,第二次不用重新跑推理。

四、白膜渲染的四种显示样式怎么选

同一份深度结果,可以按四种样式呈现。选错样式不会让数据变差, 但会让你的工作流效果打折扣 —— 因为控制模型只认其中一种。

显示样式看起来像什么该用在哪
灰度 黑白灰,越近越亮 唯一推荐给控制工作流用的样式。ControlNet depth 等控制模型就是在灰度深度图上训练的,人眼校对也最直观
伪彩(Inferno) 热力图,近处暖色远处冷色 给人看、做演示、检查深度层次。好看,但不要直接当控制信号
肤色渐变 偏肤色的柔和渐变 做人像相关内容的展示素材,观感比灰度友好
与原图并排对比 左原图右深度 调参和排查专用。判断深度方向对不对、主体有没有被背景吞掉,看这个最快
一个容易踩的坑:伪彩图看着信息量更大,很多人第一反应是拿它去做控制 —— 这是错的。控制模型读的是像素亮度值,彩色热力图的亮度分布和灰度深度图并不一致, 喂进去相当于给了一个「扭曲过的」控制信号。要控制就用灰度, 要好看就导出两份,一份灰度喂工作流、一份伪彩做展示。

五、白膜视频制作的参数怎么调

参数没有一套「万能最优值」,取决于你是要接工作流、做数据集,还是只是看看效果。 下面按用途给建议。

参数接 AI 生成工作流做训练数据集只试效果
帧率 与原视频一致(必须) 与原视频一致,或统一降到一个固定值 无所谓
处理分辨率 512 起,追求精度上 768 / 1024 按训练模型的输入尺寸定 512,快
输出格式 mp4(体积小、好加载) PNG 序列(无损,不会有编码块效应) mp4
显示样式 灰度 灰度 伪彩或并排对比
深度细节增强 建议开,边缘更利落 建议开,标签更清晰 开
转换时长 / 起始时间 按需要的片段截取 用分段时长切规整片段 先截 10 秒
为什么帧率必须一致:控制信号和生成结果是逐帧对应的。 如果原视频 30fps、白膜导成了 24fps,生成时按时间轴对齐, 动作就会出现「前快后慢」或者整体拖慢。这类问题在成品里很难补救, 只能在导出这一步就做对。
分辨率不是越高越好:控制图最终会被缩放成生成模型的输入尺寸, 中间多出来的分辨率不会提高控制精度,只会拖慢转换和加载。 但如果你的生成模型本身跑在高分辨率上(比如 1024 短边), 控制图也跟着上 1024 是有意义的,否则缩放会糊掉细节。 具体每一项参数在软件里的位置,见完整使用教程。

六、白膜视频控制工作流:接进 AI 生成

拿到白膜视频之后怎么用,是整件事里最容易被讲糊的一段。这里给一条能直接照做的链路。

整条链路长什么样

原视频 → 深度视频转换器 → 白膜视频(灰度深度序列) → 控制模型(ControlNet depth / 视频生成模型的深度分支)→ 生成结果

关键在中间那一环:白膜视频本身不是成品,它是一个「约束」。 生成模型同时读两样东西 —— 提示词告诉它要生成什么, 白膜视频告诉它形体和动作要长成什么样。 两者配合,才能既换掉形象、又保住动作。

接到不同工具里的做法

接到哪怎么接关键设置
ComfyUI · 图像工作流 用视频加载节点读入白膜 mp4(或 Load Image 读序列帧),接到 ControlNet Apply 的 depth 输入 预处理器选 depth 且「不重新估算」(直接用我们给的深度);控制强度 0.6 到 1.0
ComfyUI · 视频工作流 白膜视频作为控制视频,与噪声潜变量一起进采样器 控制强度随时间递减(前段强、后段弱)能让画面更自然
SD WebUI · ControlNet 插件 上传深度图当控制图,模型选 depth 那一档 Preprocessor 选 none,否则会把你的深度图再估一遍,白白损失精度
视频生成模型(深度分支) 把白膜视频当控制视频,配合参考图或提示词描述目标形象 控制强度别一次拉满,先 0.5 试一版看动作跟不跟得住
最容易被忽略的一步:关掉预处理器的「重新估深度」。 很多教程让你把原图丢进去,让 ControlNet 自己估深度 —— 那条路能用,但估出来的深度是逐帧独立的,会闪。 既然已经用带时序一致性的工具转好了白膜视频,就该让控制模型直接用, 不要再估第二遍。这是白膜视频控制工作流相比「原图直连 ControlNet」的核心优势。

提示词该怎么写

这一点反直觉但很重要:提示词里不要描述原视频的内容。 白膜视频已经把形体和动作交代清楚了,提示词的作用是描述你想要的最终画面 —— 角色是什么样、穿什么、什么材质、什么风格、什么光线。 如果你还在提示词里写原视频人物的穿着,模型会倾向于往原样复制, 那就白费了白膜「去材质」的意义。

想看更多控制方式的对比:深度控制和 Canny、OpenPose 的分工差异, 在深度图的六大应用场景里有一张对照表, 讲清了「什么需求该用哪种控制」。

七、效果不对怎么办:六个常见问题

白膜视频出问题,绝大多数不是工具的问题,而是素材或参数。按下面顺序排查最快。

🎞️ 一帧亮一帧暗地闪

逐帧独立估深度的典型症状。换用带时序一致性的模型(本工具内置的 Video-Depth-Anything 就是),别拿单图深度模型逐帧硬跑。

🏃 动作和原视频对不上

先查帧率是否一致,再查有没有用起始时间截取。截取之后时间轴从零开始,接工作流时要用对应的那一段。

🫥 生成画面很糊

多半是白膜分辨率太低,或控制强度设得太低。先把处理分辨率提到 768,再把控制强度往上调一档试试。

🌫️ 主体和背景糊在一起

素材本身前景背景太接近,或存在大面积无纹理区域。换一段主体与背景层次更清楚的素材,比调参数有效。

🪞 玻璃、水面、镜面区域乱掉

反射和折射会彻底打乱深度线索,这是单目深度估计的公认短板。这类画面建议人工避开或后期遮盖。

🎭 生成结果还是在复制原视频

控制强度太高,或者提示词里描述了原视频的内容。降一档控制强度,提示词只写你想要的最终画面。

通用排查顺序:先看素材(主体够不够大、有没有镜面、有没有糊帧)→ 再看参数(帧率对不对、分辨率够不够、样式是不是灰度)→ 最后才看工作流(控制强度、预处理器有没有重复估深度)。 反过来查,容易在参数上白折腾半天。

八、常见问题

白膜视频和白模视频是同一个东西吗?
是同一个概念在中文里的两种写法。白膜和白模都指去掉材质贴图、只保留形体结构的素模画面,影视动画行业更常写白模,AI 生成圈子更常写白膜。英文里对应的说法是 clay render(黏土渲染)或 white model。搜索时两种写法都能找到结果,本文统一写白膜。
白膜视频和深度图视频有什么区别?
深度图视频是白膜效果的一种。严格意义的白模是三维几何体加了纯色材质渲染出来的,有光照也有曲面朝向;深度图记录的是每个像素离镜头多远,只有远近、没有光照和朝向。所以深度图看起来像白膜,但曲面起伏(鼻梁、衣褶)不如真白模清晰。好处是不需要建模,真人视频可以直接转。
生成白膜视频一定要用 3D 软件建模吗?
不一定。如果只是要「去材质、留结构」的画面当 AI 生成的控制信号,用深度图或法线图就够了,不需要建模,也不需要追踪相机。只有当你要输出带光照的成品白模渲染(比如给客户看形体)时,才需要真的建出几何体,在 Blender 或 UE 里用黏土材质渲染。
白膜视频能直接接到 ControlNet 的 depth 上吗?
可以,这正是最常见的用法。ControlNet 的 depth 控制分支期望的就是灰度深度图(近处亮、远处暗),而深度视频转换器输出的灰度深度图就是这个格式。注意用灰度样式,不要用伪彩热力图 —— 控制模型是在灰度深度图上训练的,喂彩色反而会干扰。
做白膜视频控制工作流,输出视频还是 PNG 序列?
看工作流怎么吃。ComfyUI 用视频加载节点就出 mp4,体积小、好管理;要做训练数据集或对帧精度要求高,就出 PNG 序列,无损,不会被视频编码压出块效应。同一份深度结果两种都能导出,不需要重新跑一遍推理。
白膜视频里的动作和原视频对不上怎么办?
先检查输出帧率是否和原视频一致 —— 帧率被改过就会出现动作快慢错位。其次看有没有用到起始时间或转换时长做截取,截取之后时间轴会从零重新开始,接工作流时要用对应的那一段。最后确认控制强度是否够,强度太低时生成模型会自由发挥,动作自然就对不上了。
为什么我的白膜视频会一帧亮一帧暗地闪?
这是逐帧独立估深度的典型症状 —— 每帧单独推理,帧与帧之间没有约束,深度归一化的尺度就会来回跳。解决办法是用带时序一致性的模型,本工具内置的 Video-Depth-Anything 就是这一类,而不是拿单张图像的深度模型逐帧硬跑。
白膜视频能商用吗?
分两头看。你拍的原始素材要你自己有使用权;生成出来的深度图和白膜视频属于衍生数据,本工具不限制你用在哪里,也不联网上传。但如果你把白膜视频喂给第三方 AI 生成服务,那部分要另外遵守那个服务的条款。
你的场景不在上面?直接邮件描述一下素材和工作流,一般 24 小时内回复: lu-ying-zhi@foxmail.com
下一步

拿你自己的视频跑一版白膜看看

安装包约 2.6 GB,模型权重已内置,装完即可离线使用,视频不上传。 试用版全部功能都能用,只是单段最长 10 秒 —— 正好够验证一条白膜视频出来是什么样。