Windows 10 / 11 · 全本地运行 · 适用 v1.8.7 及以上

视频转深度图教程:
五步把普通视频转成深度图、骨架与点云

这篇教程把「视频转深度图」的完整流程拆成五步:安装启动、导入视频、选择转换模式、调整输出参数、导出成片。 看完你能独立跑通一次转换,知道六种模式该怎么选,也知道慢、糊、检测不到人这些常见问题该怎么处理。

  • 阅读约 6 分钟 · 实操约 3 分钟
  • 不需要命令行,不需要配 Python
  • 输出自动保留原声

一、开始前:你需要准备什么

深度视频转换器是一个 Windows 桌面工具,装完双击快捷方式就能用,全程在本地跑。 开始前确认下面几件事就行:

💻 系统与空间

Windows 10 / Windows 11 64 位。安装包约 2.6 GB,装完约需 6 GB 空间(默认装到 D:\XIANGYU,空间不足会自动回退)。

🎞️ 一段视频

ffmpeg 能解码的格式基本都支持:mp4、mov、mkv、avi、webm 等。第一次试建议用 10~30 秒、人物清晰的片段。

⚡ 显卡(可选)

有 NVIDIA 独显会自动走 GPU,速度和 CPU 不是一个量级。没有独显也能用 —— 检测不到 CUDA 时自动回退 CPU,功能完全一致,只是慢一些。

🔌 网络(基本不需要)

模型权重随安装包一起装上,转换过程完全离线,视频不会上传到任何服务器。只有打开付款页面时才会用到网络。

试用版说明:功能一个都不少,只有「单段最长处理 10 秒」这一条限制,超过会自动截断并提示,不会报错拒绝。 建议先用 10 秒跑通自己的素材,确认效果再决定要不要激活。

二、完整流程:五步把视频转成深度图

下面五步是一次完整转换的标准流程。第一次用建议先别动参数,直接走一遍默认设置,看到结果再回来调。

1

安装并启动

下载 Windows x64 安装包后双击运行,跟着向导走到底即可 —— Python 运行时、ffmpeg 和全部模型权重都已经打包在里面, 不需要你自己配任何环境。装完双击桌面快捷方式,会自动打开操作界面(本机地址 127.0.0.1,也就是你自己的电脑上跑的一个本地服务)。

💡 安装包支持断点续传,2.6 GB 中途断了不用从头下。

2

导入视频

把视频文件拖到界面中央的拖放区,或者点击选择文件。导入后会显示文件名、时长和分辨率, 确认信息无误再进下一步 —— 分辨率直接决定了后面转换要花多少时间。

💡 手机上拍的「动态照片」看着是 .jpg,其实里面嵌了一段 MP4,先用 ffmpeg 或格式转换工具把它提出来再拖进去。

3

选择转换模式

界面上有六张模式卡片,点一张就选中了: 灰度深度图、人体姿态骨架、深度 + 姿态组合、 面部 478 点云、全部叠加、颜色深度。 六种模式的用途和区别见下一节的对比表。

💡 拿不准就先选「灰度深度图」,这是最通用、也最容易看出效果的一种。

4

调整输出设置(可选)

展开「输出设置」可以看到全部可调参数:处理分辨率、输出帧率、编码器与质量、转换时长、分段时长、起始时间、 中间帧格式、音频码率与声道、深度细节增强。第一次用保持默认即可, 第四节逐项解释了每个参数什么时候该动。

💡 只想转换视频中间某一段时,填「起始时间」+「转换时长」就行,音轨会同步截取。

5

开始转换并导出

点「开始转换」,进度条会实时推进,同时显示当前跑在 GPU 还是 CPU。处理过程中随时可以取消。 完成后直接在页面上预览,满意了下载成片 —— 原声已经自动回填(AAC,码率和声道可调), 不用再拿剪辑软件对一次音轨。

💡 所有完成过的任务都留在底部历史面板里,服务重启后依然能回看和重新下载。

三、六种转换模式怎么选

同一段视频,六种观感。深度与姿态的中间结果会缓存,所以切换模式不用从头再跑一遍推理。

模式输出是什么适合什么场景
🌑 灰度深度图 用亮度表示远近的灰度图,越近越亮。官方 Video-Depth-Anything(Small · Apache-2.0)生成,带时序一致性,跨帧不闪烁。 AI 绘画的 ControlNet 深度控制、3D 参考、景深特效素材
🦴 人体姿态骨架 COCO 17 个关键点连成的骨架,叠加在原视频上。 动作分析、舞蹈/体育教学、当作深度动作捕捉的素材
🧬 深度 + 姿态 灰度深度图作底,姿态骨架叠在上面。 既要空间层次又要看清人物动作
🧑 面部 478 点云 MediaPipe FaceLandmarker 提取的 478 个面部关键点,渲染为彩色点云。 表情分析、面部驱动参考、细节演示
🎛️ 全部叠加 深度底图 + 姿态骨架 + 面部点云一次叠满。 信息量最大的效果图、展示与对比
🎨 颜色深度 按颜色反推深度:KMeans 分析主色调映射为伪深度(黑色恒为 0),也可手写颜色映射 JSON 精确控制。 素材本身颜色分层明显、需要按颜色指定远近的场景
选不动时的一条经验:要「空间感」选灰度深度图;要「动作」选人体姿态骨架;两个都要选深度 + 姿态; 画面里人脸很大很清楚,再考虑面部 478 点云。

四、输出参数逐项说明

参数不是越多越好。下表按「什么时候才需要动它」排序 —— 标了 ★ 的三个是最常用、也最影响结果和速度的。

参数作用什么时候调
★ 处理分辨率 送进模型的帧尺寸。深度推理的计算量大致按像素面积增长。 提速第一选择。降一档通常能快一倍以上;想要更多细节时反向调高
★ 编码器与质量 libx264 / libx265 / libvpx-vp9 三选一,各自有质量档位。 文件太大换 x265;要 WebM 换 VP9;画质不够就调高质量档
★ 转换时长 / 起始时间 只处理视频的某一段,音轨同步截取。 只想转高潮片段;或先用 10 秒试参数再跑全片
分段时长 把长视频切成几段分别处理。 长视频怕中途出问题;试用版每段上限 10 秒
输出帧率 成片的帧率。 想再快一点、或源文件帧率过高时可以降
深度细节增强 加强深度图的层次对比。 深度图看起来一片糊、远近分不开时
音频码率与声道 回填原声的编码参数,96k~256k,默认 192k。 对音质有要求调高;只想看画面调低省体积
中间帧格式 缓存的中间结果是存 PNG 还是 JPG。 磁盘紧张选 JPG;要无损中间结果选 PNG
颜色映射 JSON 手写规则,精确指定每个颜色对应的深度值。 只在「颜色深度」模式下用

五、深度图的四种显示样式

同一份深度结果,可以用四种方式呈现。看不清层次时,先换样式往往比调参数更快。

灰度

最通用的表达,越亮越近。给 AI 绘图当 ControlNet 深度控制图时一般用这个。

伪彩(Inferno)

热力图配色,层次分辨最清楚,适合人眼判断和截图演示。

肤色渐变

观感更柔和,适合直接当成品素材用。

与原图并排对比

左边原视频右边深度图 —— 判断深度对不对,用这个最直观。

六、提速与实用技巧

⚡ 先降处理分辨率

这是最有效的一档。深度推理量和像素面积成正比,降一档常常直接快一倍以上,而肉眼观感损失有限。

🎯 用 10 秒试参数

调「转换时长」只转 10 秒,快速确认模式、样式、编码器效果,跑通了再转全片。比直接转 3 分钟再返工省得多。

🔁 换模式不重跑

中间结果按「视频指纹 + 处理分辨率」缓存,切模式或换样式时不会重新推理,几秒就能出新版本。想对比多种效果时特别省时间。

🖥️ 确认跑在 GPU 上

任务结果会标注这一趟实际跑在 GPU 还是 CPU。如果一直显示 CPU,先检查 NVIDIA 驱动和 CUDA 环境 —— GPU 和 CPU 的速度差距非常大。

✂️ 长视频分段处理

用「分段时长」把长片切成几段。中途出问题只影响一段,不用从头再来。

🔍 先并排对比再定稿

输出前用「与原图并排对比」的样式扫一遍,能提前发现深度方向不对、人物被背景吞掉这类问题。

七、常见问题

转换速度太慢怎么办?
三个最有效的办法:一是把「处理分辨率」调低,深度推理的计算量按像素面积增长,降一档往往能快一倍以上;二是降低输出帧率;三是确认这一趟跑在 GPU 上 —— 任务结果会标注实际运行设备,如果显示 CPU,说明没有可用的 CUDA 环境。另外先用「转换时长」只转 10 秒试一下参数,跑通了再转全片。
能不能只转换视频中间的某一段?
可以。输出设置里有「起始时间」和「转换时长」两项,填好之后只会处理这一段,音轨也会同步截取,不用先拿剪辑软件裁一遍。
换个模式是不是要重新算一遍?
不用。深度、姿态、面部关键点会按「视频指纹 + 处理分辨率」缓存中间结果,所以切到另一种模式、或者换一种深度显示样式时,不需要从头再推理一遍,几秒就能出新版成片。
输出的视频文件太大怎么办?
优先换编码器:libx265 在同画质下通常明显小于 libx264,libvpx-vp9 适合 WebM 场景。其次调低质量档位、降低输出帧率,或者降低处理分辨率。
人体骨架检测不到人怎么办?
姿态模型是 COCO 关键点检测,对人物在画面里的占比比较敏感。建议让人物占画面比例更大一些、光线充足、避免大面积遮挡和极端侧背角度;太小的远景人物检测率会明显下降。
面部 478 点云出不来怎么办?
面部关键点需要人脸清晰可见且占画面足够大,正脸效果最好。戴口罩、用手遮挡、侧脸角度过大或画面太暗都会影响检出。换一段人脸更清楚的素材通常就能出结果。
深度图看起来一片糊、层次不明显怎么办?
先换显示样式看看:伪彩(Inferno)和肤色渐变比纯灰度更容易分辨层次。其次可以调整「深度细节增强」参数,也可以提高处理分辨率让模型拿到更多细节。另外「与原图并排对比」的样式很适合判断深度是否正确。
试用版 10 秒限制怎么解除?
购买授权后在软件里点「授权」粘贴激活码即可,¥19.9 永久买断,无订阅。激活码会在付款完成页直接显示,请当场复制保存;激活本身是离线验签,不需要联网。
还有别的疑问?安装、激活、转换效果的任何问题,都可以直接邮件找作者,一般 24 小时内回复: lu-ying-zhi@foxmail.com
下一步

下载深度视频转换器,跟着教程跑一遍

安装包约 2.6 GB,模型权重已内置,装完即可离线使用。 试用版全部功能都能用,只是单段最长 10 秒 —— 正好够把这篇教程走一遍。