💻 系统与空间
Windows 10 / Windows 11 64 位。安装包约 2.6 GB,装完约需 6 GB 空间(默认装到 D:\XIANGYU,空间不足会自动回退)。
这篇教程把「视频转深度图」的完整流程拆成五步:安装启动、导入视频、选择转换模式、调整输出参数、导出成片。 看完你能独立跑通一次转换,知道六种模式该怎么选,也知道慢、糊、检测不到人这些常见问题该怎么处理。
深度视频转换器是一个 Windows 桌面工具,装完双击快捷方式就能用,全程在本地跑。 开始前确认下面几件事就行:
Windows 10 / Windows 11 64 位。安装包约 2.6 GB,装完约需 6 GB 空间(默认装到 D:\XIANGYU,空间不足会自动回退)。
ffmpeg 能解码的格式基本都支持:mp4、mov、mkv、avi、webm 等。第一次试建议用 10~30 秒、人物清晰的片段。
有 NVIDIA 独显会自动走 GPU,速度和 CPU 不是一个量级。没有独显也能用 —— 检测不到 CUDA 时自动回退 CPU,功能完全一致,只是慢一些。
模型权重随安装包一起装上,转换过程完全离线,视频不会上传到任何服务器。只有打开付款页面时才会用到网络。
下面五步是一次完整转换的标准流程。第一次用建议先别动参数,直接走一遍默认设置,看到结果再回来调。
下载 Windows x64 安装包后双击运行,跟着向导走到底即可 —— Python 运行时、ffmpeg 和全部模型权重都已经打包在里面, 不需要你自己配任何环境。装完双击桌面快捷方式,会自动打开操作界面(本机地址 127.0.0.1,也就是你自己的电脑上跑的一个本地服务)。
💡 安装包支持断点续传,2.6 GB 中途断了不用从头下。
把视频文件拖到界面中央的拖放区,或者点击选择文件。导入后会显示文件名、时长和分辨率, 确认信息无误再进下一步 —— 分辨率直接决定了后面转换要花多少时间。
💡 手机上拍的「动态照片」看着是 .jpg,其实里面嵌了一段 MP4,先用 ffmpeg 或格式转换工具把它提出来再拖进去。
界面上有六张模式卡片,点一张就选中了: 灰度深度图、人体姿态骨架、深度 + 姿态组合、 面部 478 点云、全部叠加、颜色深度。 六种模式的用途和区别见下一节的对比表。
💡 拿不准就先选「灰度深度图」,这是最通用、也最容易看出效果的一种。
展开「输出设置」可以看到全部可调参数:处理分辨率、输出帧率、编码器与质量、转换时长、分段时长、起始时间、 中间帧格式、音频码率与声道、深度细节增强。第一次用保持默认即可, 第四节逐项解释了每个参数什么时候该动。
💡 只想转换视频中间某一段时,填「起始时间」+「转换时长」就行,音轨会同步截取。
点「开始转换」,进度条会实时推进,同时显示当前跑在 GPU 还是 CPU。处理过程中随时可以取消。 完成后直接在页面上预览,满意了下载成片 —— 原声已经自动回填(AAC,码率和声道可调), 不用再拿剪辑软件对一次音轨。
💡 所有完成过的任务都留在底部历史面板里,服务重启后依然能回看和重新下载。
同一段视频,六种观感。深度与姿态的中间结果会缓存,所以切换模式不用从头再跑一遍推理。
| 模式 | 输出是什么 | 适合什么场景 |
|---|---|---|
| 🌑 灰度深度图 | 用亮度表示远近的灰度图,越近越亮。官方 Video-Depth-Anything(Small · Apache-2.0)生成,带时序一致性,跨帧不闪烁。 | AI 绘画的 ControlNet 深度控制、3D 参考、景深特效素材 |
| 🦴 人体姿态骨架 | COCO 17 个关键点连成的骨架,叠加在原视频上。 | 动作分析、舞蹈/体育教学、当作深度动作捕捉的素材 |
| 🧬 深度 + 姿态 | 灰度深度图作底,姿态骨架叠在上面。 | 既要空间层次又要看清人物动作 |
| 🧑 面部 478 点云 | MediaPipe FaceLandmarker 提取的 478 个面部关键点,渲染为彩色点云。 | 表情分析、面部驱动参考、细节演示 |
| 🎛️ 全部叠加 | 深度底图 + 姿态骨架 + 面部点云一次叠满。 | 信息量最大的效果图、展示与对比 |
| 🎨 颜色深度 | 按颜色反推深度:KMeans 分析主色调映射为伪深度(黑色恒为 0),也可手写颜色映射 JSON 精确控制。 | 素材本身颜色分层明显、需要按颜色指定远近的场景 |
参数不是越多越好。下表按「什么时候才需要动它」排序 —— 标了 ★ 的三个是最常用、也最影响结果和速度的。
| 参数 | 作用 | 什么时候调 |
|---|---|---|
| ★ 处理分辨率 | 送进模型的帧尺寸。深度推理的计算量大致按像素面积增长。 | 提速第一选择。降一档通常能快一倍以上;想要更多细节时反向调高 |
| ★ 编码器与质量 | libx264 / libx265 / libvpx-vp9 三选一,各自有质量档位。 | 文件太大换 x265;要 WebM 换 VP9;画质不够就调高质量档 |
| ★ 转换时长 / 起始时间 | 只处理视频的某一段,音轨同步截取。 | 只想转高潮片段;或先用 10 秒试参数再跑全片 |
| 分段时长 | 把长视频切成几段分别处理。 | 长视频怕中途出问题;试用版每段上限 10 秒 |
| 输出帧率 | 成片的帧率。 | 想再快一点、或源文件帧率过高时可以降 |
| 深度细节增强 | 加强深度图的层次对比。 | 深度图看起来一片糊、远近分不开时 |
| 音频码率与声道 | 回填原声的编码参数,96k~256k,默认 192k。 | 对音质有要求调高;只想看画面调低省体积 |
| 中间帧格式 | 缓存的中间结果是存 PNG 还是 JPG。 | 磁盘紧张选 JPG;要无损中间结果选 PNG |
| 颜色映射 JSON | 手写规则,精确指定每个颜色对应的深度值。 | 只在「颜色深度」模式下用 |
同一份深度结果,可以用四种方式呈现。看不清层次时,先换样式往往比调参数更快。
最通用的表达,越亮越近。给 AI 绘图当 ControlNet 深度控制图时一般用这个。
热力图配色,层次分辨最清楚,适合人眼判断和截图演示。
观感更柔和,适合直接当成品素材用。
左边原视频右边深度图 —— 判断深度对不对,用这个最直观。
这是最有效的一档。深度推理量和像素面积成正比,降一档常常直接快一倍以上,而肉眼观感损失有限。
调「转换时长」只转 10 秒,快速确认模式、样式、编码器效果,跑通了再转全片。比直接转 3 分钟再返工省得多。
中间结果按「视频指纹 + 处理分辨率」缓存,切模式或换样式时不会重新推理,几秒就能出新版本。想对比多种效果时特别省时间。
任务结果会标注这一趟实际跑在 GPU 还是 CPU。如果一直显示 CPU,先检查 NVIDIA 驱动和 CUDA 环境 —— GPU 和 CPU 的速度差距非常大。
用「分段时长」把长片切成几段。中途出问题只影响一段,不用从头再来。
输出前用「与原图并排对比」的样式扫一遍,能提前发现深度方向不对、人物被背景吞掉这类问题。
安装包约 2.6 GB,模型权重已内置,装完即可离线使用。 试用版全部功能都能用,只是单段最长 10 秒 —— 正好够把这篇教程走一遍。