在 VPS 上跑文生视频与图生视频:Wan2.2、HunyuanVideo、ComfyUI 实战(2026)
2026-08-16 · DevCraft Studio
2026 实战:在 GPU VPS 自建无审核 AI 视频工坊,部署阿里 Wan2.2 与腾讯 HunyuanVideo,用 ComfyUI 搭工作流,含显存、fp8、xDiT、TeaCache 避坑。
延伸阅读
更多相关攻略推荐:【API 中转 02】ChatGPT/Claude API 中转 V、炒币/外汇 EA 机器人用什么 VPS?低延迟到交易所的选机指南、量化/EA 交易要低延迟:跑外汇机器人该选哪台 VPS?就近机房实测、2026 多语言/多区域 SEO 技术栈:hreflang+CDN 、Tailscale 连上了却卡成狗?自建 DERP/ZeroTier。
为什么要在 VPS 上自建视频生成工坊
这两年 Sora、Veo 这类闭源视频模型确实厉害,但订阅贵、排队久,而且有内容审核和地区限制。对做短视频、做营销素材、做数字人内容的自媒体和开发者来说,最难受的不是出不了片,而是想做的画面被直接拦下来,或者账号因为擦边被封。开源视频模型给了我们另一条路:模型权重完全公开,本地或自有的 VPS 上随便跑,没有审核、没有月度额度,生成的视频版权也归你自己。
2026 年这个赛道最大的变化是:阿里通义万相的 Wan2.2 和腾讯的 HunyuanVideo 都已经开源,并且都支持量化后塞进消费级甚至入门级显卡。再配合 ComfyUI 这套节点式工作流,普通人拖拖节点就能出片。本文就带你从零在 GPU VPS 上把这套工坊搭起来,重点讲清显存到底要多少、fp8 量化怎么用、多卡并行怎么开、TeaCache 怎么提速,以及踩过的坑。
显存到底要多少:48GB 还是 80GB
先说结论,免得被网上互相矛盾的显存数字搞晕。视频模型有两个量级,买机器前一定要分清你跑的是哪一个:
- 轻量变体(Wan2.2 TI2V-5B / Wan2.1 1.3B):5B 稠密模型官方参考是单卡 24GB 跑 720p;用 ComfyUI 原生卸载(offloading)配合 GGUF Q8 量化,8GB 显存也能跑。Wan2.1 的 1.3B 版更是只要 8.19GB 显存,RTX 4060 这种入门卡就能玩,适合试水和批量草稿。
- 满血变体(Wan2.2 A14B / HunyuanVideo 13B):Wan2.2 的 A14B 是 MoE 架构,27B 总参数但每步只激活 14B,官方未量化单卡命令要求 80GB 显存(A100/H100 级别)。HunyuanVideo 生成 720p、129 帧需要约 60GB 显存,推荐 80GB。FP8 量化后 HunyuanVideo 能省下约 10GB。
所以网上有人说 8GB 有人说 80GB,两个都对,只是说的是不同变体。如果你的 VPS 是一张 24GB 的卡(比如 RTX 4090 云实例),就老老实实走 fp8 或 GGUF 量化跑 A14B 的 480p;想要 720p 高画质满血体验,就得上 48GB 甚至 80GB 的单卡,或者用多卡并行把显存摊开。
Wan2.2 三种变体与 fp8 量化
Wan2.2 是 2025 年 7 月 28 日开源的,协议是宽松的 Apache 2.0,是首个把 MoE 架构用到视频扩散模型上的项目。它主要有几个变体:
- TI2V-5B:稠密模型,一个模型同时支持文生视频和图生视频,720p/24fps,是消费级显卡的首选。
- T2V-A14B / I2V-A14B:MoE 大模型,画质最高,文生视频和图生视频分开两个权重,最常用的是 I2V-A14B。
- S2V-14B / Animate-14B:声音驱动口型、角色动画等专门方向。
A14B 的 MoE 设计很巧妙:它用两个专家分别负责高噪声阶段(定整体布局)和低噪声阶段(补细节),两步串行执行,所以显存里同一时刻只放一个专家,这正是 28.6GB 的 FP16 文件能塞进 24GB 卡的原因。官方已经提供了 FP8-scaled 的权重文件,每个专家约 14.3GB,比 FP16 省了接近一半。
量化方案优先级建议:
- 显存够(24GB+):直接用官方 FP8 scaled 权重,质量几乎无损,最省心。
- 显存紧(16GB):用 GGUF Q5_K_M,每个专家约 10.8GB,720p 可用。
- 显存很紧(8-12GB):用 GGUF Q3/Q4 加 CPU 卸载,只能当学习玩具,出片慢但能跑通。
HunyuanVideo 与 xDiT 多卡并行
腾讯 HunyuanVideo 是 2024 年底开源的 13B 视频模型,画质和运镜连贯性在开源里数一数二,适合追求电影感的场景。它原生支持多卡并行,靠的是 xDiT 这套面向 DiT 的推理加速引擎,用的是统一序列并行(USP),通过 Ulysses 注意力和 Ring 注意力把视频 token 序列切到多张卡上。
实测数据很直观:生成 720p、129 帧、50 步的视频,单卡要 1904 秒,8 卡用 xDiT 只要 338 秒,提速 5.64 倍,接近线性加速。启动命令长这样:
cd HunyuanVideo
torchrun --nproc_per_node=8 sample_video.py --video-size 1280 720 --video-length 129 --infer-steps 50 --prompt "A cat walks on the grass, realistic style." --ulysses-degree 8 --ring-degree 1 --save-path ./results注意 --ulysses-degree 乘以 --ring-degree 必须等于 GPU 总数。8 卡常见的组合有 8x1、4x2、2x4、1x8,分辨率越高越适合 Ulysses 并行。多卡模式要求关闭 CPU 卸载,并且卡间最好有 NVLink 或高速网络,否则通信开销会吃掉一部分加速收益。
用 ComfyUI 搭工作流(实测步骤)
命令行适合批量跑,但日常创作还是 ComfyUI 节点工作流更顺手。下面是在 VPS 上从零装起来的步骤,Ubuntu 22.04 + 一张 NVIDIA 卡为例。
第一步,装基础环境(驱动、CUDA、Python)。云 GPU 实例一般镜像自带 CUDA,先确认:
nvidia-smi
python3 --version第二步,拉 ComfyUI 和视频模型封装节点:
git clone https://github.com/comfyanonymous/ComfyUI
cd ComfyUI
pip install -r requirements.txt
cd custom_nodes
git clone https://github.com/kijai/ComfyUI-WanVideoWrapper
cd ComfyUI-WanVideoWrapper
pip install -r requirements.txt
cd ..
git clone https://github.com/city96/ComfyUI-GGUF第三步,下载模型权重。以 Wan2.2 为例,把扩散模型放 ComfyUI/models/diffusion_models/,VAE 放 ComfyUI/models/vae/:
wan2.2_t2v_14B_fp8_scaled.safetensors # 约 14GB 文生视频
wan2.2_i2v_14B_fp8_scaled.safetensors # 约 14GB 图生视频
wan2.2_vae.safetensors # 约 320MB 解码器第四步,启动并在本机浏览器通过端口转发访问:
cd ComfyUI
python main.py --listen 0.0.0.0 --port 8188在本地机器做 SSH 隧道把 8188 端口转出来,浏览器打开就能拖节点了。文生视频只需 Load WanVideo Model、CLIP 文本编码、Empty Latent、采样器、VAE 解码、视频保存几个节点;图生视频多一个 Load Image 首帧输入。
TeaCache 提速与省钱技巧
视频扩散每步都要过一遍庞大的 Transformer,这是最烧时间和算力的地方。TeaCache 是一类时间步缓存加速方法:它发现相邻去噪步之间的残差变化有规律,可以跳过一部分完整计算,直接复用上一步的中间结果。配合 ComfyUI 的 WanVideo 封装节点里的 TeaCache 开关,通常能换来 1.5 到 2 倍的提速,画质损失很小,是性价比最高的开关。
其他省钱省时技巧:
- 降分辨率出草稿、再放大:先用 480p 跑分镜确认,满意了再上 720p,避免反复烧满血算力。
- 帧间插值补长度:原生 5 秒太短,可用 RIFE 把 16fps 插到 24/30fps,或者首尾帧链路把多段拼成长片。
- 量化 + 卸载组合:FP8 加 block offload,比纯 GGUF 更容易保持质量。
- 按需开关计费:GPU 实例按小时最贵,出片完就关机或释放,比常驻省一大截。
选哪台 VPS:vultr 与 dmit 举例
搭工坊最现实的问题是:本地没卡,去买机器又不划算,那就上云 GPU VPS。这里自然想到两家:
- Vultr:全球机房多,直接提供 A100/H100 80GB 这类满血 GPU 实例,按小时计费,想跑 HunyuanVideo 满血 80GB 版或 8 卡 xDiT 集群,选它最省心,镜像市场里也有带 CUDA 的现成系统。
- DMIT:以中国方向优质线路(CN2 GIA 之类)著称,延迟低、访问稳。如果你人在国内,用 DMIT 做跳板或跑轻量 Wan2.2 5B 变体,从大陆连 ComfyUI 界面会明显比绕美西的机器流畅。
实操建议:重算力(A14B 满血、多卡并行)放 Vultr 的 80GB 实例;日常轻量出片、且你在中国大陆需要低延迟操作界面,可以考虑 DMIT 的线路优势。无论哪家,记得确认镜像自带 CUDA 驱动,并且系统盘留够 60GB 以上放模型。
还有一点容易被忽略:视频模型权重动辄十几 GB,下载走 Hugging Face 官方源在部分地区很慢,建议部署时先确认 VPS 机房到模型源的带宽,或者用镜像站、对象存储做中转,否则光拉权重就可能花掉一两个小时,期间 GPU 闲置也是在烧钱。另外生成视频产出的是大量临时帧和缓存,系统盘要留余量,最好挂一块独立的数据盘专门存素材和成品。
避坑清单(实测踩过的雷)
- 显存不足别硬扛:OOM 时先开 CPU 卸载(--t5_cpu、--offload_model),再上 FP8/GGUF,别指望原精度能塞进小卡。
- 模型放错目录:ComfyUI 对 diffusion_models、text_encoders、vae 目录分得很清,放错就加载不到,报错还很隐晦。
- 多卡别开 CPU 卸载:xDiT 并行模式要求 use_cpu_offload 为 False,否则初始化直接断言失败。
- 长视频会漂移:DiT 注意力随帧数二次增长,超过 96 帧后可能出现颜色漂移、首尾不闭合,长片用分镜拼接而非一次生成。
- 防火墙放开 8188:--listen 0.0.0.0 后别忘了安全组放行,但别对公网裸奔,最好只走 SSH 隧道。
- GGUF 低量化是玩具:8GB 卡上 Q3 量化能跑通,但画质垮得厉害,生产别指望它。