问题拆成两个可量化的:①生成同样时长的视频要多少计算成本?②要多长生成时间?把我们的实测和社区(VDN/FastH3+数据中心卡)放到同一口径上比——统一用 $/秒视频(计算成本)和 ×实时(生成秒÷视频秒)两个指标,跨分辨率/时长/卡数都可比。
由 159 条实测拟合(源码 src/analysis/cost_model.py,可复算):
e2e = steps × ( compute(load)/N + comm(N,拓扑) ) + fixed
逐项拆(480p/5s,4×4090 TP2×USP2 实测):固定开销(VAE 解码/文本编码/预热/起服务)只占 1%——所以任何不进去噪循环的优化,天花板就 1%。算力 compute/N = 1.68 s/步。通信 comm = 2.38 s/步、占 58.6%。
关键推论:既然每步都被拆成"算力+通信",而 steps 乘在整个括号外面——砍步数(蒸馏)会同时把算力和通信一起除掉,这是唯一能整步跳过的杠杆;量化/换核只压算力项,压不到主导的通信。这解释了为什么下文蒸馏的收益远大于其它手段。
事实源 results/measurements.csv(159 条)。480p = 832×480,5.17s(124f)。成本按 phosor 实付 4090 租金 $0.0000611/GPU秒($144/月)。
| 配置(480p/5.17s) | 生成时间 | 卡数 | $/片 | $/秒视频 | ×实时 |
|---|---|---|---|---|---|
| 60 步 · 2×TP2(基线) | 346 s | 2 | $0.0423 | $0.0082 | 66.9× |
| 20 步 · 2×TP2 | 116 s | 2 | $0.0142 | $0.0027 | 22.4× |
| 4 步蒸馏 · 1×TP1 | 75 s | 1 | $0.0046 | $0.0009 | 14.5× |
| 4 步蒸馏 · 2×TP2 ★ | 38 s | 2 | $0.0046 | $0.0009 | 7.4× |
| 768p · 4 步 · 2×TP2 | 88 s | 2 | $0.0108 | $0.0021 | 17.0× |
注:4 步 1 卡与 2 卡成本几乎一样($0.0046)——2 卡只把延迟砍半,不改单片总 GPU-秒。所以要吞吐用 1 卡×多任务,要单片快用 2 卡。数据行:results/measurements.csv 的 vgzvx2jc(38s)/dsc2jc6x(75s)/4tsjptmj(768p 88s)/4evqpfvr(346s)。
官方分档:CONSUMER_32G(5090) 单请求 112.2s、每步 5.14s;CONSUMER_24G(4090) ~250s、每步 8.5s。5090 比 4090 快 2.2×,主因不是算力,是 32G 能常驻 14 层 DiT(4090 只 6 层)——买 5090 买到的是"少搬数据"。成本按 phosor 5090 $0.000223/GPU秒:单卡 112.2s ≈ $0.025/片 ≈ $0.0048/秒视频(未蒸馏);4 步蒸馏后(推断)约 $0.0013–0.0018/秒。来源:SGLang cookbook · MiniMax-H3.mdx。
这是带画质过门的一手数据(比 480p 更能代表生产),也纠正了一个关键点:4 步蒸馏画质不过门(刺眼/过锐/前腿畸形),生产可用的是 8 步。
| 配置(768p/5s) | 生成时间 | $/秒视频 | ×实时 | 画质 |
|---|---|---|---|---|
| 剪枝 fp8 · 20 步(线上生产) | 426.7 s | $0.0052 | 85× | ✅ 4/4 |
| lightx2v · 8 步 LoRA ★ | 189.1 s | $0.0023 | 38× | ✅ 过门 |
| VDN · 8 步 turbo | 180.7 s | $0.0022 | 36× | ✅ 过门 |
| lightx2v · 4 步 | 109.0 s | $0.0013 | 22× | ❌ 过锐/畸形 |
| 最快过门(4 卡 · 8 步) | 65.2 s | $0.0032 | 13× | ✅ 6.55×生产 |
来源:内部看板 http://…:7052/v2/frameworks/comfyui(RTX 4090 单卡/四卡,v2.0)。成本用 phosor 4090 $0.0000611/GPU秒。冷/温/热差 40%(181/204/253s),此处取热态。VDN 官方 SGLang 栈在 4090 装不下(OOM),ComfyUI 转换路线能跑。
社区加速版跑在 B200/H200 上。GPU 成本用 vast.ai 2026-09 中位:B200 $6.52/hr($0.00181/s)、H200 $4.40/hr($0.00122/s)、H100 $3.25/hr。
| 方案 | 视频时长 | 生成时间 | 卡 | $/秒视频 | ×实时 |
|---|---|---|---|---|---|
| FastH3 · 1×B200 | ~5 s | ~16 s | 1 | $0.0058 | 3.2× |
| VDN · 8×B200 | 14.4 s | 11.2 s | 8 | $0.0113 | 0.78× |
| 8×H200(缓存档) | ~5 s | 17.2 s | 8 | $0.034 | 3.4× |
| vast.ai 官方模板 · 1×PRO6000(BF16 未蒸馏) | ~5 s | ~75 s | 1 | $0.0039 | 15× |
社区数不同源、时长口径不完全一致,已折算到 $/秒视频与 ×实时以便对齐(推断成分见页脚)。要点不是精确到分,而是量级:社区在 $0.006–0.034/秒、0.8–3.4× 实时——快,但每张卡贵 20–30 倍,且多卡把成本推高。VDN 8×B200 能做到快于实时,但 8 张 B200 的账单让 $/秒回到 $0.011。
一张表放齐:我们在 4090 上的多档实测方案(480p/768p × 5s/15s × 1/2/4 卡 × 步数)、社区数据中心方案、vast 官方。口径 $/秒视频 + ×实时 + 画质是否过门。推断值标注。
| 方案 | 分辨率·时长 | 卡 | 机器$/时 | 步数/方法 | 生成 | $/秒视频 | ×实时 | 画质 |
|---|---|---|---|---|---|---|---|---|
| 我们·8步 lightx2v ★ | 768p·5s | 1×4090 | $0.22 | 8步蒸馏 | 189 s | $0.0023 | 38× | ✅ |
| 我们·VDN 8步 turbo | 768p·5s | 1×4090 | $0.22 | VDN 8步 | 181 s | $0.0022 | 36× | ✅ |
| 我们·4卡最快过门 | 768p·5s | 4×4090 | $0.88 | 8步 | 65 s | $0.0032 | 13× | ✅ |
| 我们·生产 20步 | 768p·5s | 1×4090 | $0.22 | 20步 | 427 s | $0.0052 | 85× | ✅ |
| 我们·4步(弃用) | 768p·5s | 1×4090 | $0.22 | 4步 | 109 s | $0.0013 | 22× | ❌畸形 |
| 我们·8步 480p推断 | 480p·5s | 2×4090 | $0.44 | 8步 | ~65 s | $0.0016 | 13× | ≈ |
| 我们·20步 480p | 480p·5s | 2×4090 | $0.44 | 20步 | 116 s | $0.0027 | 22× | ✅ |
| 我们·长片 20步 | 768p·15s | 1×4090 | $0.22 | 20步 | 2645 s | $0.0108 | 176× | ✅ |
| 我们·长片 8步推断 | 768p·15s | 1×4090 | $0.22 | 8步 | ~1125 s | $0.0046 | 75× | ≈ |
| 社区·FastH3 | ~480p·5s | 1×B200 | $6.52 | 4步DMD | ~16 s | $0.0058 | 3.2× | — |
| 社区·VDN | 768p·14.4s | 8×B200 | $52.2 | 8步 | 11 s | $0.0113 | 0.78× | — |
| vast官方模板 | 480p·5s | 1×PRO6000 | $0.93 | BF16未蒸馏 | ~75 s | $0.0039 | 15× | ✅ |
| PRO6000推断 | 768p·15s | 1×PRO6000 | $0.93 | 8步 | ~740 s | $0.0127/spot $0.0022 | 49× | ≈ |
我们数:results/measurements.csv(480p) + 内部看板 v2.0(768p,画质过门)。社区/vast:见 §3。$/秒视频=GPU$/s×卡×生成÷时长。看点:质量过门后,我们 768p 8步 $0.0022–0.0023/秒 仍比社区最便宜的 FastH3($0.0058) 便宜 ~2.5×,比 vast 官方($0.0039) 便宜 ~1.7×;且我们是自有便宜卡。长片(768p/15s)是分界:单 4090 8步 $0.0046/秒尚可,但慢(75×),PRO6000 spot 才是甜点。
把所有配置画到"每片速度(×实时,横轴,越左越快)× 计算成本($/秒视频,纵轴,越下越便宜)"上。实心=我们(4090),空心=社区(数据中心)。虚线=我们的报价 ¥0.08/秒。
这张图想让你看到:我们的 4-step 4090(左下偏下)在成本轴上比所有社区点低 5–30×,而且深踩在报价线下方(12× 余量);社区点全部贴着或高于报价线。速度轴上社区在左(更快),我们在右(更慢)——这正是"成本 vs 延迟"的取舍前沿。
把 $/秒视频 展开:$/秒 = GPU每秒租金 × 卡数 × 生成时间 ÷ 视频时长。逐个因子看 4090 vs B200:
当前报价 ¥0.08/秒 ≈ $0.0113/秒(¥7.1/$1)。对我们的成本:
| 档位 | 成本 $/秒 | 报价 $/秒 | 毛利 |
|---|---|---|---|
| 768p · 8 步 · 4090(过门) | $0.0023 | $0.0113 | 80% |
| 480p · 8 步 · 4090(推断) | $0.0016 | $0.0113 | 86% |
| 768p · 15s · 8 步 · 4090 | $0.0046 | $0.0113 | 59% |
| 社区 B200 成本(对手) | $0.006–0.011 | $0.0113 | 0–47% |
生成时间随时长超线性增长,且长片撞显存墙。实测(results/baseline_node14.csv,480p i2v 16 步单卡):
长 768p 的主导项换了:短视频是通信主导;长 768p 先撞显存(OOM)、再撞通信。按第一性原理排序、逐个攻击(每条标:攻击哪项 · 预期 · 状态 · 证伪)。
| 768p · 15s | 生成时间 | 卡 | $/秒视频 | 毛利@¥0.08 |
|---|---|---|---|---|
| 20 步基线 · 1×4090(实测) | 2645 s | 1 | $0.0108 | − |
| 8 步 · 1×4090(推断,慢) | ~1125 s | 1 | $0.0046 | ~59% |
| 方案A · 4×4090 · 8步+USP+跨switch | ~400 s 推断 | 4 | $0.0065 | ~42% |
| 方案B · 1×PRO6000 · 8步(on-demand) | ~740 s 推断 | 1 | $0.0127 | 亏 12% |
| 方案B · 1×PRO6000 spot($0.16/hr) | ~740 s 推断 | 1 | $0.0022 | ~80% |
docs/16-optimization-roadmap.md §8。