H3 优化经济效益 · 4090/5090 vs 社区 phosor internal · 2026-09
MiniMax H3 · batch-production economics

4090/5090 这种便宜但带宽弱的卡,
能不能做出有竞争力的批量 H3 视频?

问题拆成两个可量化的:①生成同样时长的视频要多少计算成本?②要多长生成时间?把我们的实测和社区(VDN/FastH3+数据中心卡)放到同一口径上比——统一用 $/秒视频(计算成本)和 ×实时(生成秒÷视频秒)两个指标,跨分辨率/时长/卡数都可比。

结论先行(下文逐步推导,可自行证伪)
——但前提是用「质量过门」的 8 步蒸馏4 步实测过锐/前腿畸形,不可用)+ 每任务 1–2 卡 + 并行堆任务。质量过门下:768p/5s 实测 8 步 189s ≈ $0.0023/秒视频、480p/5s ≈$0.0016/秒(8 步推断),比社区 B200 便宜 ~3–7×;代价是每片慢。

0先把名词说清楚

名词
一句话解释
为什么这里重要
$/秒视频
生成 1 秒成片的计算成本=GPU每秒租金×卡数×生成时间÷视频时长
跨分辨率/时长/卡数唯一可比的成本口径
×实时
生成耗时÷视频时长。7× = 生成 7 秒得 1 秒片
衡量"快慢";批量生产可容忍大,交互不能
步数蒸馏
把几十步去噪压成 4 步的小改造(flashgen-4step / VDN 8-NFE)
本报告最大杠杆:步数同时乘在算力和通信上
TP / USP(Ulysses)
TP=按注意力头切权重;USP=按序列切、每卡装全权重
多卡怎么切,直接决定通信量与显存
P2P / PCIe switch
GPU 直连拷贝 / 同一 PCIe 交换芯片下的卡组
4090 的 P2P 被驱动禁用→通信要经主机内存两跳,这是"带宽弱"的根因
comm-bound
瓶颈是卡间通信而非算力
4090 多卡就是这状态:4 卡通信占 58.6%
e2e
端到端一条视频的总生成时间
成本与速度都从它算

1成本模型:钱花在哪一步

由 159 条实测拟合(源码 src/analysis/cost_model.py,可复算):

e2e = steps × ( compute(load)/N + comm(N,拓扑) ) + fixed

逐项拆(480p/5s,4×4090 TP2×USP2 实测):固定开销(VAE 解码/文本编码/预热/起服务)只占 1%——所以任何不进去噪循环的优化,天花板就 1%。算力 compute/N = 1.68 s/步。通信 comm = 2.38 s/步、占 58.6%

关键推论:既然每步都被拆成"算力+通信",而 steps 乘在整个括号外面——砍步数(蒸馏)会同时把算力和通信一起除掉,这是唯一能整步跳过的杠杆;量化/换核只压算力项,压不到主导的通信。这解释了为什么下文蒸馏的收益远大于其它手段。

怎么证伪:若在 4090 上把 60 步蒸到 4 步、加速不到~10×(应约等于步数比 × 通信占比修正),则"步数是外层乘子"的模型错,整条推理塌。实测 480p 2×TP2:346s(60步) → 38s(4步) = 9.1×,成立。

2我们的实测 · 4090(node15,vLLM-Omni 0.28.0)

事实源 results/measurements.csv(159 条)。480p = 832×480,5.17s(124f)。成本按 phosor 实付 4090 租金 $0.0000611/GPU秒($144/月)。

配置(480p/5.17s)生成时间卡数$/片$/秒视频×实时
60 步 · 2×TP2(基线)346 s2$0.0423$0.008266.9×
20 步 · 2×TP2116 s2$0.0142$0.002722.4×
4 步蒸馏 · 1×TP175 s1$0.0046$0.000914.5×
4 步蒸馏 · 2×TP2 ★38 s2$0.0046$0.00097.4×
768p · 4 步 · 2×TP288 s2$0.0108$0.002117.0×

注:4 步 1 卡与 2 卡成本几乎一样($0.0046)——2 卡只把延迟砍半,不改单片总 GPU-秒。所以要吞吐用 1 卡×多任务,要单片快用 2 卡。数据行:results/measurements.csvvgzvx2jc(38s)/dsc2jc6x(75s)/4tsjptmj(768p 88s)/4evqpfvr(346s)。

5090 单卡(SGLang 官方 cookbook 实测)

官方分档:CONSUMER_32G(5090) 单请求 112.2s、每步 5.14s;CONSUMER_24G(4090) ~250s、每步 8.5s。5090 比 4090 快 2.2×,主因不是算力,是 32G 能常驻 14 层 DiT(4090 只 6 层)——买 5090 买到的是"少搬数据"。成本按 phosor 5090 $0.000223/GPU秒:单卡 112.2s ≈ $0.025/片 ≈ $0.0048/秒视频(未蒸馏);4 步蒸馏后(推断)约 $0.0013–0.0018/秒。来源:SGLang cookbook · MiniMax-H3.mdx

768p(1344×768/124f)· 1×4090 · 内部看板 v2.0 实测(热态)

这是带画质过门的一手数据(比 480p 更能代表生产),也纠正了一个关键点:4 步蒸馏画质不过门(刺眼/过锐/前腿畸形),生产可用的是 8 步。

配置(768p/5s)生成时间$/秒视频×实时画质
剪枝 fp8 · 20 步(线上生产)426.7 s$0.005285×✅ 4/4
lightx2v · 8 步 LoRA ★189.1 s$0.002338×✅ 过门
VDN · 8 步 turbo180.7 s$0.002236×✅ 过门
lightx2v · 4 步109.0 s$0.001322×❌ 过锐/畸形
最快过门(4 卡 · 8 步)65.2 s$0.003213×✅ 6.55×生产

来源:内部看板 http://…:7052/v2/frameworks/comfyui(RTX 4090 单卡/四卡,v2.0)。成本用 phosor 4090 $0.0000611/GPU秒。冷/温/热差 40%(181/204/253s),此处取热态。VDN 官方 SGLang 栈在 4090 装不下(OOM),ComfyUI 转换路线能跑。

3社区 / 数据中心对比(VDN / FastH3)

社区加速版跑在 B200/H200 上。GPU 成本用 vast.ai 2026-09 中位:B200 $6.52/hr($0.00181/s)、H200 $4.40/hr($0.00122/s)、H100 $3.25/hr。

方案视频时长生成时间$/秒视频×实时
FastH3 · 1×B200~5 s~16 s1$0.00583.2×
VDN · 8×B20014.4 s11.2 s8$0.01130.78×
8×H200(缓存档)~5 s17.2 s8$0.0343.4×
vast.ai 官方模板 · 1×PRO6000(BF16 未蒸馏)~5 s~75 s1$0.003915×

社区数不同源、时长口径不完全一致,已折算到 $/秒视频与 ×实时以便对齐(推断成分见页脚)。要点不是精确到分,而是量级:社区在 $0.006–0.034/秒、0.8–3.4× 实时——快,但每张卡贵 20–30 倍,且多卡把成本推高。VDN 8×B200 能做到快于实时,但 8 张 B200 的账单让 $/秒回到 $0.011。

从 vast.ai 官方 H3 模板学到什么(vast.ai/model/minimax-h3):官方一键方案 = 1× RTX PRO 6000(96GB Blackwell)· ComfyUI · H3-Base BF16 · 未蒸馏,主打"大卡装下、全质量、开箱即用"。它和我们是两端:它买简单+质量+无 OOM(96GB 单卡能吃下 768p/15s),我们买成本+批量(便宜卡+蒸馏)。
关键价格发现:RTX PRO 6000 在 vast 仅 $0.93/hr(spot 低至 $0.16!)——比我预期便宜得多,仅 5090 的 1.5×、却有 3× 显存。这让"1×PRO6000"成为一个被我们低估的选项,尤其对 768p 长视频(见 §8 方案 B)。但官方模板没开蒸馏:$0.0039/秒、15× 实时,仍比我们 4-step 4090($0.0009/秒)贵 4×——因为便宜的不是卡,是"蒸馏省下的步数"。

3.5综合对比总表(我们全部实测 + 社区 + vast)

一张表放齐:我们在 4090 上的多档实测方案(480p/768p × 5s/15s × 1/2/4 卡 × 步数)、社区数据中心方案、vast 官方。口径 $/秒视频 + ×实时 + 画质是否过门推断值标注

方案分辨率·时长机器$/时步数/方法生成$/秒视频×实时画质
我们·8步 lightx2v ★768p·5s1×4090$0.228步蒸馏189 s$0.002338×
我们·VDN 8步 turbo768p·5s1×4090$0.22VDN 8步181 s$0.002236×
我们·4卡最快过门768p·5s4×4090$0.888步65 s$0.003213×
我们·生产 20步768p·5s1×4090$0.2220步427 s$0.005285×
我们·4步(弃用)768p·5s1×4090$0.224步109 s$0.001322×❌畸形
我们·8步 480p推断480p·5s2×4090$0.448步~65 s$0.001613×
我们·20步 480p480p·5s2×4090$0.4420步116 s$0.002722×
我们·长片 20步768p·15s1×4090$0.2220步2645 s$0.0108176×
我们·长片 8步推断768p·15s1×4090$0.228步~1125 s$0.004675×
社区·FastH3~480p·5s1×B200$6.524步DMD~16 s$0.00583.2×
社区·VDN768p·14.4s8×B200$52.28步11 s$0.01130.78×
vast官方模板480p·5s1×PRO6000$0.93BF16未蒸馏~75 s$0.003915×
PRO6000推断768p·15s1×PRO6000$0.938步~740 s$0.0127/spot $0.002249×

我们数:results/measurements.csv(480p) + 内部看板 v2.0(768p,画质过门)。社区/vast:见 §3。$/秒视频=GPU$/s×卡×生成÷时长。看点:质量过门后,我们 768p 8步 $0.0022–0.0023/秒 仍比社区最便宜的 FastH3($0.0058) 便宜 ~2.5×,比 vast 官方($0.0039) 便宜 ~1.7×;且我们是自有便宜卡。长片(768p/15s)是分界:单 4090 8步 $0.0046/秒尚可,但慢(75×),PRO6000 spot 才是甜点。

4核心对比 · 成本↔速度前沿

把所有配置画到"每片速度(×实时,横轴,越左越快)× 计算成本($/秒视频,纵轴,越下越便宜)"上。实心=我们(4090)空心=社区(数据中心)。虚线=我们的报价 ¥0.08/秒。

我们 · 4090(实测) 我们 · 未蒸馏(慢/贵) 社区 · B200/H200 报价线 ¥0.08/秒

这张图想让你看到:我们的 4-step 4090(左下偏下)在成本轴上比所有社区点低 5–30×,而且深踩在报价线下方(12× 余量);社区点全部贴着或高于报价线。速度轴上社区在左(更快),我们在右(更慢)——这正是"成本 vs 延迟"的取舍前沿。

只看成本($/秒视频,对数条)

5第一性原理:为什么便宜卡能赢批量

把 $/秒视频 展开:$/秒 = GPU每秒租金 × 卡数 × 生成时间 ÷ 视频时长。逐个因子看 4090 vs B200:

因子① GPU 每秒租金:4090 便宜 ~30×
4090 $0.0000611/s vs B200 $0.00181/s ≈ 1/30。这是最大的杠杆,且是硬件市场给的、不用我们做任何事。
因子② 生成时间:4090 慢 ~3–9×
4 步蒸馏后 480p 我们 7× 实时、社区 B200 0.8–3×。慢,但只慢个位数倍——远小于 30× 的租金差
因子③ 卡数:我们 1–2,社区常 8
因为 4090 P2P 被禁、多卡通信墙(4 卡上限仅 1.71×),硬件逼着我们每任务只用 1–2 卡——反而让单片 GPU-秒更低。社区为压延迟上到 8 卡,$/秒被卡数乘上去。
净账:租金 ÷30 × 时间 ×(3~9) × 卡数(我们更少) ⇒ 每秒视频净便宜 ~7–12×。带宽弱只影响因子②③的上限,而蒸馏把步数这个"既压算力又压通信"的外层乘子干掉后,因子②③的劣势被压到可接受——这就是便宜卡翻盘的机理。

成立的四个前提(缺一不可)

① 必须步数蒸馏
不蒸馏,60 步在 4090 上 67× 实时,成本优势被步数吃光。4-step 是入场券。
② 每任务 1–2 卡
P2P 被禁的通信墙让大 TP 是白花钱(4 卡上限 1.71×)。别把一条视频摊到多卡。
③ 并行堆任务求吞吐
吞吐 = 卡数 × 每卡任务数。便宜卡线性堆,这才是批量经济学。
④ 场景是批量/非实时
7× 实时对离线批产可接受;要交互秒出才必须上 B200。

6定价与利润

当前报价 ¥0.08/秒 ≈ $0.0113/秒(¥7.1/$1)。对我们的成本:

档位成本 $/秒报价 $/秒毛利
768p · 8 步 · 4090(过门)$0.0023$0.011380%
480p · 8 步 · 4090(推断)$0.0016$0.011386%
768p · 15s · 8 步 · 4090$0.0046$0.011359%
社区 B200 成本(对手)$0.006–0.011$0.01130–47%
竞争护城河:即便用画质过门的 8 步,我们成本 $0.0023(768p)仍比对手在 B200 上的成本($0.006–0.011)低 3–5×。同报 ¥0.08/秒,我们 ~80% 毛利,数据中心对手几乎保本——他们没法在这个价位打价格战。怎么证伪:若拿到社区在单张 B200/PRO6000 上把画质过门的 $/秒做到 ≤$0.0023 的实测,则护城河收窄。

7长视频边界(软肋,要如实说)

生成时间随时长超线性增长,且长片撞显存墙。实测(results/baseline_node14.csv,480p i2v 16 步单卡):

8768p 长视频优化方案(攻坚软肋)

长 768p 的主导项换了:短视频是通信主导;长 768p 先撞显存(OOM)、再撞通信。按第一性原理排序、逐个攻击(每条标:攻击哪项 · 预期 · 状态 · 证伪)。

① 4-step 蒸馏(前提 · 实测)
步数是外层乘子,同时除掉算力和通信。768p/5s 已实测 88s(11.7×)。长片必开,否则无从谈起。
② Ulysses/USP 多卡:切长序列,不切权重(实测支撑)
长视频=长 token 序列,USP 按序列切最契合,序列越长越划算。仓库最新实测 4 卡纯 Ulysses = 91s / 1.99× lossless(480p/5s),对长 768p 只会更有利。⚠️ 每卡装全权重(不省显存),须配合 ④。
③ 跨 PCIe switch 放置(免费 · 实测 1.65×)
4 卡放 4/5/6/7(同 switch 同 NUMA),别挤一个 switch、别跨 NUMA。零成本、量级比量化大。
④ 显存攻坚:解 OOM,避免被迫堆更多卡
分段生成+拼接(把长片切时间段分别生成再缝,直接 cap 峰值显存,长视频最实用)· 层级 offload(SGLang 常驻层流式换入,5090 常驻 14 层)· int8/fp8 量化降显存地板,让 768p-15s 塞进更少卡。
⑤ fp8 集合通信 / 层次化 all-reduce(降通信量 · 推演)
攻击 comm 项,通信减半 → ~1.42×。多卡长片才值得做。
⑥ 步间缓存 TeaCache/MagCache(与蒸馏相乘 · 内置未测)
整步跳过,上限 2.0×,可叠在 4-step 之上。一个命令行开关,验证代价低。
⑦ P2P 驱动补丁(若可行 · 釜底抽薪)
4090 的 P2P 被驱动禁用是通信墙根因;打补丁走 GPUDirect 直连 → 直接抬升多卡上限(当前 4 卡上限仅 1.71×)。⚠️ 消费卡补丁稳定性需实测。

目标经济账(推断,768p-15s 优化后未实测)

768p · 15s生成时间$/秒视频毛利@¥0.08
20 步基线 · 1×4090(实测)2645 s1$0.0108
8 步 · 1×4090(推断,慢)~1125 s1$0.0046~59%
方案A · 4×4090 · 8步+USP+跨switch~400 s 推断4$0.0065~42%
方案B · 1×PRO6000 · 8步(on-demand)~740 s 推断1$0.0127亏 12%
方案B · 1×PRO6000 spot($0.16/hr)~740 s 推断1$0.0022~80%
校准后(用真实 8 步、非 4 步)长 768p 比初版更紧:① 单 4090 8 步 ~1125s(太慢,75× 实时,勉强盈利);② 4×4090+USP+跨switch ~400s、$0.0065/秒、~42% 毛利——工程重但可控;③ 1×PRO6000:96GB 绕开 OOM、工程最简,但 8 步 ~740s 使 on-demand($0.93/hr) $/秒达 $0.0127 → 在 ¥0.08 报价下反而亏只有 spot($0.16/hr) 才划算($0.0022、~80% 毛利)。→ 长 768p 推荐:抢到 PRO6000 spot 用它(最简+盈利),否则 4×4090 编排;on-demand 单卡不划算。所有长片数为推断(4 步实测但画质弃用;8 步长片未直测),须实测校准——这正是本报告最该先补的实验
结论:长 768p 可做到"能批产且仍盈利",但优势窗口比 480p 窄(4 卡进场、通信墙开始咬)。怎么证伪:若 4 卡 USP+跨 switch+4step+分段 下 768p-15s 仍 OOM,或 e2e > 800s,则"消费卡救长 768p"不成立,长/高分辨率交互片退回数据中心卡。执行顺序与命令见 docs/16-optimization-roadmap.md §8