逐模型拆解:技术规格 · 算力需求 · 官方与第三方市场价 · vast.ai 等平台租赁成本 · 自部署方案 · 单位经济学与利润 · 社区优化。本期深度展开 Kimi K3,后续持续更新 DeepSeek / Qwen / Flash 与 Video 板块。
点击已上线模型进入深度分析。灰色为排期中——同一套框架(技术→算力→市场价→自部署→利润→优化)逐个展开。
Moonshot AI 的旗舰:2.8T 总参 / 104B 激活的原生多模态 MoE,1M 上下文,MXFP4 原生量化。激活参数大 = 单 token 算力重,这是它成本高于小模型的根因。
权重 1.56 TB 是硬约束。两条现实路径:H200 集群(生产)与 5090 集群(成本套利/实验)。MXFP4 只在 Blackwell/MI355 级原生加速——5090 是 Blackwell,格式没问题,瓶颈在容量与无 NVLink 的 all-to-all。
| 方案 | 拓扑 | 聚合显存 | 互联 | 吞吐(base) | 定位 |
|---|---|---|---|---|---|
| H200 生产 | 16× H200 (141GB) 2 节点,DP16+EP16 | 2,256 GB | NVLink + IB | ~4,000 tok/s高并发·出 | 稳定商用甜点 |
| 5090 套利 | 60× RTX 5090 (32GB) 8卡/节点 × ~8 | 1,920 GB | PCIe 5.0 (无 NVLink) | ~1,000 tok/s需 spec+P2P | 低价实验/夜间 |
| B300 官方级 | 8× B300 (288GB) 单节点 | 2,304 GB | NVLink5 | 最高 | Moonshot 官方路径 |
吞吐为建模估计(高并发混合负载 · 出 token),按 DeepSeek-V3 级 MoE 服务能力、以激活比例(104B)缩放并计入投机解码,非官方实测值——真实值随 batch、上下文长度、命中率波动,故下方计算器全部参数可调。
吞吐是成本的分母——它由推理管线的每一环决定。下面拆开 K3 的服务框架,并对单 token 解码做延迟归因(profiling),说明 20 → 50 tok/s 的空间从哪来。
基线 50 ms/token = 20 tok/s。纯权重读取(HBM)理论下限仅 ~0.5 ms——差 90×,全在通信、CPU 中转与 kernel 碎片。瓶颈不是算力也不是带宽,是无 NVLink 的 all-to-all。
目标 50 tok/s 稳妥达成(叠乘有相互抵消,已打折至 40–70 区间)。吞吐每提升一档,第 05/06 节的成本/M 同比例下降、毛利同步走高——这就是「优化即利润」。分解为示意值(batch 1 裸 EP 基线),实际随并发、上下文、命中率波动。
官方 $3 入 / $0.30 缓存 / $15 出。第三方普遍贴近官方,最低见 Sail Research $2.60/$13。我们定 官方 −50%:$1.50 入 / $0.15 缓存 / $7.50 出——比全市场都低,靠自部署成本撑毛利。
条形宽度 = 相对官方 $15 出 token 的比例。我们报价与成本线之间的落差即毛利空间。
成本公式:成本/M = 集群$每小时 ÷ (吞吐 tok/s × 3600 ÷ 1e6 × 利用率)。利用率取 70%,报价 $7.50/M。
| 方案 | 集群 $/hr | 吞吐 tok/s | 成本/M | 毛利@$7.5 | 平衡吞吐 |
|---|---|---|---|---|---|
| H200 按需 ($3/GPU) | $48 | 4,000 | $4.76 | 37% | 2,540 |
| H200 预留 ($2/GPU) | $32 | 4,000 | $3.17 | 58% | 1,693 |
| 5090 按需 ($0.35) | $21 | 1,000 | $8.33 | −11% | 1,111 |
| 5090 spot ($0.15) | $9 | 1,000 | $3.57 | 52% | 476 |
上表以「出 token」为核心(成本与售价的大头)。入 token/prefill 是净利上行项:agentic 负载入:出常达 4:1,且 1M 上下文缓存命中率高、prefill 算力便宜,而我们仍按 $1.50/$0.15 计费——计算器已含此项。
调参数看单位经济学与月度损益。默认 = H200 按需生产配置。
月度按 24/7 满负载 × 利用率估算;入 token 收入已扣缓存折扣,prefill 算力占用近似含于利用率。仅供量级参考。
同样的硬件,吞吐能差 2–3×——直接决定上表毛利正负。优先级从高到低:
蒸馏 = 用强「教师」模型的知识训练更小/更快的「学生」,逼近能力而省算力。LLM 蒸的是知识与推理轨迹(视频侧蒸的是「采样步数」,见 Video 板块的蒸馏专栏)。下面拆解:术语 → 三种范式与架构 → 数据/训练怎么做 → 推理侧蒸馏 → 合规传言 → 典型产品。
数据流水线通用四步:教师大量生成 → 拒绝采样/校验过滤 → 保留推理轨迹并格式化 → SFT(黑盒)或 KL(白盒)/ on-policy 更新。数据质量 > 数据量,「留对的」是关键。
| 工程 / 产品 | 做什么 | 方法 |
|---|---|---|
| DistilBERT / TinyBERT | 早期编码器压缩(~40% 更小,保 ~97% 性能) | 白盒 logit KD |
| DeepSeek-R1-Distill | 把 R1 推理蒸进 Qwen/Llama 1.5–70B | 序列级 SFT |
| Kimi K3 | 多领域专家 → 单一全能模型 | MOPD on-policy |
| MiniLLM | 逆向 KL,缓解模式平均 | 白盒逆向 KL |
| EAGLE-3 | 草稿模型做投机解码 | 特征/草稿蒸馏 |
| Gemma / Llama distilled | 官方从旗舰蒸小尺寸 | logit + 序列 |
视频生成的经济学和 LLM 不同——按「每片时长 / 每帧」计价,成本由扩散步数 × 分辨率 × 卡决定。本期深度展开 MiniMax H3(33B 视频 DiT):架构、推理提速、GPU 矩阵、参考与 LoRA 生意,全部由一手拆解与实测支撑。
33B 视频扩散 Transformer(DiT),支持文生视频+音频、图生视频、ref2va 参考驱动。Base 已开源(2026-08-03,FL2VA + Ref2VA 双 checkpoint);H3 Max 为 fal 闭源后训练版,跑在 GB200 NVL72。以下拆解基于 transcript 一手研究(含 11 次自我修正)+ 可复现算子级 FLOPs 计算。
它不是单个模型,而是三件套系统:33B 生成器 + 全量 Qwen3-VL-32B 条件编码器(取第 50 层隐状态)+ 双 VAE(视频 fp16 / 音频 fp32)。HF 仓库 ≈ 498 GB;官方 BF16 部署 ≈ 4 卡(~123.6 GB)。
H3 Max 是唯一有质量数字的变体(AA 榜与 Gemini/Seedance 2.0 差 6–8 Elo,落在 ±10 CI 内 = 统计打平)。商用 license 条款尚未核实——上线前需法务确认。
核心发现是参数与算力的「错位」:条件注入走 AdaLN 调制(非 cross-attention),39.3% 的参数只产生 0.0011% 的算力;而 52.9% 的算力来自零参数的注意力二次项。这直接决定了「显存几乎从不是瓶颈,算力才是」。
结构参数由 safetensors header 的 HTTP-Range 读取实测(不下载权重);FLOPs 经 PyTorch 计数器验证 0.00% 偏差。AdaLN 输入仅时间步嵌入、与 token 无关 → 每步可预计算缓存(提议省 ~25GB,尚未实现)。
生产 shipped workflow = 20 步。提速阶梯从 342s 一路到 3.8s(90×),而最大单笔收益来自换 4-step 蒸馏权重(现成、9.3×)。
| 配置 (768p 5s · 2 参考图) | 整片时延 | 相对 |
|---|---|---|
| 生产 ref2va · 1×5090 · 20 步 dense | 342 s | 1× |
| 4-step 蒸馏 · 1×5090 · FP16 | 36.7 s | 9.3× |
| 4-step · 8×5090 · FP16 | 6.1 s | 56× |
| 8-step · 8×5090 · FP4 (质量档) | 6.7 s | 51× |
| 4-step · 8×5090 · FP4 | 3.8 s | 90× |
九张卡横评(仅 4090 有实测锚点,余同 MFU 外推)。反直觉结论:VRAM 几乎从不是瓶颈,算力才是——逐层权重换入(~0.8GB 常驻)下,连 12GB 3060 都能跑 768p,仅 +1–6% 时间(H3 算术强度是 H100 roofline 拐点的 48×,PCIe 传输藏在计算下)。
| 显卡 | VRAM | 768p 5s | 480p 5s | vs 4090 |
|---|---|---|---|---|
| RTX 3060 | 12 GB | 93.3 min | 23.9 min | 0.08× |
| RTX 3090 | 24 GB | 33.5 min | 8.6 min | 0.22× |
| RTX 4080 | 16 GB | 12.2 min | 3.1 min | 0.59× |
| RTX 5080 | 16 GB | 10.6 min | 2.7 min | 0.68× |
| RTX 4090 实测 | 24 GB | 7.2 min | 1.9 min | 1.00× |
| RTX 5090 | 32 GB | 5.7 min | 1.5 min | 1.27× |
| RTX PRO 6000 | 96 GB | 4.7 min | 1.2 min | 1.52× |
并发 > 序列并行:8 卡各服务自己的请求 ≈ 9.4 片/分,序列并行仅 3 片/分——同样硬件 3× 吞吐;序列并行只买延迟("有人盯着页面时才值")。「加参考就 OOM」的真因不是显存(4090 能装 173 张参考图),而是阶段未卸载 / ComfyUI 未登记 H3 的显存因子 / 参考视频 VAE 编码尖峰。
实测成本是竞品报价的 1–3%。参考输入在 768p 默认下仅约 2.09× 算力(1 张参考图 ≈ 1 目标帧,非早期误判的 17×)——足以打出「参考不额外收费」这张竞品没测过成本、不敢跟的牌。
| 档位 | 成本 $/s | 建议报价 | 毛利 | vs fal |
|---|---|---|---|---|
| H3 标准 20-step | $0.0031 | $0.015 | 4.8× | 便宜 5.3× |
| H3 Turbo 8-step | $0.0012 | $0.010 | 8.1× | 便宜 8× |
| H3 Turbo 4-step | $0.0006 | $0.010 | 16.1× | 便宜 8× |
本研究把 11 次自我推翻当作可信度定价的特性,而非谦辞。几个关键修正:
| 结论 | 早期 → 最新 | 为何翻 |
|---|---|---|
| H3 步数 | 30 → 49 → 20 | 把 harness/diffusers 默认当生产值 |
| H3 结构 | L=64/d=6553 → L=50/d=5376 | 逆向估计 vs header 实测 |
| 参考成本 | 17× → 2.09× | 把非默认满配当默认(且"替代"解释也错) |
| 4090 有效算力 | 123 → 178.6 TFLOP/s | 旧值 =108% 峰值,物理不可能 |
| fal 是否支持 ref2va | 否 → 是 | 把某时刻产品页当成能力边界 |
fal H3 Max blog · page · ref2va 端点 · LoRA 训练指南 · ref2va trainer · Realism People LoRA · Acc LoRA (comfyui-wiki) · VDN-H3 主页 / 仓库 · FastH3 preview / FastVideo / DMD 文档 · VSA (NeurIPS 2025) · Adaptive Video Distillation · X-MinimaxH3
技术拆解来自内部项目 video-asic 的可复现计算(flops_exact.py · h3_memory.py · gpu_matrix.py · h3max_parity.py · refdistill.py)与 video-research 会话研究记录。数值以官方发布/实测为准;未标"实测"者为同 MFU 外推。
和 LLM 蒸「知识」不同,扩散模型蒸的是采样步数与去噪轨迹:教师要几十步去噪,学生学会几步甚至一步出图/出片。这是视频推理提速的核心手段(承接 MiniMax H3 的 342s→3.8s)。
| 工程 / 产品 | 做什么 | 方法 |
|---|---|---|
| LCM / LCM-LoRA | SD 系通用少步加速(4–8 步) | 一致性蒸馏 |
| SDXL-Lightning | 1–8 步高质量出图 | 渐进 + 对抗 |
| Animate-LCM / VideoLCM | 视频 4 步生成 | 一致性(解耦) |
| DMD2 / FastVideo(FastH3) | 数据无关少步视频 | 分布匹配 |
| MiniMax H3 Acc-LoRA | 4 步蒸馏,90× 提速 | CFG+时间头蒸馏 |
| APT (Seedance 系) | 1 步视频生成 | 对抗后训练 |
与 LLM 蒸馏专题 对照:LLM 蒸「知识/推理轨迹」、目标是小模型;视频蒸「采样步数」、目标是少步——但范式同源(教师产出 → 造数据 → 训学生)。