逐模型拆解:技术规格 · 算力需求 · 官方与第三方市场价 · vast.ai 等平台租赁成本 · 自部署方案 · 单位经济学与利润 · 社区优化。本期深度展开 Kimi K3,后续持续更新 DeepSeek / Qwen / Flash 与 Video 板块。
点击已上线模型进入深度分析。灰色为排期中——同一套框架(技术→算力→市场价→自部署→利润→优化)逐个展开。
Moonshot AI 的旗舰:2.8T 总参 / 104B 激活的原生多模态 MoE,1M 上下文,MXFP4 原生量化。激活参数大 = 单 token 算力重,这是它成本高于小模型的根因。
权重 1.56 TB 是硬约束。两条现实路径:H200 集群(生产)与 5090 集群(成本套利/实验)。MXFP4 只在 Blackwell/MI355 级原生加速——5090 是 Blackwell,格式没问题,瓶颈在容量与无 NVLink 的 all-to-all。
| 方案 | 拓扑 | 聚合显存 | 互联 | 吞吐(base) | 定位 |
|---|---|---|---|---|---|
| H200 生产 | 16× H200 (141GB) 2 节点,DP16+EP16 | 2,256 GB | NVLink + IB | ~4,000 tok/s高并发·出 | 稳定商用甜点 |
| 5090 套利 | 60× RTX 5090 (32GB) 8卡/节点 × ~8 | 1,920 GB | PCIe 5.0 (无 NVLink) | ~1,000 tok/s需 spec+P2P | 低价实验/夜间 |
| B300 官方级 | 8× B300 (288GB) 单节点 | 2,304 GB | NVLink5 | 最高 | Moonshot 官方路径 |
吞吐为建模估计(高并发混合负载 · 出 token),按 DeepSeek-V3 级 MoE 服务能力、以激活比例(104B)缩放并计入投机解码,非官方实测值——真实值随 batch、上下文长度、命中率波动,故下方计算器全部参数可调。
吞吐是成本的分母——它由推理管线的每一环决定。下面拆开 K3 的服务框架,并对单 token 解码做延迟归因(profiling),说明 20 → 50 tok/s 的空间从哪来。
基线 50 ms/token = 20 tok/s。纯权重读取(HBM)理论下限仅 ~0.5 ms——差 90×,全在通信、CPU 中转与 kernel 碎片。瓶颈不是算力也不是带宽,是无 NVLink 的 all-to-all。
目标 50 tok/s 稳妥达成(叠乘有相互抵消,已打折至 40–70 区间)。吞吐每提升一档,第 05/06 节的成本/M 同比例下降、毛利同步走高——这就是「优化即利润」。分解为示意值(batch 1 裸 EP 基线),实际随并发、上下文、命中率波动。
官方 $3 入 / $0.30 缓存 / $15 出。第三方普遍贴近官方,最低见 Sail Research $2.60/$13。我们定 官方 −50%:$1.50 入 / $0.15 缓存 / $7.50 出——比全市场都低,靠自部署成本撑毛利。
条形宽度 = 相对官方 $15 出 token 的比例。我们报价与成本线之间的落差即毛利空间。
成本公式:成本/M = 集群$每小时 ÷ (吞吐 tok/s × 3600 ÷ 1e6 × 利用率)。利用率取 70%,报价 $7.50/M。
| 方案 | 集群 $/hr | 吞吐 tok/s | 成本/M | 毛利@$7.5 | 平衡吞吐 |
|---|---|---|---|---|---|
| H200 按需 ($3/GPU) | $48 | 4,000 | $4.76 | 37% | 2,540 |
| H200 预留 ($2/GPU) | $32 | 4,000 | $3.17 | 58% | 1,693 |
| 5090 按需 ($0.35) | $21 | 1,000 | $8.33 | −11% | 1,111 |
| 5090 spot ($0.15) | $9 | 1,000 | $3.57 | 52% | 476 |
上表以「出 token」为核心(成本与售价的大头)。入 token/prefill 是净利上行项:agentic 负载入:出常达 4:1,且 1M 上下文缓存命中率高、prefill 算力便宜,而我们仍按 $1.50/$0.15 计费——计算器已含此项。
调参数看单位经济学与月度损益。默认 = H200 按需生产配置。
月度按 24/7 满负载 × 利用率估算;入 token 收入已扣缓存折扣,prefill 算力占用近似含于利用率。仅供量级参考。
同样的硬件,吞吐能差 2–3×——直接决定上表毛利正负。优先级从高到低:
后训练(post-training)= 预训练之后的一切——把基座变成好用、对齐、专精、够快够小的模型。蒸馏只是其中一种技术。先看全景,再重点展开蒸馏(LLM 里迁移能力最核心的一类)。
▽ 以下重点展开「蒸馏」——术语 → 三范式 → 数据/训练 → 推理侧 → 合规 → 产品。
三种范式到底「流」什么? 同一个 prompt「2+2=?」,三条路传递的信号完全不同:
数据流水线通用四步:教师大量生成 → 拒绝采样/校验过滤 → 保留推理轨迹并格式化 → SFT(黑盒)或 KL(白盒)/ on-policy 更新。数据质量 > 数据量,「留对的」是关键。
如果你手里有大量中转/网关平台的 (prompt, 输入, 输出) 流量(且合法合规),这本质就是一份现成的黑盒序列蒸馏教师数据集——正是上面「黑盒·生成文本」那条路。用法远不止蒸馏:
规模参考:R1 用 80 万条;垂类任务几千~几万条精选常胜过几百万条噪声——数据质量 > 数量。
| 工程 / 产品 | 做什么 | 方法 |
|---|---|---|
| DistilBERT / TinyBERT | 早期编码器压缩(~40% 更小,保 ~97% 性能) | 白盒 logit KD |
| DeepSeek-R1-Distill | 把 R1 推理蒸进 Qwen/Llama 1.5–70B | 序列级 SFT |
| Kimi K3 | 多领域专家 → 单一全能模型 | MOPD on-policy |
| MiniLLM | 逆向 KL,缓解模式平均 | 白盒逆向 KL |
| EAGLE-3 | 草稿模型做投机解码 | 特征/草稿蒸馏 |
| Gemma / Llama distilled | 官方从旗舰蒸小尺寸 | logit + 序列 |
不是所有 LLM 都得上数据中心卡。24–32GB 的消费级卡能跑不少中小模型;社区还有办法把百亿~千亿 MoE 拆到消费级集群或 CPU。Qwen 是当下对消费级最友好的开源家族(全系 Apache 2.0、尺寸全、MoE 小激活),本栏重点看它。
消费级的两条铁律:容量决定「能不能装」(不够就量化/卸载/拼卡);无 NVLink → 多卡走 pipeline(只传激活)比 tensor 并行(频繁 all-reduce)更适合 PCIe。5090 的 FP4 张量核让 4-bit 推理更快。
| Qwen 模型 | 4-bit 权重 | 4090 (24GB) | 5090 (32GB) |
|---|---|---|---|
| Qwen3-0.6B / 1.7B / 4B | <3 GB | ✓ 端侧富余 | ✓ |
| Qwen3-8B | ~5 GB | ✓ 满 131K 上下文 | ✓ |
| Qwen3-14B | ~8.5 GB | ✓ 宽裕 | ✓ |
| Qwen3-32B | ~20 GB | ⚠ 紧(小 ctx) | ✓ |
| Qwen3.8-27B(最新) | ~16–21 GB | ⚠ AWQ 89%,需调 | ✓ Q6 + 128K 全上显存 |
| Qwen3-30B-A3B(MoE) | ~18 GB | ✓ 激活仅 3B,快 | ✓ |
| Qwen3-235B-A22B(MoE) | ~120 GB | ✗ 单卡 → 见 C5 | ✗ 单卡 → 见 C5 |
实测参考:Qwen3.8-27B UD-Q4 GGUF 在 4090 上 144K 上下文 ~46 tok/s;社区 ninfer-4090 用 E8 4-bit KV 把 27B 塞进单 4090 跑满 262K 上下文、MTP3 下代码解码达 149 tok/s。5090 32GB 可 Q6 全精度档 + 128K 上下文全驻显存。
单卡装不下千亿模型?三条社区路子,让 4090/5090(甚至加 CPU 内存)也能跑百亿~千亿 MoE:
--n-cpu-moe N:把前 N 层 MoE FFN 放 CPU、注意力留 GPU → 16GB 卡也能跑 100B+ MoE(如 Qwen3-235B-A22B)。| 工具 | 定位 | 消费级亮点 |
|---|---|---|
| llama.cpp | GGUF 推理引擎 | 多卡自动 · --n-cpu-moe · 跨平台 |
| Ollama / LM Studio | 易用封装 / GUI | 一键跑 · 自动多卡 |
| ktransformers | 巨型 MoE + CPU 卸载 | 单卡 + RAM 跑千亿 |
| vLLM / SGLang | 生产级服务 | TP/PP · 高吞吐(更吃互联) |
| ExLlamaV3 | EXL3 量化 + 快推理 | 单/双卡吞吐优 |
| GPUStack | 消费级 GPU 集群管理 | 异构卡拼集群 |
这是目前经济性最好的一档:小激活 MoE(30B 总 / 3B 激活)单张 5090 就能高吞吐服务,成本低到几乎白菜价,毛利甩开 Kimi K3。
| 项 | 按需 ($0.35/时) | Spot ($0.15/时) |
|---|---|---|
| 吞吐(vLLM AWQ 实测) | 4,570 tok/s | 4,570 tok/s |
| 有效吞吐 @70% | 3,199 tok/s | 3,199 tok/s |
| 成本 / M 出 | $0.030 | $0.013 |
| 市场价(OpenRouter) | $0.12 入 / $0.50 出 | 同左 |
| 我们报价(市场−50%) | $0.25 出 | $0.25 出 |
| 毛利率(出) | 88% | 95% |
| 单卡月净利(出 token) | ~$1,780 | ~$1,970 |
4× 5090 replica 可达 12,744 tok/s(线性堆叠)。绝对营收/卡不高(小模型是商品价),但毛利近 9 成、基建极简(1 卡、无 NVLink、无集群)——和 Kimi K3 那种「60 卡勉强打平」是两个极端。入 token 收入为额外上行项。数值为建模估计,随并发/上下文波动。
「把大模型拆到消费级」有两类成功案例,但省的地方不同——别混为一谈:
那怎么卖出去?——别卖商品 token,卖价值/结果。你的 88% 毛利是「弹药」(能激进定价/免费引流/捆绑),不是产品本身。护城河在这五处:
视频生成的经济学和 LLM 不同——按「每片时长 / 每帧」计价,成本由扩散步数 × 分辨率 × 卡决定。本期深度展开 MiniMax H3(33B 视频 DiT):架构、推理提速、GPU 矩阵、参考与 LoRA 生意,全部由一手拆解与实测支撑。
33B 视频扩散 Transformer(DiT),支持文生视频+音频、图生视频、ref2va 参考驱动。Base 已开源(2026-08-03,FL2VA + Ref2VA 双 checkpoint);H3 Max 为 fal 闭源后训练版,跑在 GB200 NVL72。以下拆解基于 transcript 一手研究(含 11 次自我修正)+ 可复现算子级 FLOPs 计算。
它不是单个模型,而是三件套系统:33B 生成器 + 全量 Qwen3-VL-32B 条件编码器(取第 50 层隐状态)+ 双 VAE(视频 fp16 / 音频 fp32)。HF 仓库 ≈ 498 GB;官方 BF16 部署 ≈ 4 卡(~123.6 GB)。
H3 Max 是唯一有质量数字的变体(AA 榜与 Gemini/Seedance 2.0 差 6–8 Elo,落在 ±10 CI 内 = 统计打平)。商用 license 条款尚未核实——上线前需法务确认。
核心发现是参数与算力的「错位」:条件注入走 AdaLN 调制(非 cross-attention),39.3% 的参数只产生 0.0011% 的算力;而 52.9% 的算力来自零参数的注意力二次项。这直接决定了「显存几乎从不是瓶颈,算力才是」。
结构参数由 safetensors header 的 HTTP-Range 读取实测(不下载权重);FLOPs 经 PyTorch 计数器验证 0.00% 偏差。AdaLN 输入仅时间步嵌入、与 token 无关 → 每步可预计算缓存(提议省 ~25GB,尚未实现)。
生产 shipped workflow = 20 步。提速阶梯从 342s 一路到 3.8s(90×),而最大单笔收益来自换 4-step 蒸馏权重(现成、9.3×)。
| 配置 (768p 5s · 2 参考图) | 整片时延 | 相对 |
|---|---|---|
| 生产 ref2va · 1×5090 · 20 步 dense | 342 s | 1× |
| 4-step 蒸馏 · 1×5090 · FP16 | 36.7 s | 9.3× |
| 4-step · 8×5090 · FP16 | 6.1 s | 56× |
| 8-step · 8×5090 · FP4 (质量档) | 6.7 s | 51× |
| 4-step · 8×5090 · FP4 | 3.8 s | 90× |
九张卡横评(仅 4090 有实测锚点,余同 MFU 外推)。反直觉结论:VRAM 几乎从不是瓶颈,算力才是——逐层权重换入(~0.8GB 常驻)下,连 12GB 3060 都能跑 768p,仅 +1–6% 时间(H3 算术强度是 H100 roofline 拐点的 48×,PCIe 传输藏在计算下)。
| 显卡 | VRAM | 768p 5s | 480p 5s | vs 4090 |
|---|---|---|---|---|
| RTX 3060 | 12 GB | 93.3 min | 23.9 min | 0.08× |
| RTX 3090 | 24 GB | 33.5 min | 8.6 min | 0.22× |
| RTX 4080 | 16 GB | 12.2 min | 3.1 min | 0.59× |
| RTX 5080 | 16 GB | 10.6 min | 2.7 min | 0.68× |
| RTX 4090 实测 | 24 GB | 7.2 min | 1.9 min | 1.00× |
| RTX 5090 | 32 GB | 5.7 min | 1.5 min | 1.27× |
| RTX PRO 6000 | 96 GB | 4.7 min | 1.2 min | 1.52× |
并发 > 序列并行:8 卡各服务自己的请求 ≈ 9.4 片/分,序列并行仅 3 片/分——同样硬件 3× 吞吐;序列并行只买延迟("有人盯着页面时才值")。「加参考就 OOM」的真因不是显存(4090 能装 173 张参考图),而是阶段未卸载 / ComfyUI 未登记 H3 的显存因子 / 参考视频 VAE 编码尖峰。
把 MiniMax 视频线的版本谱系、质量与设备要求拉通对齐(从 4090 到 GB200)。要点:「H3 Max」是 fal 的后训练闭源版,不是 MiniMax 官方版本;官方旗舰是 H3(Hailuo 3.0) 开源权重。
| 版本 | 时间 | 开/闭源 | 质量 | 定位 |
|---|---|---|---|---|
| T2V-01-Director | 2025-02 | 闭源 API | 一代 | 早期文生视频 |
| Hailuo-02 | 2025-06 | 闭源 API | 二代(架构/数据/规模) | 效率与扩展 |
| Hailuo 2.3 | 2025-10 | 闭源 API | WorldModelBench「物理冠军」 | 物理一致性强 |
| H3 / Hailuo 3.0 | 2026-07 | 开源权重 | Elo #2 (1242 T2VA) · 编辑 #1 | 当前旗舰 · 2K@24fps · 全模态 |
| ├ H3 Base · FL2VA | H3 | 开源 | 满质量(教师) | 文生 + 帧条件图生 |
| ├ H3 Base · Ref2VA | H3 | 开源 | 满质量 | 参考驱动(角色/运镜/声音) |
| ├ H3 Max fal | H3 | 闭源(fal 后训练) | +8 Elo(最高) | fal 托管 · GB200 |
| ├ VDN-H3 OpenVDN | H3 | 自报近乎无损 | 开源(第三方) | 混合注意力 · 8 步 |
| ├ FastH3 Hao AI | H3 | 少步(DMD) | 开源(第三方) | 4 步 · VSA(B200) |
| └ 蒸馏/量化档 | H3 | 开源 | 少步略降 / 量化档 | 4–8 步 · FP4/Q4… 上消费卡 |
| 设备 | VRAM | 能跑档 | 典型时延 | 定位 |
|---|---|---|---|---|
| RTX 4090 | 24 GB | 量化/卸载/少步 | 20步 7.2min · 4步 数十秒 | 实验/端侧 |
| RTX 5090 | 32 GB | Q6/少步 | 20步 5.7min · 4步 36.7s · 8卡 3.8s(FP4) | 成本套利 |
| H100 | 80 GB | BF16(需多卡) | 需 2+ 卡;略慢于 H200 | 通用数据中心 |
| H200 | 141 GB | BF16 全档 | 8卡无损 37.8s→缓存 17.2s;4卡 75s→25.8s | 生产主力 |
| B200 | ~180 GB | BF16/FP4 | 8卡:VDN 14.4s片/11.2s;FastH3 15s/<13s | 高端生产 |
| GB200 NVL72 | 巨量 | 全档 | Sol 引擎 3.95× 近无损 | 顶配 · fal H3 Max 平台 |
官方 BF16 部署约 4 卡(~123.6GB):单张 H200(141GB) 勉强容 BF16,H100(80GB) 需 2+ 卡;消费卡靠量化(NVFP4 12.5GB / Q4 20.9GB)+逐层卸载+少步「能跑但慢/需调」。质量↔速度↔设备是三角:满质量 dense 要多卡数据中心;少步蒸馏(FastH3/VDN)在 B200 秒级但依赖 FA4 + B200(sm100a) 内核(5090 sm120 会 fallback);消费卡是「跑得起、但别做高并发生意」。数据中心时延为 SGLang/官方公开值。
把设备矩阵换算成钱。市场锚点 fal H3 Max $0.40 / 5s 片(促销 $0.20,≈ $0.08/秒)。成本/片 = 集群 $每时 ÷ 每时片数。结论和 LLM 的 Qwen 经济账 同构。
| 配置(768p 5s) | 集群 $/时 | 秒/片 | 片/时 | 成本/片 | 毛利@$0.20 |
|---|---|---|---|---|---|
| 5090×1 · 4 步蒸馏 | $0.35 | 36.7 | 98 | $0.0036 | 98% |
| 5090×8 · 4 步 FP4 | $2.80 | 3.8 | 947 | $0.0030 | 98% |
| 5090×1 · 20 步 dense | $0.35 | 342 | 10.5 | $0.033 | 84% |
| H200×8 · 缓存(满质量) | $24 | 17.2 | 209 | $0.115 | 43% |
| H200×8 · 无损 dense | $24 | 37.8 | 95 | $0.25 | 亏 → 卖 $0.40 得 37% |
| B200×8 | $48 | 12 | 300 | $0.16 | 20% → 卖 $0.40 得 60% |
GPU 租金取 vast.ai 量级(5090 $0.35 / H200 $3 / B200 $6,spot 更低);片/时按连续队列满算(视频任务天然排队、GPU 近满载),实际利用率 70–90% 会等比抬高成本/片。4 步蒸馏质量略低于满质量 dense(见 V4+ 三角)。数值为建模估计,随分辨率/时长/命中率波动。
实测成本是竞品报价的 1–3%。参考输入在 768p 默认下仅约 2.09× 算力(1 张参考图 ≈ 1 目标帧,非早期误判的 17×)——足以打出「参考不额外收费」这张竞品没测过成本、不敢跟的牌。
| 档位 | 成本 $/s | 建议报价 | 毛利 | vs fal |
|---|---|---|---|---|
| H3 标准 20-step | $0.0031 | $0.015 | 4.8× | 便宜 5.3× |
| H3 Turbo 8-step | $0.0012 | $0.010 | 8.1× | 便宜 8× |
| H3 Turbo 4-step | $0.0006 | $0.010 | 16.1× | 便宜 8× |
本研究把 11 次自我推翻当作可信度定价的特性,而非谦辞。几个关键修正:
| 结论 | 早期 → 最新 | 为何翻 |
|---|---|---|
| H3 步数 | 30 → 49 → 20 | 把 harness/diffusers 默认当生产值 |
| H3 结构 | L=64/d=6553 → L=50/d=5376 | 逆向估计 vs header 实测 |
| 参考成本 | 17× → 2.09× | 把非默认满配当默认(且"替代"解释也错) |
| 4090 有效算力 | 123 → 178.6 TFLOP/s | 旧值 =108% 峰值,物理不可能 |
| fal 是否支持 ref2va | 否 → 是 | 把某时刻产品页当成能力边界 |
fal H3 Max blog · page · ref2va 端点 · LoRA 训练指南 · ref2va trainer · Realism People LoRA · Acc LoRA (comfyui-wiki) · VDN-H3 主页 / 仓库 · FastH3 preview / FastVideo / DMD 文档 · VSA (NeurIPS 2025) · Adaptive Video Distillation · X-MinimaxH3
技术拆解来自内部项目 video-asic 的可复现计算(flops_exact.py · h3_memory.py · gpu_matrix.py · h3max_parity.py · refdistill.py)与 video-research 会话研究记录。数值以官方发布/实测为准;未标"实测"者为同 MFU 外推。
视频扩散的后训练也是大类:步数蒸馏、微调(角色/风格 LoRA)、架构改造(VDN)、量化、对抗后训练…。本栏重点展开「步数蒸馏」(把几十步去噪压成几步),并给一个「架构改造 → 消费级工程」的真实案例:VDN → ComfyUI。
▽ 以下重点展开「步数蒸馏」
把「轨迹」画出来:去噪是从纯噪声一步步走到成品;蒸馏就是让学生少走几步直达。紫点=真实前向,灰点=被跳过的步,■=成品,⚡=判别器。
| 工程 / 产品 | 做什么 | 方法 |
|---|---|---|
| LCM / LCM-LoRA | SD 系通用少步加速(4–8 步) | 一致性蒸馏 |
| SDXL-Lightning | 1–8 步高质量出图 | 渐进 + 对抗 |
| Animate-LCM / VideoLCM | 视频 4 步生成 | 一致性(解耦) |
| DMD2 / FastVideo(FastH3) | 数据无关少步视频 | 分布匹配 |
| MiniMax H3 Acc-LoRA | 4 步蒸馏,90× 提速 | CFG+时间头蒸馏 |
| APT (Seedance 系) | 1 步视频生成 | 对抗后训练 |
VDN 本身是一次「架构改造后训练」——在冻结的 H3 上把远程二次注意力换成线性分支,再用 4 阶段适配补偿:A1/A2 对齐(自蒸馏)+ B LoRA + DMD 步数蒸馏。它是后训练、内部用到蒸馏,正好印证「蒸馏 ⊂ 后训练」。Saganaki22/ComfyUI-VDN-H3 这个社区工程,把它从「只跑数据中心」变成「消费卡即插即用」。
| 步骤 | 有损? | 类型 |
|---|---|---|
| 线性分支替代远程注意力 | ⚠ 轻微 | 质量(近似远程上下文) |
| 8-step DMD 蒸馏 | ⚠ 有损 | 质量(少步;50-step 档基本无损) |
| 文本编码器 NVFP4-AWQ | ⚠ 有损 | 质量(4-bit 编码器) |
| 可选 fp8_scaled diffusion | ⚠ 有损 | 质量(FP8 权重) |
| 可移植内核(FA4→PyTorch) | 性能有损 | 速度(2.6× vs 74.5×,画质近似无损) |
| INT8 ConvRot(分支/Video VAE) | ✓ 无损 | 声称 bit-identical |
| 显存调度 / 流式 / re-key | ✓ 无损 | 不改计算 |
要更接近满质量:用 50-step stage-b 档 + INT8 ConvRot(而非 fp8)+ 少叠激进缓存。这个工程在「画质↔速度↔设备」三角里选了消费卡可跑 + 尽量保画质,代价是速度——是「研究代码 → 消费级工程」的教科书案例。
与 LLM 后训练专题 对照:LLM 后训练迁移「知识/推理轨迹」、目标是小模型;视频后训练压「采样步数」或改结构、目标是少步/可跑——但同属后训练大类,且都常用蒸馏。