更新于 2026-09
Self-Hosting Economics · 开源模型自部署经济模型

把开源前沿模型跑起来,
比官方便宜 50%,还能赚钱吗?

逐模型拆解:技术规格 · 算力需求 · 官方与第三方市场价 · vast.ai 等平台租赁成本 · 自部署方案 · 单位经济学与利润 · 社区优化。本期深度展开 Kimi K3,后续持续更新 DeepSeek / Qwen / Flash 与 Video 板块。

💰 商业机会 · Arbitrage
官方 / 第三方定价 $13–15/M,而 H200 实际 serving 成本低至 $3.17/M —— 以官方 −50% 报价切入,仍留 37–58% 毛利的套利窗口。
最优毛利率
58%
16×H200 预留 · −50% 报价
单集群月净利
~$24k
16×H200 按需 · 满负载 24/7
年化净利 / 集群
~$290k
纯租赁 · 零 capex
价格护城河
低 42%
$7.5 vs 第三方最低 $13
我们报价 · 出 token
$7.50/M
官方 $15 的 −50%
最佳成本 · 出 token
$3.17/M
16×H200 预留价
生产甜点毛利
37–58%
H200 按需 → 预留
收支平衡吞吐
2540tok/s
H200 按需 @70% 利用率

01模型清单 · LLM

点击已上线模型进入深度分析。灰色为排期中——同一套框架(技术→算力→市场价→自部署→利润→优化)逐个展开。

02Kimi K3 · 技术规格

Moonshot AI 的旗舰:2.8T 总参 / 104B 激活的原生多模态 MoE,1M 上下文,MXFP4 原生量化。激活参数大 = 单 token 算力重,这是它成本高于小模型的根因。

总参 / 激活
2.8T / 104B
专家 (激活)
896 → 16+2
层数
93 (69 KDA+24 MLA)
注意力
KDA 线性 + Gated MLA
上下文 / 词表
1M / 160K
量化 (权重体积)
MXFP4 ≈ 1.56 TB
多模态
文本+图像+视频
投机解码
EAGLE-3 draft
许可证
Kimi K3 License

03算力需求 & 部署方案

权重 1.56 TB 是硬约束。两条现实路径:H200 集群(生产)5090 集群(成本套利/实验)。MXFP4 只在 Blackwell/MI355 级原生加速——5090 是 Blackwell,格式没问题,瓶颈在容量与无 NVLink 的 all-to-all。

方案拓扑聚合显存互联吞吐(base)定位
H200 生产16× H200 (141GB)
2 节点,DP16+EP16
2,256 GBNVLink + IB~4,000 tok/s高并发·出稳定商用甜点
5090 套利60× RTX 5090 (32GB)
8卡/节点 × ~8
1,920 GBPCIe 5.0 (无 NVLink)~1,000 tok/s需 spec+P2P低价实验/夜间
B300 官方级8× B300 (288GB)
单节点
2,304 GBNVLink5最高Moonshot 官方路径

吞吐为建模估计(高并发混合负载 · 出 token),按 DeepSeek-V3 级 MoE 服务能力、以激活比例(104B)缩放并计入投机解码,非官方实测值——真实值随 batch、上下文长度、命中率波动,故下方计算器全部参数可调。

04推理框架 & Profiling

吞吐是成本的分母——它由推理管线的每一环决定。下面拆开 K3 的服务框架,并对单 token 解码做延迟归因(profiling),说明 20 → 50 tok/s 的空间从哪来。

推理管线 Prefill / Decode 分离部署
① 请求 + 前缀缓存
KDA-aware 前缀缓存联合管理 KDA 递归状态 + MLA KV。1M 上下文命中后仅增量 prefill ~4K
512-token 边界可命中
② Prefill 阶段
FlashKDA chunkwise 内核 + Gated MLA;SM 级 Context Parallelism 并行超长序列。
算力密集 · 可独立扩容
③ Decode 阶段
进入自回归循环,逐 token 出字。瓶颈从算力转为状态搬运 + 跨卡通信
延迟敏感 · 本节重点
Decode 循环(每步)
draft · EAGLE-3
Kimi-K3-0.40B 单层草稿模型一次提 k 个候选 token。
提 4
target verify
KDA 递归状态更新 + MLA KV 读 + MoE 16 专家 all-to-all,一次前向校验 k+1 个 token。
批量化改善通信
accept + rollback
ReplaySSM 缓存 draft 投影输入、on-chip 重建被接受 token 的状态。
接受 ~3 / 步

Profiling:单 token 解码延迟归因(裸 EP · batch 1 · 示意)

基线 50 ms/token = 20 tok/s。纯权重读取(HBM)理论下限仅 ~0.5 ms——差 90×,全在通信、CPU 中转与 kernel 碎片。瓶颈不是算力也不是带宽,是无 NVLink 的 all-to-all。

MoE all-to-all (PCIe) ~29ms CPU 中转 ~9ms kernel 碎片 ~6ms 其他 ~5ms
跨卡专家通信(主导瓶颈) 无 P2P 的主机内存反弹 93 层 kernel launch 通用/未适配 kernel 权重读取 ~0.5ms(理论下限)

优化增益阶梯:20 → 50+ tok/s(累计 · 已打折)

基线(裸 EP · 无 spec)
20 tok/s
+ EAGLE-3 投机
~40 ·×2
+ PCIe P2P 补丁
~52 ·×1.3
+ latent-FP8 / FlashKDA
~62 ·×1.2
+ CUDA Graph / 重叠
~70 ·×1.13

目标 50 tok/s 稳妥达成(叠乘有相互抵消,已打折至 40–70 区间)。吞吐每提升一档,第 05/06 节的成本/M 同比例下降、毛利同步走高——这就是「优化即利润」。分解为示意值(batch 1 裸 EP 基线),实际随并发、上下文、命中率波动。

05市场价格对照 · 出 token ($/M)

官方 $3 入 / $0.30 缓存 / $15 出。第三方普遍贴近官方,最低见 Sail Research $2.60/$13。我们定 官方 −50%$1.50 入 / $0.15 缓存 / $7.50 出——比全市场都低,靠自部署成本撑毛利。

Kimi 官方$15.00
官方 platform.kimi.ai
第三方最低 (Sail)$13.00
FP4 · 略裁上下文
我们报价$7.50
官方 −50%
自部署成本 (H200 预留)$3.17
成本线

条形宽度 = 相对官方 $15 出 token 的比例。我们报价与成本线之间的落差即毛利空间。

06单位经济学 · 每 1M 出 token

成本公式:成本/M = 集群$每小时 ÷ (吞吐 tok/s × 3600 ÷ 1e6 × 利用率)。利用率取 70%,报价 $7.50/M。

方案集群 $/hr吞吐 tok/s成本/M毛利@$7.5平衡吞吐
H200 按需 ($3/GPU)$484,000$4.7637%2,540
H200 预留 ($2/GPU)$324,000$3.1758%1,693
5090 按需 ($0.35)$211,000$8.33−11%1,111
5090 spot ($0.15)$91,000$3.5752%476
核心判断:K3 这种 104B 激活的重模型,H200 是生产甜点区(按需即 37% 毛利,预留达 58%)。5090 按需会亏——低吞吐 + 无 NVLink 的 all-to-all 拖累;只有 spot 价或把吞吐优化上去才转正。5090 的真正主场是后续的小模型(V4-Flash / Qwen),下期展开。

上表以「出 token」为核心(成本与售价的大头)。入 token/prefill 是净利上行项:agentic 负载入:出常达 4:1,且 1M 上下文缓存命中率高、prefill 算力便宜,而我们仍按 $1.50/$0.15 计费——计算器已含此项。

07交互式利润计算器

调参数看单位经济学与月度损益。默认 = H200 按需生产配置。

成本 / M 出
$4.76
毛利率(出)
37%
利润率健康度
我们售价 · 出 token$7.50 /M
月产出 token(24/7)7,258 M
月收入(出 + 入)$64,300
月成本(GPU + 15% 运维)$39,744
月净利$24,556

月度按 24/7 满负载 × 利用率估算;入 token 收入已扣缓存折扣,prefill 算力占用近似含于利用率。仅供量级参考。

08社区 & 自研优化方法

同样的硬件,吞吐能差 2–3×——直接决定上表毛利正负。优先级从高到低:

投机解码 EAGLE-3
K3 原生自带 draft(`Kimi-K3-0.40B`)。接受长度 ~3 → 单流吞吐直接 2–3×,且 verify 批量化改善 all-to-all 效率。
增益 ×2–3 · 最高杠杆
SGLang / vLLM + P/D 分离
KDA-aware 前缀缓存 + prefill/decode 分离;1M 上下文命中后仅增量 prefill 4K,成本降数量级。
增益 ×1.5–2 · 官方 recipe
PCIe P2P 驱动补丁(5090)
消费卡默认禁 P2P;打补丁走 GPUDirect 直传,去掉每次 all-to-all 的 CPU 中转。5090 集群转正的关键。
增益 ×1.3–1.6 · 仅 5090
层级并行 + latent 派发
跨节点 PP(只传 7KB 激活)+ 节点内 grouped-EP;latent 维 3584 派发 + FP8 通信,all-to-all 载荷减半。
增益 ×1.3
CUDA Graph + kernel 移植
整 decode step 捕图去 launch 开销;FlashKDA / WarpDecode 移植到 sm_120,吃满架构红利。
增益 ×1.2–1.5
调度:连续批处理 + 预算准入
连续批处理拉高并发利用率;按请求类分预算,防长上下文突发饿死短请求、稳住利用率(毛利分母)。
利用率 +15–25pt