vLLM 团队创业公司 Inferact:16 块 TPU v7 跑 Kimi K3,比 GB200 快 57%
据量子位报道,vLLM 原班人马创办的 Inferact 为谷歌 TPU 写了 megakernel 推理内核,配合 DeepSeek 的 DSpark 推测解码,在 16 块 TPU v7 上跑 Kimi K3 达到每秒 709 token,同等条件下 GB200 为 452 token,代码已开源。

据量子位 9 月 26 日报道,推理创业公司 Inferact 公布了一组测试:16 块谷歌 TPU v7 Ironwood 跑 Kimi K3,每秒输出 709 个 token,同等条件下 16 块英伟达 GB200 为 452 个,快 57%。Inferact 由 vLLM 的原班人马创办。
事实部分
- 测试条件:两边都跑 Kimi K3、都用 vLLM 推理引擎,变量只有芯片和底层 kernel 实现。
- 怎么做到的:Inferact 为 TPU 写了一种 megakernel,把推理时要调度的几百个小程序合成一个大程序,把内存带宽利用率推到接近硬件理论峰值;再配合 DeepSeek 提出的 DSpark 推测解码框架,平均接受长度为 6。
- 不开推测解码:batch size 为 1 时,TPU 每秒 249 token,GB200 为 127;batch size 为 8 时分别为 865 和 636。
- 其他模型:4 块 TPU v7 跑 Qwen 3.8 27B 达到每秒 1515 token,同配置 GB200 为 695。
- 精度:Inferact 用 greedy decoding 验证,Kimi K3 在 TPU 上的 GPQA-Diamond(94.4%)和 GSM8K(97.2%)与 GPU 结果一致。相关代码已开源。
编辑判断
这组数字说明,推理速度越来越取决于软件栈,而不只是芯片规格:同一个模型、同一个引擎,换一套 kernel 就差出一半多。
需要保留一点怀疑:这是 Inferact 自己的测试,还没有看到第三方复现。如果你在评估自建推理的硬件选型,可以把它当作 TPU 值得纳入比较的信号,再用自己的模型和负载测一轮。