Baseten 工程师实测:LLM 生成的推理引擎比 vLLM 快最多 90%
Baseten 工程师参考 MetaInfer 论文,让 Claude Code(Fable 5)为 Qwen-3.6-35B-A3B(NVFP4,单张 B200)自动构建推理引擎 VibeQwen,单流解码比 vLLM 0.25.1 快 90%,首 token 从 28ms 降至 12ms,并发 32 时吞吐高 71%。
推荐理由:作者亲测用智能体生成定制推理引擎,给出了相对 vLLM 的具体性能数据和成本,可帮助读者评估自动优化的实际可行性。