PyTorch:Blog(RSS)· PyTorch:Blog(RSS)·· 14 天前精选AI 评分60
vLLM 引入硬件无关层以兼容 torch.compile 与 OOT 加速器
AI 导读
vLLM 为追求前沿性能正转向硬件专用的 flat 模型定义,与 fullgraph torch.compile 不兼容,影响 OOT 加速器、旧 GPU 和较冷门模型的支持。
推荐理由
vLLM 团队解释内部架构转向与硬件无关层的设计原则,并给出 H100 上 3.4% 吞吐差距的实测数据,对部署可移植性有参考。
来源:PyTorch:Blog(RSS) · pytorch.org