跳到正文
原文
PyTorch:Blog(RSS)· PyTorch:Blog(RSS)·· 14 天前精选AI 评分60

vLLM 引入硬件无关层以兼容 torch.compile 与 OOT 加速器

AI 导读

vLLM 为追求前沿性能正转向硬件专用的 flat 模型定义,与 fullgraph torch.compile 不兼容,影响 OOT 加速器、旧 GPU 和较冷门模型的支持。

推荐理由

vLLM 团队解释内部架构转向与硬件无关层的设计原则,并给出 H100 上 3.4% 吞吐差距的实测数据,对部署可移植性有参考。

来源:PyTorch:Blog(RSS) · pytorch.org