智东西10月18日消息,据量子位报道,上周,FlashAttention团队提出一种Transformer架构大模型推理加速的新方法Flash-Decoding,最高可提速8倍。该方法尤其造福于长上下文LLM,在64k长度的CodeLlama-34B上通过了验证,并得到了PyTorch官方认可。据介绍,这个新方法在FlashAttention的基础之上衍生而出,主要思想是用并行操作尽快加载Key和Value缓存,分别重新缩放再合并结果,最终获得推理速度上的大幅提升。
目前作者团队还未发表Flash-Decoding论文,但据透露,此次论文的一作仍是Tri Dao。Tri Dao今年博士毕业于斯坦福,7月份加盟大模型创业公司Together AI担任首席科学家,明年9月将上任普林斯顿大学助理教授,他是FlashAttention v1和v2的主要作者。其他三位作者分别是Daniel Haziza,Facebook AI Research研究工程师,主要负责xformers(用于训练加速的开源框架);Francisco Massa,同Facebook AI Research研究工程师, 主要从事PyTorch相关工作;Grigory Sizov,Meta机器学习工程师,主要工作是优化GPU上的LLM推理和其他AI工作负载,为PyTorch生态做出过贡献。
官方博客:
https://princeton-nlp.github.io/flash-decoding/




14


