智东西9月27日消息,据新智元报道,近期,来自加州大学伯克利分校、斯坦福大学、加州大学圣迭戈分校的研究人员基于操作系统中经典的虚拟内存和分页技术,提出了一个新的注意力算法PagedAttention,并打造了一个LLM服务系统vLLM。据介绍,vLLM在KV缓存上实现了几乎零浪费,并且可以在“请求内部”和“请求之间”灵活共享KV高速缓存,进一步减少了内存的使用量。评估结果表明,vLLM可以将常用的LLM吞吐量提高了2-4倍,在延迟水平上与最先进的系统(如FasterTransformer和Orca)相当,并且在更长序列、更大模型和更复杂的解码算法时,提升更明显。
论文链接:
https://arxiv.org/pdf/2309.06180.pdf
开源链接:
https://github.com/vllm-project/vllm




10


