欢迎来车东西
登录
免费注册
我的订阅
关注我们
智东西
车东西
芯东西
智猩猩
谷歌发RNN新架构 同等规模强于Mamba
2024-03-04
arxiv
6
智东西3月4日报道,3月1日,谷歌研究者提出了RG-LRU层,它是一种新颖的门控线性循环层,并围绕它设计了一个新的循环块来取代多查询注意力(MQA)。他们使用该循环块构建了两个新的模型,一个是混合了MLP和循环块的模型Hawk,另一个是混合了MLP与循环块、局部注意力的模型Griffin。针对一系列模型规模、在300B tokens上对Hawk和Griffin的过度训练,Hawk-3B在下游任务的性能上超越了Mamba-3B,但训练的tokens数量只有后者的一半。Griffin-7B和Griffin-14B的性能与Llama-2相当,但训练的tokens数量只有后者的1/7。
论文链接:https://arxiv.org/pdf/2402.19427.pdf
谷歌