革命Transformer,普林斯顿提出全新框架Mamba,推理速度飙升5倍

Jim Fan转发:与传统的注意力机制相比,Mamba具有线性时间扩展、超长上下文和5倍更高推理吞吐量。在语言建模等多个领域,Mamba-3B模型不仅在与同等大小的Transformer相比中表现卓越,而且在预训练和下游评估中,更胜于两倍大小的Transformer。这一突破性的SSM架构标志着对深度学习基础模型的重要进展,为处理长序列数据提供了更高效、更灵活的解决方案。

https://arxiv.org/abs/2312.00752