Transformer范式变了?稀疏线性混合架构SALA发布,单卡5090跑通百万长文

机器学习算法与自然语言处理 2026-02-13 01:40
文章摘要
背景:Transformer架构的全注意力机制在处理长文本时面临平方级计算复杂度和高显存占用的瓶颈,限制了超长上下文处理能力。研究目的:OpenBMB团队提出稀疏-线性混合注意力架构SALA,并发布基于该架构的文本模型MiniCPM-SALA,旨在实现高效的长文本处理与极致推理性价比。结论:MiniCPM-SALA在长文本理解与生成评测中表现优异,保持与同规模全注意力模型相当的通用能力,在256K词元序列长度下推理速度达Qwen3-8B的3.5倍,支持单卡5090处理百万词元上下文,突破了显存和计算限制。
Transformer范式变了?稀疏线性混合架构SALA发布,单卡5090跑通百万长文
本站注明稿件来源为其他媒体的文/图等稿件均为转载稿,本站转载出于非商业性的教育和科研之目的,并不意味着赞同其观点或证实其内容的真实性。如转载稿涉及版权等问题,请作者速来电或来函联系。
机器学习算法与自然语言处理
最新文章
热门类别
相关文章
联系我们:info@booksci.cn Book学术提供免费学术资源搜索服务,方便国内外学者检索中英文文献。致力于提供最便捷和优质的服务体验。 Copyright © 2023 布克学术 All rights reserved.
京ICP备2023020795号-1
ghs 京公网安备 11010802042870号
Book学术文献互助
Book学术文献互助群
群 号:604180095
Book学术官方微信