ITBEAR科技资讯
网站首页 科技资讯 财经资讯 分享好友

DeepSeek发布NSA技术,硬件对齐稀疏注意力加速推理降成本

时间:2025-02-18 18:16:05来源:ITBEAR编辑:快讯团队

DeepSeek公司近期宣布了一项技术创新,正式推出了名为NSA(Native Sparse Attention)的新型稀疏注意力机制。这一机制专为超快速长上下文训练与推理设计,实现了硬件对齐与原生可训练性。

NSA的核心组成部分别具一格,涵盖了动态分层稀疏策略、粗粒度token压缩以及细粒度token选择。这些组件的协同作用,使得NSA在提升性能的同时,也优化了现代硬件设计。

据DeepSeek官方介绍,NSA机制不仅能够加速推理过程,显著降低预训练成本,而且在性能上并未做出妥协。在通用基准测试、长上下文任务以及基于指令的推理场景中,NSA的表现与全注意力模型相比,要么相当,要么更胜一筹。

这一创新技术的推出,对于深度学习领域而言无疑是一个重大突破。通过优化硬件设计与训练效率,NSA为大规模语言模型的应用开辟了新路径,使得长上下文处理和快速推理成为可能。

DeepSeek还提供了关于NSA机制的详细论文链接,供相关领域的研究人员和开发者深入了解和探索。

更多热门内容
美团官宣:2025年二季度起,全职及稳定兼职骑手将享社保福利
美团表示,2022年7月以来,美团率启动新就业形态人员职业伤害保障试点,已出资14亿为7个试点省市的全量骑手缴纳职业伤害保费,未来将进一步覆盖所有省市所有骑手。 去年以来,美团就骑手缴纳养老保险等社保方案做…

2025-02-19