ITBEAR科技资讯
网站首页 科技资讯 财经资讯 分享好友

阿里通义千问Qwen3.8-Flash发布:125B参数多模态MoE模型,成本降低性能跃升

时间:2026-08-26 23:36:29来源:快讯编辑:快讯

阿里通义千问团队近日推出了一款名为Qwen3.8-Flash的多模态混合专家(MoE)模型,该模型基于下一代Qwen4架构构建,旨在为开发者提供提前体验新架构特性的技术预览平台。模型主架构包含1250亿参数,同时配备510亿参数的N-gram嵌入模块,实际运算时每token仅激活60亿参数,在保证性能的同时显著降低了计算资源消耗。

技术团队在四大核心模块进行了突破性改进。注意力机制采用GDN+QSA混合架构,其中门控增量网络(GDN)通过动态压缩历史信息提升处理效率,稀疏注意力模块(QSA)则通过微块级索引筛选关键上下文。在超长序列处理测试中,该架构使预填充和解码阶段的注意力计算速度分别提升7.6倍和4.9倍。残差连接模块引入四分支门控机制,配合FP8量化存储技术,将显存占用降低40%以上。

嵌入层创新采用510亿参数的N-gram查表系统,通过局部上下文匹配扩展模型容量。该模块支持异步预取技术,可将参数动态卸载至主机内存,避免长期占用GPU显存。优化器方面采用Muon优化算法,针对参数正交性、分工策略和矩阵分解进行专项优化,并重新拟合了符合新架构特性的扩展定律。

性能测试显示,在60亿激活参数条件下,Qwen3.8-Flash-Next-Base在14个基准测试中8项夺冠,涵盖编程能力(SWEBench-Pretrain)、数学推理(MGSM)、多模态理解(MMMU)等专业领域。相较于前代Qwen3.7-Plus,新模型训练成本降低至1/9,却在代码生成和办公自动化场景展现出更强的处理能力。

该模型将于千问AI平台开放API服务,定价体系为输入每百万token1元、输出3元。模型权重已在北京时间23:00同步开源至Hugging Face和ModelScope平台,提供标准版和FP8量化版两种选择。旗舰版本Qwen3.8-Flash-Next默认支持100万token上下文窗口,并集成官方开发工具包,方便开发者进行二次开发。

更多热门内容
小米18 Pro或9月23日发布 全球首发骁龙8超级至尊版 与华为Mate 90同档竞技
考虑到高通骁龙峰会将于9月22日(夏威夷时间)举行, 小米18 Pro系列的发布会很可能安排在9月23日。 据悉,小米18 Pro系列将首发搭载高通第六代骁龙8超级至尊版平台,这颗芯片的CPU主频首次突破5…

2026-08-26

谷歌Pixel 11系列:Pro版升级有限,标准版性价比凸显成更优解
在软件体验方面,谷歌Pixel 11系列均支持Gemini Intelligence、Magic Capture、CreatorSuite以及Circle to Search等AI功能,标准版虽然缺少Pro…

2026-08-26

新机功能“专属化”:定制硬件创新下,老旗舰性价比何去何从?
这很自然地就会引发一个现象,那就是高端机、特别是老款旗舰机型的“性能过剩”。 那么问题就来了,类似谷歌Pixel 11系列这样将新功能与硬件创新绑定,让老设备、老用户除了换机之外,没有任何办法可以用到新功能…

2026-08-26

OpenAI自研Jalapeño芯片首秀:性能超越顶尖推理处理器 引领AI算力新突破
延伸阅读 Jalapeño 是 OpenAI 首款自研 AI 推理芯片,由 OpenAI 与博通(Broadcom)合作开发,台积电采用3nm 制程代工制造,于 2026 年 6 月 24 日首次对外展…

2026-08-26