ITBEAR科技资讯
网站首页 科技资讯 财经资讯 分享好友

智谱开源GLM-5.3-Flash多模态模型:性能超越前代,国产芯片助力高效推理

时间:2026-08-27 01:49:54来源:互联网编辑:快讯

智谱今日宣布推出并开源GLM-5.3-Flash(320B-A18B),这是GLM-5系列首个原生多模态模型,总参数量达320亿,激活参数量仅18亿,层数从92层缩减至45层。该模型在AA综合智能指数中取得57分,与Anthropic旗下Claude Opus 4.8持平,但定价仅为后者的1/40,限时折扣期间更降至1/20,标志着前沿智能技术首次实现“平民化”应用。

在性能测试中,GLM-5.3-Flash全面超越参数量翻倍的GLM-5.2,其编程能力在自研Z.ai Code Bench评估中与Claude Opus 4.8相当。这一突破得益于全新混合架构设计:模型采用稀疏注意力与线性注意力结合的方式,通过递归机制捕获局部依赖关系,并借助轻量级索引器召回全局上下文。为进一步优化长文本处理效率,团队引入IndexPool技术,将索引器缓存向量从4个压缩至1个,使1M上下文场景下的时延与内存开销显著降低。

对比实验显示,GLM-5.3-Flash的注意力计算量较GLM-5.3降低3.01倍,KV缓存大小减少4.44倍,单Token计算效率在所有基线模型中位居首位。尽管KV缓存仍略高于Kimi-K3和DeepSeek-V4-Flash,但团队已将其列为后续优化重点。模型通过流形约束超连接(mHC)技术提升Scaling能力,结合30T Token多模态预训练语料,实现了计算资源与性能的平衡。

值得关注的是,GLM-5.3-Flash的推理服务完全基于国产芯片集群构建。为克服单芯片算力与内存容量限制,团队在SGLang框架上开发专用推理引擎,通过节点内张量并行、ReplaySSM、W8A8量化等技术,结合生产级EPD分离式架构,将编码、预填充和解码拆分为独立工作池。经优化后,端到端服务性能较初始基线提升3倍,单Token成本与主流英伟达GPU持平,验证了国产硬件在大规模场景下的可行性。

该模型已正式开源,并接入ZCode等编码平台。通过GLM Coding Plan,用户可每日领取10,000张体验卡,同步开放的API调用服务将进一步推动技术普惠。此次发布不仅展示了低成本架构的创新潜力,也为国产芯片生态建设提供了重要实践案例。

更多热门内容
BOSS直聘如何打造高利润模式?以“直聊+推荐”构建企业求职双赢“收费站”
BOSS直聘99.4%的营收来自企业客户的线上招聘服务,求职者端增值服务半年只有2563万元,还在主动收缩。 利润暴增151%是一个含了投资收益的账目数字,但即便只看经调整口径,18.85亿利润对应44.6…

2026-08-26

2026前端生态大变革:5大升级2大开源涌现,零代码黑马如何突围?
与VBA、Access、AI coding不同,云表解决的代码编写的工具问题,聚焦于企业数据严谨治理的工程架构问题。 无需一行代码,即可在前端通过画表格、零代码实现树形明细与复杂的事件响应,同时在后端自动构…

2026-08-26