ITBEAR科技资讯
网站首页 科技资讯 财经资讯 分享好友

蚂蚁百灵Ling-3.0-Flash发布:小体量高智能,为AI Agent运行提速稳航

时间:2026-07-27 23:08:32来源:互联网编辑:快讯

蚂蚁百灵近日推出新一代原生混合推理模型Ling-3.0-Flash,该模型以1240亿参数总量和51亿单次计算激活量,在基础推理、指令遵循及长文本处理等核心能力上达到甚至超越了参数规模2至3倍的行业领先模型。通过架构创新与工程优化,这款模型在保持轻量化特征的同时,实现了智能密度与落地效率的双重突破,目前已上线OpenRouter平台并开启限时免费体验,后续将面向开发者开源。

针对AI Agent实际应用中的复杂场景,研发团队构建了超万个真实交互训练环境,重点优化了任务拆解、自我纠错和长程规划能力。在代码生成、跨领域信息整合等场景测试中,该模型展现出更强的自主闭环能力,有效解决了传统模型在处理长链条任务时容易偏离目标或中断的问题。这种能力提升源于底层计算架构的革新,模型采用混合注意力机制,以5:1的比例交替部署KDA线性注意力层与MLA层,在长上下文处理效率与模型性能间取得平衡。

技术团队对注意力机制进行深度改造,将上一代的Lightning Attention升级为KDA架构,通过引入细粒度对角门控技术,使模型在处理长文档和代码库时能更精准地捕捉关键信息。同时,专家激活比例从前代的1/32压缩至1/64,在保持模型性能的前提下显著降低计算资源消耗。这种设计使模型在相同算力条件下可处理更复杂的任务,或在相同任务下减少硬件投入。

为支撑高频线上服务需求,百灵配套开发了集群级分级缓存系统,通过避免长对话中的重复计算,将首字响应延迟降低60%-80%。在任务稳定性方面,升级后的多智能体协同架构支持不同模型分工协作与相互校验,有效降低单一模型误判风险。这种软硬件协同优化策略,为模型在金融、医疗等对稳定性要求极高的领域落地提供了技术保障。

更多热门内容