蚂蚁百灵近日宣布,正式开源其最新研发的 Ling-3.0-tiny-base 与 Ling-3.0-flash-base 两个基础模型。此次开源不仅提供了最终版本的 Base checkpoint,还同步开放了预训练和中期训练阶段的权重数据,总计六个关键 checkpoint,为开发者提供了更全面的研究资源。
据了解,Base 模型作为未经特定任务微调的基础预训练模型,在开发过程中注重平衡性能与资源消耗。此次开源的预训练 checkpoint 已完成大规模训练,但尚未进行中期训练、WSM 合并及后训练;中期训练 checkpoint 则完成了中期优化,但未涉及后续步骤。官方特别说明,WSM 合并 checkpoint 是基于中期训练结果完成特定合并操作后的版本,仍需进一步后训练才能投入实际应用。
技术团队对训练流程进行了创新优化,将传统学习率衰减机制替换为 WSM(Warmup-Stable and Merge)加权合并方法。这种改进消除了固定衰减曲线的限制,使模型更适合持续预训练和动态数据扩展,同时支持训练后离线探索不同学习率调整策略,为模型适配多样化场景提供了技术保障。
在性能表现方面,Ling-3.0-tiny-base 模型总参数达 7.9B,激活参数 1.3B,相比前代模型参数量减少约 50%,但在多数评测指标上实现超越。特别是在代码生成任务中,该模型在与同规模竞品的对比中展现出显著优势。而参数规模更大的 Ling-3.0-flash-base 模型总参数达 124B,激活参数 5.1B,通过稀疏激活设计实现了更高的参数利用率,为复杂场景适配提供了开放基础。
官方强调,这些基础模型尚未完成指令对齐优化,不建议直接用于终端用户服务或安全关键型应用。开发者需根据具体任务需求完成后训练、评估与验证流程,确保模型在特定场景下的可靠性和安全性。目前,两个模型的开源资源已分别在 Hugging Face 和 ModelScope 平台上线,为全球开发者提供研究支持。
评测数据显示,Ling-3.0-flash-base 在代码生成、复杂推理和长文本处理等任务中表现突出。尽管其参数规模仅为某些对比模型的 1/2 至 1/3,但整体性能仍保持领先优势,验证了稀疏激活架构在提升模型效率方面的有效性。这些特性使其成为研究持续训练方法、探索模型扩展性的理想实验平台。