Thinking Machines Lab近日宣布推出新一代人工智能模型Inkling-Small,该模型在保持核心性能的同时将参数规模缩减至原模型的四分之一。作为Inkling系列的轻量化版本,新模型延续了混合专家(MoE)架构设计,总参数从9750亿降至2760亿,激活参数由410亿压缩至120亿,在保持100万token最长上下文窗口的基础上,显著降低了计算资源需求。
研发团队透露,Inkling-Small在NVIDIA GB300 NVL72系统上完成训练,支持多模态原生推理能力,可同时处理文本、音频和图像输入。与前代模型相比,新版本在智能体工具使用、复杂推理和指令遵循等关键指标上展现出更高效率,特别是在Humanity’s Last Exam基准测试中取得31.6%的得分,较原模型29.7%的成绩提升近2个百分点。
技术白皮书显示,该模型通过优化专家模块分配机制,在保持100万token上下文容量的前提下,将推理阶段的计算密度降低60%。在相同硬件条件下,Inkling-Small的响应速度较前代提升35%,尤其在需要多步推理的复杂任务中表现出更稳定的性能曲线。测试数据显示,在每个思考预算层级上,新模型的计算效率均优于原版架构。
开放策略方面,Thinking Machines Lab同步释放了完整模型权重,并将其集成至Tinker微调服务平台。开发者可通过Tinker Playground直接体验文本对话、图像生成和音频交互功能,无需自行搭建训练环境。这种全栈式开放模式,为中小研发团队提供了接触前沿AI技术的便捷通道。
行业分析师指出,Inkling-Small的推出标志着大模型进入"精效化"发展阶段。通过架构创新实现性能与效率的平衡,这种技术路径可能引发新一轮模型优化竞赛。特别是在边缘计算和实时交互场景中,轻量化模型将展现出更大的应用潜力,有望推动AI技术向更广泛的产业领域渗透。