Thinking Machines Lab 正式推出全新开源人工智能模型 Inkling-Small,该模型在保持与前代产品 Inkling 相近性能的同时,将整体规模缩减至约四分之一。这款轻量化模型采用混合专家(MoE)架构,总参数为2760亿,激活参数120亿,在NVIDIA GB300 NVL72系统上完成训练,展现出更高的计算效率。
作为"美国最强开源AI模型"的轻量化版本,Inkling-Small继承了原版的多模态处理能力,支持音频、图像的原生推理,并保持100万token的最大上下文窗口。在智能体工具使用、推理任务和指令遵循等关键测试中,新模型展现出显著优势:在Humanity’s Last Exam基准测试中取得31.6%的得分,较原版29.7%的成绩提升近2个百分点。研发团队特别强调,该模型在相同计算预算下,测试时计算曲线始终高于前代产品。
技术文档显示,Inkling-Small通过优化专家模块分配机制,在保持多领域均衡表现的同时,将推理效率提升30%以上。在多类基准测试中,该模型不仅与同等参数规模的竞品不相上下,更在复杂推理任务中超越部分更大规模的模型。其可变思考强度设计允许用户根据任务需求动态调整计算资源分配,这种灵活性使其在实时交互场景中表现尤为突出。
目前,Thinking Machines已开放Inkling-Small的完整模型权重,并将其集成至Tinker微调服务平台。开发者可通过Tinker Playground体验文本、图像、音频的多模态交互功能,该平台特别优化了低延迟场景下的响应速度。研究团队透露,后续将发布关于模型压缩技术的详细论文,重点解析如何在保持性能的前提下实现参数规模的有效缩减。