上海人工智能实验室(以下简称“上海AI实验室”)近日宣布,其书生团队将在大模型研发领域推行一项全新的开源模式,不仅开放最终模型参数,更将研发过程中的关键环节全面公开,推动大模型预训练从“结果开源”迈向“过程开放”。这一举措旨在打破传统研发中的“黑箱”状态,为全球AI科研社区提供可追溯、可复用的创新经验。
当前,大语言模型(LLM)架构的演进速度极快,但外界往往难以了解哪些创新真正有效、哪些尝试最终被放弃,以及决策背后的具体依据。科技巨头凭借算力优势主导前沿研发,而学术界受限于论文发表周期,难以跟上产业迭代节奏。这导致AI领域的技术细节与经验更多依赖私下交流或“小道消息”传播,缺乏公开、规范的验证平台。尤其在基础模型架构创新中,设计背后的探索过程——如方案验证、取舍逻辑及实际效果——很少被完整披露,阻碍了技术的透明发展。
为解决这一问题,上海AI实验室书生团队提出“全开放”模式,逐步公开预训练全流程的实验记录、架构取舍逻辑及验证结果。具体包括:开放模型全量Checkpoints与完整训练日志,还原模型从零到一的成长轨迹;公开内部迭代中所有单点架构创新的尝试过程与结论;披露架构选型与取舍的实验数据及依据;提供社区提案在统一流程下的完整验证结果,涵盖预训练、指令微调及强化学习等环节。团队强调,真正的开放不仅是共享成果,更是共享探索的每一步脚印。
作为这一模式的核心载体,配套开源可视化平台ArchSpace正式上线。该平台以经典Decoder-only Transformer为起点,全面展示后续单点架构创新及迭代过程。例如,针对新的Attention方案,用户可追溯其从小规模实验到主流模型尺寸(如1B、3B、8B)的放大过程,查看每阶段实验数据、对比结果及关键指标,并了解最终是否纳入研发主线的决策原因。所有创新点均实现“有据可查、失败可回溯”,为行业提供透明化的技术参考。
ArchSpace平台采用社区驱动的创新机制。科研人员可在GitHub仓库提交架构创新提案,经由学术界与工业界专家组成的委员会审阅后,进入分阶段验证流程。验证过程严格对齐开源基模Olmo 3的训练标准,覆盖预训练、长上下文继续训练及指令微调,训练规模达6.2T tokens。训练与评测日志通过Weights & Biases平台实时公开,确保结果可复现、可引用。目前,委员会成员包括上海交通大学、复旦大学等高校学者及上海AI实验室青年研究员,未来将持续吸纳更多专家参与。
在提案遴选标准上,委员会重点考察创新价值、技术可行性及实验设计完备性。通过审阅的提案将获得实验室提供的双聘、实习生等合作机会,加速技术落地。目前,平台已汇聚“下一个概念预测”(NCP)、深度注意力模型(Depth-Attention)等十余项架构创新提案,正在接受统一验证。这些提案涉及层间Attention、隐空间模型、长上下文稀疏Attention等多个方向,旨在探索更高效、更强大的模型架构。
尽管当前验证规模聚焦于1B/3B/8B参数量级的轻量级模型,但上海AI实验室表示,此举标志着大模型时代科研组织范式的革新尝试。通过将技术细节从“黑箱”转向“完全开放”,将创新效果评估从“小道消息”转向“公开可追溯”,实验室希望推动每一次实验的成功与失败均成为社区可复用的知识资产。这一模式不仅为基模架构创新提供了深度试炼场,更向全球AI科研社区递出了一份开放协作的邀请函。

