ITBEAR科技资讯
网站首页 科技资讯 财经资讯 分享好友

英伟达新突破:ZPPO方法助力AI小模型高效学习,效果显著提升

时间:2026-06-20 01:19:38来源:互联网编辑:快讯

在人工智能领域,如何让算力有限的小模型获得接近大模型的能力,一直是困扰研究者的难题。英伟达研究团队近期提出的新方法ZPPO(近端发展区策略优化),为这一难题提供了突破性解决方案。该研究在0.8B参数的小模型上,将视觉语言理解能力提升了9.3个百分点,并在31个基准测试中全面超越现有方法,相关论文已通过arXiv编号2606.18216公开。

当前小模型训练主要依赖两种方法:知识蒸馏和强化学习。知识蒸馏要求小模型完全模仿大模型的输出概率分布,但小模型有限的“脑容量”难以吸收如此复杂的信息,导致在遇到新问题时表现甚至不如未训练的模型。强化学习则通过奖励机制让模型自主探索,但会系统性地忽略那些小模型反复失败的题目,即使加入大模型答案作为“作弊”手段,也会引发策略漂移问题。这两种方法都未能有效解决小模型的学习困境。

研究团队从苏联心理学家维果茨基的“近端发展区”理论中获得灵感,提出将大模型的指导嵌入题目背景而非答案中的创新思路。在ZPPO框架下,大模型不再直接提供答案,而是将其推理过程转化为题目中的辅助信息。小模型需要独立分析这些信息并生成自己的答案,训练过程中仅使用小模型自身的输出计算梯度,确保学习过程真正反映模型自身能力的提升。

针对小模型反复失败的难题,研究团队设计了两种题目改造策略。二元候选问题(BCQ)将大模型的正确推理和小模型的错误推理匿名化后作为候选选项,要求模型判断哪个更合理并给出答案。负面候选问题(NCQ)则收集小模型的所有错误尝试,明确告知这些答案全错,引导模型分析错误模式后重新作答。这两种策略通过不同的方式让小模型直面自身弱点,在保持挑战性的同时提供可学习的改进方向。

为确保困难题目得到充分练习,研究团队引入了提示词回放缓冲区机制。该机制自动存储小模型正确率低于50%的题目,在后续训练中反复呈现这些题目,但每次都会生成新的BCQ或NCQ版本。这种动态调整方式既避免了模型对固定题目的机械记忆,又通过持续提供新的学习信号促进能力提升。实验数据显示,单独使用回放缓冲区或题目改造策略效果有限,但两者结合可产生超加性效应。

在训练参数优化方面,研究团队发现将每批数据的梯度更新次数从传统的16次调整为4次,可有效避免模型参数偏离当前状态。同时,通过排除零优势组计算批次优势归一化统计量,防止了非零优势分被人为放大,显著提升了训练稳定性。这些看似微小的调整对最终性能产生了重要影响。

实验在Qwen3.5系列的四个规模模型上展开,以270亿参数的Qwen3.5作为教师模型。结果显示,ZPPO对小模型的提升效果尤为显著:0.8B模型在视觉语言测试中提升9.3个百分点,2B模型提升5.2个百分点,而9B模型仅提升2.8个百分点。这种规模依赖性提升印证了研究假设——模型越小,与大模型的能力差距越大,ZPPO提供的学习信号就越丰富。

在纯语言和视频理解等未训练任务上,ZPPO同样表现出色,而知识蒸馏方法在这些测试中反而导致模型性能下降。这表明ZPPO的训练过程不仅提升了模型在特定任务上的表现,还促进了能力的泛化迁移。对于初始正确率为零的最难题目,ZPPO能使28%的题目最终达到毕业标准,远超对比方法的4%。

通过详细审计模型在BCQ和NCQ任务中的表现,研究团队验证了学习过程的有效性。在BCQ任务中,模型答案与正确候选的匹配率在答对样本中为78%-91%,在答错样本中为77%-97%,证明模型确实在进行判断而非机械复制。NCQ任务的审计则显示,0.8B模型有82.7%的推理重复了已知错误答案,但随着模型规模增大,这一比例迅速下降,解释了NCQ对大模型更有效的原因。

尽管ZPPO在多个方面取得突破,但研究团队也指出其局限性:当教师模型无法解答某些题目时,BCQ策略将失去效用。如何让小模型的学习能力超越教师模型的覆盖范围,成为该研究留下的重要开放问题。对于希望深入了解技术细节的读者,原始论文提供了完整的算法伪代码、所有基准测试的详细数据及消融实验结果。

更多热门内容
雄安新区智慧城市科创中心揭牌 绘就未来城市数智化发展新蓝图
其中,“创新之城”以红色通信初心为主线,串联起1G至6G的通信技术发展历程;“魅力之城”集中呈现了中国移动在智算、低空经济、智慧城市等领域的全栈创新成果,可远程演示雄安低空应用公共服务平台,一键调度无人机起飞…

2026-08-11

北京石景山:人形机器人“学艺”正忙 十大场景练就全栈服务本领
8月10日,位于北京市石景山区的人形机器人数据训练中心内,上百台机器人正在训练师的带领下学习人类的生产生活技能。中新社记者 贾天勇摄中新社记者 贾天勇 摄图为一组机器人正在练习家庭康养应用场景技能。中新社…

2026-08-11

第二届世界人形机器人运动会将启,灵巧手专项赛机器人“精细活”练得如何?
我们参加了灵巧手专项的积木搭建的比赛,要在一个限定的时间和场地之内搭积木,一共要搭5层,按照比赛规则,最后能够立住5秒就有效。”这项比赛考核的是机器人和灵巧手的配合,包括它的精细操作的能力,对于以后走进家庭去…

2026-08-11

从网络热梗到硬科技落地:中国飞行机器人正突破天际,开启低空新未来
市场端也在同步响应,随着低空开放的步伐加快,植保、巡检、救援、物流等多个领域对具备自主作业能力的智能飞行设备的需求正在快速爆发,单纯依靠人工遥控的传统无人机已经难以满足复杂场景下的高效作业需求,这也让区分清…

2026-08-11

展厅讲解机器人进化论:从标准化服务到“千馆千面”智慧中枢的破局之路
猎户星空提供了超过370个API接口,覆盖了导航、感知、交互、系统状态等各个方面,开发者可以在Android Studio环境中使用Java/Kotlin语言进行深度定制,打造符合自身品牌调性的UI界面和交互…

2026-08-11

模量科技获数千万元Pre-A轮融资,以“视触觉+压阻”方案赋能机器人触觉感知
模量科技成立于2024年底,是一家致力于构建触觉基础设施的公司,具备触觉感知模组、触觉数据采集和触觉模型全链路研发能力,聚焦人形机器人/灵巧手、工业智能制造两大赛道。 在实际应用中,不同区域的机器人手部结构对…

2026-08-11

2026数博会倒计时!25台“贵阳造”无人接驳车带你驶向科幻未来
2026中国国际大数据产业博览会开幕在即,作为贵州本土硬核自动驾驶代表企业,贵州翰凯斯智能技术有限公司将在本届盛会上带来规模空前、体验感拉满的无人驾驶接驳车矩阵:25台无方向盘、无踏板的全自动驾驶接驳车组成…

2026-08-11

橡木果机器人发布全球首个触觉感知具身本能模型 获招商局创投等天使轮投资
姜峣进一步介绍,橡木果此次发布的模型不依赖任何数据预训练,是行业首个以触觉感知为核心、复刻人类操作机理的通用操作基座模型,其能够实现零样本泛化与毫秒级的自适应操作,从根本上解决了当前行业面临的“数据稀缺、场…

2026-08-11

智源AREX:让AI智能体告别“搜索即答案” 开启自主研究新范式
AREX的目标,不是让模型在单轮回答中写出一个「看起来更完整」的答案,而是训练一种能长期运行、持续验证、递归修正的自主研究智能体——不是一次性给出答案,而是在「研究→验证→再研究」的循环中不断接近完整解,让…

2026-08-11

2026男士智能手表选购指南:从需求出发,三款热门腕表深度对比助你决策
如果你注重品牌、追求高性价比和丰富多样化的智能功能,高拓展性、独立 4G联网、大内存,可以摆脱手机实现通话、微信、影音娱乐,想要兼顾不错的性价比,那么览邦Watch Ultra可能更适合你;览邦语音助手,…

2026-08-11