ITBEAR科技资讯
网站首页 科技资讯 财经资讯 分享好友

合成数据助力,谷歌等大模型数学推理能力突飞猛进!

时间:2025-04-07 10:01:20来源:ITBEAR编辑:快讯团队

近期,一项关于合成数据在大型模型训练中应用的新研究成果引起了业界的广泛关注。这项研究由谷歌、卡内基梅隆大学和MultiOn的联合研究团队共同完成。

据Epoch AI的研究报告显示,尽管全球范围内已有约300万亿个高质量的文本训练标记可供使用,但随着ChatGPT等大模型的快速发展,对训练数据的需求正呈爆炸式增长。预测显示,到2026年,现有的高质量训练数据或将无法满足需求。因此,探索合成数据作为替代方案显得尤为重要。

在此次研究中,研究人员主要聚焦于两种类型的合成数据:正向数据和负向数据。正向数据由高性能大模型(例如GPT-4和Gemini 1.5 Pro)生成,提供正确的数学问题解决方案,为模型提供学习范例。然而,单纯依赖正向数据存在局限性,可能导致模型仅通过模式匹配学习,缺乏真正的理解能力,且在处理新问题时泛化能力下降。

为了克服这些挑战,研究人员引入了负向数据,即经过验证的错误问题解决步骤。负向数据的加入有助于模型识别并避免错误,从而提升其逻辑推理能力。尽管使用负向数据面临诸多困难,如错误步骤可能包含误导性信息,但研究团队通过直接偏好优化(DPO)方法成功使模型能够从错误中学习。

DPO方法为每个问题解决步骤分配一个优势值,反映其相对于理想解决方案的价值。研究表明,高优势步骤是正确解决方案的关键,而低优势步骤则可能揭示模型推理中的问题。借助这些优势值,模型能够在强化学习框架内动态调整策略,更高效地从合成数据中学习和改进。

为了验证合成数据的有效性,研究团队选择了DeepSeek-Math-7B和LLaMa2-7B等模型,在GSM8K和MATH数据集上进行了全面测试。测试结果显示,经过正向和负向合成数据预训练的大模型在数学推理任务上的性能实现了显著提升,甚至达到了八倍的增长。这一研究成果充分展示了合成数据在增强大模型逻辑推理能力方面的巨大潜力和实际应用价值。

更多热门内容
数智人力新基建:实时人才市场薪酬数据重构企业用人战略
在数字化转型浪潮中,人力资源部门正从传统的事务处理中心向战略决策中心进化。市场人才数据、薪酬数据和招聘数据构成的黄金三角,正在重构企业人才管理的底层逻辑。本文将从人力成本控制、定岗定薪优化、竞品趋势监测三大维度,揭示数据驱动型HR管理的战略价值。一、市

2025-04-07

Meta新推Llama 4 AI模型,首秀“混合专家”架构引领技术潮流
当地时间4月5日,Meta公司推出其AI模型Llama 4。Meta表示,Llama 4是一个多模态大模型,它能够处理和整合各种类型的数据,包括文本、视频、图像和音频,并且可以在这些格式之间转换内容。 Ll…

2025-04-07

创投秘籍:投资人眼中决定成败的九大要素
一家共享出行企业在发展过程中,通过研究对标公司的市场拓展策略,发现其在进入新城市时,采用了与当地政府合作、提供优惠政策吸引用户等方式,快速打开了市场。在BP中,创业者要清晰阐述自身与对标公司的差距及优势,展示…

2025-04-07