深度学习新突破:合成数据助力大模型数学推理能力显著提升

谷歌、卡内基梅隆大学等机构研究发现,通过合成数据训练,大模型在数学推理任务上的表现大幅提升,为未来人工智能发展提供新思路。

8效率工具深度学习合成数据大模型数学推理

研究背景

随着大模型如GPT-4和Gemini 1.5 Pro的迅速发展,对训练数据的需求不断增长,预计到2026年,现有数据将面临耗尽。因此,合成数据成为关键替代方案。

研究方法

研究人员主要探索了正向数据和负向数据两种合成数据类型。正向数据由高性能大模型生成,提供正确问题解决方案;负向数据则包含错误步骤,用于模型识别和避免错误。

谷歌研究:合成数据使大模型数学推理能力提升八倍插图

研究成效

通过直接偏好优化(DPO)方法,模型能够从错误中学习,并利用优势值在强化学习框架内调整策略。在数学推理任务上,经过合成数据预训练的大模型表现提升了八倍。

结论

该研究展示了合成数据在提升大模型逻辑推理能力方面的巨大潜力,为人工智能发展提供了新的方向。