
深度学习新突破:合成数据助力大模型数学推理能力显著提升
谷歌、卡内基梅隆大学等机构研究发现,通过合成数据训练,大模型在数学推理任务上的表现大幅提升,为未来人工智能发展提供新思路。
研究背景
随着大模型如GPT-4和Gemini 1.5 Pro的迅速发展,对训练数据的需求不断增长,预计到2026年,现有数据将面临耗尽。因此,合成数据成为关键替代方案。
研究方法
研究人员主要探索了正向数据和负向数据两种合成数据类型。正向数据由高性能大模型生成,提供正确问题解决方案;负向数据则包含错误步骤,用于模型识别和避免错误。

研究成效
通过直接偏好优化(DPO)方法,模型能够从错误中学习,并利用优势值在强化学习框架内调整策略。在数学推理任务上,经过合成数据预训练的大模型表现提升了八倍。
结论
该研究展示了合成数据在提升大模型逻辑推理能力方面的巨大潜力,为人工智能发展提供了新的方向。