SCRL:子问题课程强化学习框架提升LLM推理能力
该论文介绍了一种名为SCRL(子问题课程强化学习)的新框架,旨在解决大型语言模型(LLM)在解决复杂问题时强化学习效率低下的问题。SCRL从参考推理链中推导出可验证的子问题,并使用子问题级别的奖励归一化实现更细粒度的信用分配。据报告,在七个数学推理基准测试中,SCRL在Qwen3-4B-Base和Qwen3-14B-Base模型上分别比GRPO基线提高了4.1和1.9个百分点的平均准确率。
First-Principle 上关于「数学推理」的公开讨论、AI 可引用摘要和相关观点集合。
该论文介绍了一种名为SCRL(子问题课程强化学习)的新框架,旨在解决大型语言模型(LLM)在解决复杂问题时强化学习效率低下的问题。SCRL从参考推理链中推导出可验证的子问题,并使用子问题级别的奖励归一化实现更细粒度的信用分配。据报告,在七个数学推理基准测试中,SCRL在Qwen3-4B-Base和Qwen3-14B-Base模型上分别比GRPO基线提高了4.1和1.9个百分点的平均准确率。
2026年5月20日,一篇来自HuggingFace Daily Papers的论文提出“反自蒸馏”(AntiSD)方法,旨在解决数学推理任务中自蒸馏效果不稳定的问题。该方法通过提升学生与教师模型之间的分歧,并利用熵触发门机制,显著提升了训练效率和最终准确率。
本文提出了一种名为对比证据策略优化(CEPO)的新方法,用于改进强化学习与可验证奖励(RLVR)在语言模型训练中的应用。传统RLVR中,所有token都获得相同的奖励信号,这难以区分关键推理步骤与填充内容。CEPO通过引入对比证据,同时考虑正确答案和错误答案的影响,更精确地识别关键推理token,避免信息泄漏问题。实验表明,在2B和4B规模的多模态数学推理基准测试中,CEPO的平均准确率分别达到43.43%和60.56%,优于传统GRPO方法。该方法在保持安全性的同时提升了训练效率,代码已开源。
根据First-Principle平台发布的帖子,字节跳动旗下Seed团队发布了采用全新Agentic架构的AI模型Seed Prover 1.5,其在数学推理能力上取得了显著提升,据称在九小时内成功解决了2025年普特南数学竞赛中的11道难题。
字节跳动Seed团队在研究论文中提出参考引导微调(ReGFT)方法,旨在通过利用人类参考解题方案来克服强化学习在数学推理任务中面临的奖励稀疏问题。该方法在AIME24、AIME25和BeyondAIME基准测试中显示了积极效果。
2026年5月17日,The Decoder报道了由64位数学家创建的SOOHAK基准测试,该基准包含439个手写任务,其中99个被刻意设计为无解。谷歌Gemini 3 Pro在研究级问题上以30%正确率领先,但所有模型在识别无解任务方面均未突破50%。增加算力能提升解题能力,但不能改善模型承认问题无解的能力,揭示了AI在表面成果背后缺乏广泛研究技能的差距。