Berkeley RDI:Blog(AI 安全与评测)·· 13 小时前AI 评分51
Berkeley RDI 提出 DELTA 与 RL Grokking Recipe:RL 可让 LLM 解出此前完全不会的任务
RL Grokking Recipe: How Can We Enable LLMs to Solve Previously Unsolvable Tasks with RL? October 02, 2025
AI 导读
UC Berkeley 等机构发布论文(arXiv:2509.21016),提出合成编程任务套件 DELTA 与两阶段奖励策略,证明 RL 可以让基础模型在 pass@128=0 的任务上出现 grokking 式相变,准确率跳升至约 100%。方法先用逐测试密集奖励脱离全零区,再切换二值全通过奖励巩固策略;迁移实验显示学会的技能可组合外推,但在需要新不变量的变换性变化上较弱。
来源:Berkeley RDI:Blog(AI 安全与评测) · rdi.berkeley.edu