跳到正文
原文
Prime Intellect(网页)·· 13 小时前AI 评分62

Prime Intellect 研究 reward hacking 的梯度动力学机制并推出 Prime Sprints

ResearchMAY 20TH, 2026Systematic Reward Hacking and Prime Sprints

AI 导读

Prime Intellect 发布系统化 reward hacking 研究,提出其本质是梯度动力学问题而非单纯的规格问题:在 Llama 3.2-1B-Instruct 上用 backdoor-ifeval 环境植入隐藏关键词奖励。

来源:Prime Intellect(网页) · primeintellect.ai