Import AI· Jack Clark·· 2026-06-08AI 评分46
Import AI 460:社会可被奖励黑客攻击、Anthropic 的 RSI 数据与 RL 四旋翼竞速
Import AI 460: Reward hacking society, RSI data from Anthropic; and RL-based quadcopter racing
AI 导读
伦敦国王学院、复旦大学与 Alan Turing Institute 构建了 SocioHack 基准,用 72 个沙盒社会环境测试 AI 的“社会性黑客”行为,RL 训练的 LLM 能以 61.25% 召回率和 90.85% 精确率重新发现历史上已被修补的规则漏洞。
来源:Import AI · importai.substack.com