TRACE 语料研究:历史难预测压缩损害
热点事件持续更新
TRACE 语料研究:历史难预测压缩损害
1 篇报道1 个报道来源6 小时前更新
先了解这件事
AI 综述
Egor Pakhomov 与 Erik Nijkamp 提交的研究论文,检验智能体近期行为能否预测上下文压缩带来的损害,结论是预测能力很弱。研究基于 TRACE 公开语料库中 590 个 AppWorld 压缩边界,在每个边界从重新执行的前缀状态出发,分别在压缩前上下文和摘要下重放,记录下一步动作的负担(报错或重复调用)。 最佳协议触发器在留出集上仅达 AUROC 0.66,低于同边界复现的 0.72;最佳冻结触发器可避开 21% 的有害边界并保留 84% 的压缩机会。 在匹配保留率下,最佳触发器能否胜过 token 预算规则尚无法评估。该论文已被 NeurIPS 2026 的 IAB Workshop(Interpreting Agent Behavior)接收,为非存档性质。
AI 根据报道生成 · 1 小时前更新
最新进展10月7日 12:00
Agent 历史能否预测压缩何时有害?TRACE 配对回放语料上的一项有限效应研究报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv:cs.LGAgent 历史能否预测压缩何时有害?TRACE 配对回放语料上的一项有限效应研究
研究基于 TRACE 公开语料库中 590 个 AppWorld 压缩边界,检验智能体近期行为能否预测上下文压缩带来的损害。结果显示,边界前历史对压缩后损害的预测能力很弱,最佳协议触发器在留出集上仅达 AUROC 0.66,低于同边界复现的 0.72;最佳冻结触发器可避开 21% 的有害边界并保留 84% 的压缩机会。在匹配保留率下,最佳触发器能否胜过 token 预算规则尚无法评估。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。