跳到正文
原文
arXiv:cs.AI(全量分类)· Jeffrey Willette, Krishna C. Puvvada, Boris Ginsburg·· 3 小时前AI 评分51

Long-Transduction 诊断测试长程智能体可靠性:上下文从 4K 扩到 128K 性能下降 62.8%

Staying on Task: Testing the Foundations of Long-Horizon Agent Reliability

AI 导读

论文提出 Long-Transduction 受控诊断,测试模型在长生成中持续读取、变换并输出依赖输入上下文的操作(算术、排序、变量查找、表格变换)时保持任务的能力。评测七个开源权重模型发现:上下文长度从 4-128K 扩展时性能下降 62.8%,输入格式变化下降 36.5%,局部任务复杂度增加下降 39.9%,三者构成智能体长程工作流中的关键失效轴。

来源:arXiv:cs.AI(全量分类) · arxiv.org