跳到正文
热点事件持续更新

Long-Transduction 诊断长程智能体可靠性

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026年10月1日,arXiv cs.AI 全量分类收录论文《Long-Transduction 诊断测试长程智能体可靠性》。该论文提出 Long-Transduction 受控诊断方法,用于测试模型在长生成过程中持续读取、变换并输出依赖输入上下文的操作(如算术、排序、变量查找、表格变换)时保持任务的能力。评测七个开源权重模型后发现三类失效轴:上下文长度从 4K 扩展到 128K 时性能下降 62.8%,输入格式变化导致下降 36.5%,局部任务复杂度增加导致下降 39.9%。论文认为这三者构成智能体长程工作流中的关键失效轴。目前该研究处于论文发布阶段,尚无后续进展报道。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月1日
  1. arXiv:cs.AI(全量分类)
    Long-Transduction 诊断测试长程智能体可靠性:上下文从 4K 扩到 128K 性能下降 62.8%

    论文提出 Long-Transduction 受控诊断,测试模型在长生成中持续读取、变换并输出依赖输入上下文的操作(算术、排序、变量查找、表格变换)时保持任务的能力。评测七个开源权重模型发现:上下文长度从 4-128K 扩展时性能下降 62.8%,输入格式变化下降 36.5%,局部任务复杂度增加下降 39.9%,三者构成智能体长程工作流中的关键失效轴。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。