CoEvoWhen:面向超长视频时序定位的策略-工具协同演化
研究者提出 CoEvoWhen 策略-工具协同演化框架,从 VLM 的智能体推理轨迹中联合演化高层策略与可执行媒体工具,形成可复用技能且无需更新模型参数。在五个 benchmark 和三个 VLM 上的实验显示,该方法持续提升超长视频时序定位精度,同时降低推理时的视觉 token 开销,演化出的技能在通用长视频 QA 上也取得显著性能提升。
研究者提出 CoEvoWhen 策略-工具协同演化框架,从 VLM 的智能体推理轨迹中联合演化高层策略与可执行媒体工具,形成可复用技能且无需更新模型参数。在五个 benchmark 和三个 VLM 上的实验显示,该方法持续提升超长视频时序定位精度,同时降低推理时的视觉 token 开销,演化出的技能在通用长视频 QA 上也取得显著性能提升。
Epoch AI 以数字版桌游《Earthborne Rangers》作为 AI 智能体评测基准,每个模型默认跑 10 局、取最后 2 局最高分作为 topline 分数并采样 5 次,人类目前最高分为 21/21。
Cohere Labs 发布“Future(s) of Work”研究专题,探讨 AI 对工作方式的影响,并指出当前关于未来工作的讨论存在证据不足的问题。该专题推出 Agentic Task Ecosystem(ATE)数据集,基于 7 个目录中的 123,000 个公开 MCP 服务器,分析了 694,000+ 个可执行工具,将 AI 工具映射到真实职业任务。
研究者提出 SAKIKO 审计框架,用于检验工具调用 LLM 的内部激活干预是否构成真正的"修复"。在 When2Call 和 MetaTool 上对七个 LLM 的测试中,通道键控干预在五个模型上带来方向特定的净增益,但 59 个预算匹配的随机方向无一能匹配校准后的目标增益。
Lookahead-R 是一个将工具检索重构为资源受限序列决策问题的规划框架,通过轻量级执行感知代理世界模型联合预测工具执行成功率、延迟成本与语义效用,无需调用真实 API。在 ToolBench 的 I3 划分上,其 NDCG@5 达 91.40%,超过 SOTA 的 ToolGen(90.16%)1.24%。消融实验表明,显式延迟建模是资源约束下识别高质量工具的关键判别信号。
Hugging Face 发布论文 ProvenanceGuard,一个面向 MCP 智能体的生成后验证层,专门检测"跨来源混淆"——即事实在证据池中成立、却被归因到错误来源。
Google Research 提出 ToolGrad,一种“先答案后问题”的工具调用数据生成范式:先迭代构建可验证的 API 调用链,再反推用户提示词,替代 ToolBench、ToolACE 等基于 DFS 试错的低效方案。