跳到正文

#MCP/工具调用

今日 1 条
今天10月1日周四
  1. HuggingFace Daily Papers(社区热门论文)34

    CoEvoWhen:面向超长视频时序定位的策略-工具协同演化

    研究者提出 CoEvoWhen 策略-工具协同演化框架,从 VLM 的智能体推理轨迹中联合演化高层策略与可执行媒体工具,形成可复用技能且无需更新模型参数。在五个 benchmark 和三个 VLM 上的实验显示,该方法持续提升超长视频时序定位精度,同时降低推理时的视觉 token 开销,演化出的技能在通用长视频 QA 上也取得显著性能提升。

9月30日周三
  1. Cohere Labs:官方研究博客42

    Cohere Labs 探讨 AI 将如何改变工作方式

    Cohere Labs 发布“Future(s) of Work”研究专题,探讨 AI 对工作方式的影响,并指出当前关于未来工作的讨论存在证据不足的问题。该专题推出 Agentic Task Ecosystem(ATE)数据集,基于 7 个目录中的 123,000 个公开 MCP 服务器,分析了 694,000+ 个可执行工具,将 AI 工具映射到真实职业任务。

  2. arXiv:cs.CL(计算语言学,全量分类)35

    Lookahead-R:基于执行中心规划的预算感知工具检索

    Lookahead-R 是一个将工具检索重构为资源受限序列决策问题的规划框架,通过轻量级执行感知代理世界模型联合预测工具执行成功率、延迟成本与语义效用,无需调用真实 API。在 ToolBench 的 I3 划分上,其 NDCG@5 达 91.40%,超过 SOTA 的 ToolGen(90.16%)1.24%。消融实验表明,显式延迟建模是资源约束下识别高质量工具的关键判别信号。

9月29日周二
9月28日周一
  1. DAIR.AI43

    Salesforce AI Research 提出 Critical-State RL,用于多轮工具调用的强化学习训练。该方法通过嵌套采样分离当前动作带来的奖励变化与下游噪声,只对改变结果的那一次调用做上下文赌博机更新,而非把奖励摊到整条轨迹。在 BFCL v4 缺失函数任务上,训练被选中的那一轮带来约 14 个百分点的提升,训练其他候选轮则准确率持平或下降。

9月11日周五