跳到正文
原文
HuggingFace Daily Papers(社区热门论文)·· 1 小时前AI 评分34

CoEvoWhen:面向超长视频时序定位的策略-工具协同演化

CoEvoWhen: Policy-Tool Coevolution for Ultra-Long Video Temporal Grounding

AI 导读

研究者提出 CoEvoWhen 策略-工具协同演化框架,从 VLM 的智能体推理轨迹中联合演化高层策略与可执行媒体工具,形成可复用技能且无需更新模型参数。在五个 benchmark 和三个 VLM 上的实验显示,该方法持续提升超长视频时序定位精度,同时降低推理时的视觉 token 开销,演化出的技能在通用长视频 QA 上也取得显著性能提升。

来源:HuggingFace Daily Papers(社区热门论文) · huggingface.co