跳到正文
热点事件持续更新

AdaptEvo:不完美监督下的智能体学习框架

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

Shijun Wan 等作者提出 AdaptEvo 框架,用于在不完美监督下训练智能体。框架由两部分组成:Training 模块用置信度自适应策略优化(CA-GRPO)按参考置信度平衡结果与过程奖励;Evolution 模块从反复出现的失败中合成可复用的决策知识,并改进过程评估标准。作者同时发布了工业多模态内容审核数据集。 该工作以 arXiv 论文形式公布,作者称其方法将置信度自适应策略优化与不断演化的决策知识和评估标准相结合,以应对不完美监督下的学习挑战。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. arXiv:cs.CL
    AdaptEvo:用演化监督实现智能体自适应学习

    AdaptEvo 提出一种在不完美监督下学习的框架,将置信度自适应策略优化与不断演化的决策知识、评估标准相结合。其 Training 模块采用 Confidence-Adaptive GRPO(CA-GRPO)按参考置信度平衡结果与过程奖励,Evolution 模块则从反复出现的失败中合成可复用决策知识并改进过程评估标准。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。