跳到正文
热点事件持续更新

研究提出多智能体辩论评估LLM规范能力

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

研究者提出一种多智能体社区辩论设置,用合成规范控制哪些智能体可以进入辩论,以此在脱离预训练暴露的情况下评估大语言模型的规范能力。 结果显示,基线LLM智能体即使已学会规范能提升准确率,仍然无法通过该设置。加入规范推断模块后,规范遵循效果对规范风格和模块所依托的模型高度敏感。 研究还发现,当真实规范伴随非规范行为出现时,智能体会不加区分地模仿这些噪声,即便明确施加惩罚也未能改变这一行为。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. arXiv:cs.AI
    LLM 规范能力的基础、设计与挑战:多智能体社区辩论中的规范推断研究

    研究者提出多智能体社区辩论设置,用合成规范控制辩论准入,以独立于预训练暴露来评估 LLM 的规范能力。基线 LLM 智能体即使学会规范能提升准确率也仍然失败;引入规范推断模块后,规范遵循对规范风格和模块所依托的模型高度敏感,且当真实规范伴随非规范行为时,智能体会不加区分地模仿这些噪声,即使明确惩罚也无济于事。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。