跳到正文
热点事件持续更新

ReFract 基准评测智能体视角感知

1 篇报道1 个报道来源4 小时前更新

先了解这件事

AI 综述

研究者发布 ReFract 基准,用于评测语言模型智能体的“视角感知”能力:面对同一查询,智能体需根据用户角色做出不同响应。该基准包含 150 条经专家验证的条目,基于匿名化的领域支持对话构建文本世界模型,模拟智能体运行环境并组装视角感知的动作轨迹。 研究称,当前最先进的大语言模型最多只能解决 69% 的任务,且超过 50% 的轨迹包含违反角色权限的动作尝试。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. arXiv:cs.AI
    ReFract:用文本世界模型评测语言模型智能体的视角感知能力

    研究者提出 ReFract 基准,包含 150 条经专家验证的条目,要求 LLM 智能体对同一查询根据用户角色做出不同响应,即"视角感知"能力。该基准基于匿名化的领域支持对话构建文本世界模型,模拟智能体运行环境并组装视角感知的动作轨迹。SOTA LLM 最多只能解决 69% 的任务,且超过 50% 的轨迹包含违反角色权限的动作尝试。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。