ReFract 基准评测智能体视角感知
热点事件持续更新
ReFract 基准评测智能体视角感知
1 篇报道1 个报道来源4 小时前更新
先了解这件事
AI 综述
研究者发布 ReFract 基准,用于评测语言模型智能体的“视角感知”能力:面对同一查询,智能体需根据用户角色做出不同响应。该基准包含 150 条经专家验证的条目,基于匿名化的领域支持对话构建文本世界模型,模拟智能体运行环境并组装视角感知的动作轨迹。 研究称,当前最先进的大语言模型最多只能解决 69% 的任务,且超过 50% 的轨迹包含违反角色权限的动作尝试。
AI 根据报道生成 · 2 小时前更新
最新进展10月5日 12:00
ReFract:用文本世界模型评测语言模型智能体的视角感知能力报道时间线
沿着报道,了解事件的不同侧面。
10月5日
- arXiv:cs.AIReFract:用文本世界模型评测语言模型智能体的视角感知能力
研究者提出 ReFract 基准,包含 150 条经专家验证的条目,要求 LLM 智能体对同一查询根据用户角色做出不同响应,即"视角感知"能力。该基准基于匿名化的领域支持对话构建文本世界模型,模拟智能体运行环境并组装视角感知的动作轨迹。SOTA LLM 最多只能解决 69% 的任务,且超过 50% 的轨迹包含违反角色权限的动作尝试。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。