跳到正文
热点事件持续更新

CoC-Seduce基准评测22个LLM裁决者

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

Weiying Chen等作者发布多智能体对抗基准 CoC-Seduce,用于测试大语言模型在《克苏鲁的呼唤》桌面角色扮演游戏中担任规则裁决者的表现。基准由 GPT-5.4、Claude Sonnet 4.6、Gemini 3.5 Flash 生成 5,376 个样本,覆盖 4 种世界设定与 16 类技能,共评测 22 个裁决模型。 结果显示,模型版本更新与显式推理均不能可靠提升裁决鲁棒性;在各类修辞注入手法中,伪逻辑框架最有效,而世界设定的影响有限。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. arXiv:cs.AI
    LLM 在《克苏鲁的呼唤》TRPG 中作为裁决者的规则遵循评估

    研究提出 CoC-Seduce 多智能体对抗基准,用 GPT-5.4、Claude Sonnet 4.6、Gemini 3.5 Flash 生成 5,376 个样本,覆盖 4 种世界设定与 16 类技能,测试 22 个裁决模型。结果显示新版本与显式推理均不能可靠提升裁决鲁棒性,伪逻辑框架是最有效的修辞注入手法,世界设定的影响有限。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。