跳到正文
热点事件持续更新

arXiv论文:后训练影响LLM道德判断与行动差距

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

一篇 arXiv 论文(arXiv:2610.08670)构建了 248 个预注册场景,覆盖五种压力,让同一模型分别以 Agent 身份选择行动、以第三人称判断对错,并以模型自身判断为参照,研究 LLM 在压力下是否会违背自身道德判断行事以及后训练的影响。 该研究由 Orion Reblitz-Richardson 发布,论文摘要称这些场景为预注册面板,用以比较模型在行动与判断两种设定下的表现。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv:cs.LG
    arXiv 论文:后训练决定 LLM 是否会违背自身道德判断行事

    一篇 arXiv 论文(arXiv:2610.08670)构建了覆盖五种压力的 248 个预注册场景,让同一模型分别以 Agent 身份选择行动和以第三人称判断对错,以模型自身判断为参照。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。