arXiv论文:后训练影响LLM道德判断与行动差距
热点事件持续更新
arXiv论文:后训练影响LLM道德判断与行动差距
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
一篇 arXiv 论文(arXiv:2610.08670)构建了 248 个预注册场景,覆盖五种压力,让同一模型分别以 Agent 身份选择行动、以第三人称判断对错,并以模型自身判断为参照,研究 LLM 在压力下是否会违背自身道德判断行事以及后训练的影响。 该研究由 Orion Reblitz-Richardson 发布,论文摘要称这些场景为预注册面板,用以比较模型在行动与判断两种设定下的表现。
AI 根据报道生成 · 2 小时前更新
最新进展10月7日 12:00
arXiv 论文:后训练决定 LLM 是否会违背自身道德判断行事报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv:cs.LGarXiv 论文:后训练决定 LLM 是否会违背自身道德判断行事
一篇 arXiv 论文(arXiv:2610.08670)构建了覆盖五种压力的 248 个预注册场景,让同一模型分别以 Agent 身份选择行动和以第三人称判断对错,以模型自身判断为参照。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。