研究:大模型答州政策会套用他州数值
热点事件持续更新
研究:大模型答州政策会套用他州数值
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
一项由 Jiayu Feng 提交、发布在 arXiv cs.CL 的测量研究称,用固定措辞、只更换美国 51 个司法辖区的极简设计测试三项 Medicaid 收入资格数值时,Claude Sonnet 5.5 与 GPT-5.6 Sol 在 153 个项目中分别有 10 项和 25 项可复现地给出其他州的当前数值,两次独立重复结果完全一致。 研究称,回答所对照的标准值来自一份官方数据手册,并在 102 个抽查单元格中有 101 个与独立来源一致。研究还称,把任何等于其他州数值的错误答案都计为跨州替换,会得到比逐项核对该州自身记录多 3 至 5 倍的可复现替换,因为许多看似跨州的答案其实是被问州在另一口径或更早年份下的自身数值。 研究者表示将公开测量协议、标准值表和全部模型输出。
AI 根据报道生成 · 1 小时前更新
最新进展10月8日 12:00
LLM 回答州政策出错时是在跨州替换吗?一项针对美国 51 个司法辖区的测量研究报道时间线
沿着报道,了解事件的不同侧面。
10月8日
- arXiv:cs.CLLLM 回答州政策出错时是在跨州替换吗?一项针对美国 51 个司法辖区的测量研究
研究用固定措辞、只更换辖区的极简设计,测试 Claude Sonnet 5.5 与 GPT-5.6 Sol 对美国 51 个司法辖区三项 Medicaid 收入资格数值的召回,两者在 153 个项目中分别有 10 和 25 项可复现地给出其他州的当前数值,且两次独立重复完全一致。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。