热点事件持续更新
长周期决策测试:顶尖AI远逊人类
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
2026年10月2日,X平台用户Rohan Paul发布消息称,一项针对长周期决策的论文测试了包括GPT-5.6 Sol和Claude Opus 4.8在内的八款领先模型。测试任务要求参与者进行一年连贯决策、面对延迟反馈并承担自身行为后果。结果显示,这些模型在任务中表现相对人类全面崩溃,表现最好的Qwen3.7-Max搭配Hermes,最终收益仅为人类平均参与者的27.3%。目前该事件仅有这一条报道,尚无后续进展。
AI 根据报道生成 · 2 小时前更新
最新进展10月2日 10:16
一项论文测试显示八款顶尖模型在长周期决策任务中远逊人类,最佳组合收益仅为人类平均的27.3%。报道时间线
沿着报道,了解事件的不同侧面。
10月2日
- X:Rohan Paul (@rohanpaul_ai)长周期任务测试:八款顶尖模型远逊人类
一项针对长周期决策的论文测试了包括GPT-5.6 Sol和Claude Opus 4.8在内的八款领先模型,在需要一年连贯决策、延迟反馈并承担自身行为后果的任务中,模型表现相对人类全面崩溃。表现最好的Qwen3.7-Max搭配Hermes,最终收益仅为人类平均参与者的27.3%。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。