arXiv:cs.AI(全量分类)· Tal Zeevi, Trey W. Jensen, Maxwell Strome·· 3 小时前AI 评分47
语言模型如何判断科学发现是否真正矛盾:GPT-5.6 Sol 与 Claude Opus 5 在 XOR 约束任务中的表现
When Scientific Contradictions Are Lost in Translation
AI 导读
研究用不可满足的 XOR 约束系统生成不同实验室的科学报告,测试语言模型在"符合约束"与"符合生物学预期"之间的取舍。
来源:arXiv:cs.AI(全量分类) · arxiv.org