arXiv:cs.CL(计算语言学,全量分类)· Yingfeng Luo, Shaowei Wei, Daixin Wang, Dingyang Lin, Kaiyan Chang, Weiqiao Shan, Tong Zheng, Zhiqiang Zhang, Jingbo Zhu, Tong Xiao·· 3 小时前AI 评分50
终端智能体能否信任自我验证?诊断并改进自我验证能力
Can Terminal Agents Trust Their Own Verification? Diagnosing and Improving Self-Verification
AI 导读
研究提出诊断框架,在 TerminalBench2.1 上测试十款终端智能体,发现完整候选方案形成后验证几乎普遍发生,但仅 61.43% 的错误候选被检出,检出的错误中仅 49.36% 被成功修复。
来源:arXiv:cs.CL(计算语言学,全量分类) · arxiv.org