arXiv:cs.CL(计算语言学,全量分类)· Divya Godara, Sachin Gupta·· 3 小时前AI 评分26
EVICALC 系统在 DocSem 共享任务中仅获 8.61% 联合准确率
Evidence First, Arithmetic Second: A System Report and Failure Analysis for DocSem
AI 导读
EVICALC 在 DocSem 共享任务官方最终测试的 1,730 项任务上取得 8.61% 联合准确率,其流程为读取 PDF、选取段落、让语言模型写出算术表达式并在本地代码中求值。
来源:arXiv:cs.CL(计算语言学,全量分类) · arxiv.org