跳到正文
原文
arXiv:cs.CL(计算语言学,全量分类)· Divya Godara, Sachin Gupta·· 3 小时前AI 评分26

EVICALC 系统在 DocSem 共享任务中仅获 8.61% 联合准确率

Evidence First, Arithmetic Second: A System Report and Failure Analysis for DocSem

AI 导读

EVICALC 在 DocSem 共享任务官方最终测试的 1,730 项任务上取得 8.61% 联合准确率,其流程为读取 PDF、选取段落、让语言模型写出算术表达式并在本地代码中求值。

来源:arXiv:cs.CL(计算语言学,全量分类) · arxiv.org