跳到正文
原文
arXiv cs.CL· Divya Godara, Sachin Gupta·· 8 小时前AI 评分21

证据优先、算术其次:DocSem 共享任务系统 EVICALC 的系统报告与失败分析

Evidence First, Arithmetic Second: A System Report and Failure Analysis for DocSem

AI 导读

EVICALC 在 DocSem 共享任务官方最终测试的 1730 个任务上取得 8.61% 联合准确率。该系统读取 PDF、选取段落,由语言模型写出算术表达式并在本地代码中求值;一次公开验证运行另取得 92.17% 答案准确率和 1.00 证据 F1,但两者配置与指标不同,并非受控对比。事后分析中一例显示 OCR 与块分组把相关段落并入其他块,系统据无关文本作答。

来源:arXiv cs.CL · arxiv.org