arXiv cs.CL· Nishanth Nayakanti, Prasang Gupta, Ashutosh Bilthare, Kevin Paul·· 4 小时前AI 评分33
无标注证据的判决:小语言模型在 ContractNLI 上该用拒绝采样还是纯标签后训练恢复证据?
Verdicts Without Annotated Evidence: Rejection Sampling or Label-Only Post-Training for Evidence Recovery?
AI 导读
小语言模型仅用判决结果后训练即可恢复证据:在 ContractNLI 上纯标签训练达准确率 0.896、span F1 0.564。拒绝采样按自动来源接地分数挑选判决匹配的轨迹,得 0.797 和 0.556(训练前 0.747、0.493),逐字引用率 0.701。匹配判决与对齐证据跨度仅弱相关,单语料单种子难分优劣。
来源:arXiv cs.CL · arxiv.org