跳到正文
原文
arXiv cs.AI· Caiqi Zhang, Rujun Han, Zifeng Wang, Zoey CuiZhu, Nigel Collier, Tomas Pfister, Chen-Yu Lee·· 4 小时前AI 评分41

VeriHarness:为长时程任务扩展智能体验证

VeriHarness: Scaling Agentic Verification for Long-Horizon Tasks

AI 导读

VeriHarness 让生成答案的 LLM 充当智能体验证器,配备工作区、证据工具与可复用验证技能来核验长时程任务输出。在五个长时程工作区基准与两个前沿模型上,它的选择分数高于所评估基线,证据支撑的修订较单次 rollout 平均提升 6.2 分(Gemini 3.5 Flash)和 6.4 分(Claude Opus 4.8)。

来源:arXiv cs.AI · arxiv.org