跳到正文
原文
arXiv cs.CL· Hongzhan Lin, Shidong Cao, Ziyang Luo, Wenhao Chai, Mong-Li Lee, Wynne Hsu·· 4 小时前AI 评分43

从证据到行动:工具调用智能体为何失败

From Evidence to Action: How Tool-Using Agents Fail

AI 导读

工具调用智能体的失败常发生在执行之前:在十种 model-harness 配置中,强静态动作评估可与弱得多的交互执行并存。研究提出 SafeActBench,含 656 个案例、6 个操作域和 5 种协议,用 Evidence Ledger 追踪证据确立与动作。获得证据后单动作执行通常可靠,多动作工作流则暴露未解决的前置条件与不完整执行。

来源:arXiv cs.CL · arxiv.org