arXiv cs.CL· Hongzhan Lin, Shidong Cao, Ziyang Luo, Wenhao Chai, Mong-Li Lee, Wynne Hsu·· 4 小时前AI 评分43
从证据到行动:工具调用智能体为何失败
From Evidence to Action: How Tool-Using Agents Fail
AI 导读
工具调用智能体的失败常发生在执行之前:在十种 model-harness 配置中,强静态动作评估可与弱得多的交互执行并存。研究提出 SafeActBench,含 656 个案例、6 个操作域和 5 种协议,用 Evidence Ledger 追踪证据确立与动作。获得证据后单动作执行通常可靠,多动作工作流则暴露未解决的前置条件与不完整执行。
来源:arXiv cs.CL · arxiv.org