跳到正文
热点事件持续更新

SafeActBench:工具智能体行动失败分析

2 篇报道2 个报道来源24 分钟前更新

先了解这件事

AI 综述

2026年10月7日,arXiv cs.CL 刊出论文《从证据到行动:工具调用智能体为何失败》,指出工具调用智能体的失败常发生在执行之前:在十种 model-harness 配置中,强静态动作评估可以与弱得多的交互执行并存。研究为此提出 SafeActBench,含 656 个案例、6 个操作域和 5 种协议,并用 Evidence Ledger 追踪证据的确立与动作;结果显示获得证据后单动作执行通常可靠,多动作工作流则暴露出未解决的前置条件与不完整执行。同日稍后,AGI Hunt 报道称该基准由新加坡国立大学发布,并进一步说明失败多发生在执行前——Agent 会提前停止调查,或在证据未齐时贸然行动;SafeActBench 配套 Evidence Ledger 溯源绑定与确定性轨迹评估器,用于追踪证据建立与下游依赖。两篇报道在案例数、操作域与协议数上一致。

AI 根据报道生成 · 8 分钟前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. AGI Hunt
    新加坡国立大学发布 SafeActBench:656 例剖析工具型 Agent 从证据到行动的断点

    新加坡国立大学发布 SafeActBench,用 656 个案例研究工具型 Agent「证据到行动」链条的断裂点。在 10 种模型-框架组合中,静态行动判断能力强并不代表交互式执行可靠,失败多发生在执行前:Agent 提前停止调查,或证据未齐就贸然行动。基准覆盖 6 个操作领域、5 种协议,配套 Evidence Ledger 溯源绑定与确定性轨迹评估器,追踪证据建立与下游依赖。

  2. arXiv cs.CL
    从证据到行动:工具调用智能体为何失败

    工具调用智能体的失败常发生在执行之前:在十种 model-harness 配置中,强静态动作评估可与弱得多的交互执行并存。研究提出 SafeActBench,含 656 个案例、6 个操作域和 5 种协议,用 Evidence Ledger 追踪证据确立与动作。获得证据后单动作执行通常可靠,多动作工作流则暴露未解决的前置条件与不完整执行。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。