AGI Hunt· NationalUniversityofSingapore·· 2 小时前AI 评分44
新加坡国立大学发布 SafeActBench:656 例剖析工具型 Agent 从证据到行动的断点
新加坡国立大学发布 SafeActBench:656 例剖析工具型 Agent 从证据到行动的断点
AI 导读
新加坡国立大学发布 SafeActBench,用 656 个案例研究工具型 Agent「证据到行动」链条的断裂点。在 10 种模型-框架组合中,静态行动判断能力强并不代表交互式执行可靠,失败多发生在执行前:Agent 提前停止调查,或证据未齐就贸然行动。基准覆盖 6 个操作领域、5 种协议,配套 Evidence Ledger 溯源绑定与确定性轨迹评估器,追踪证据建立与下游依赖。
来源:AGI Hunt · agihunt.info