跳到正文
热点事件持续更新

智能体运行时门控堆叠独立性评测

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

2026 年 10 月 7 日,arXiv cs.AI 一篇研究检验智能体工具调用运行时门控“堆叠”是否真能带来独立增益,而非只看单层准确率。作者在三个语料共 1,119 条标注 agent 动作上评估:两个 LLM 评判器组合约合 1.2–1.4 个乘性层,规则层加一个评判器为 1.86–2.09 层。但独立性检验显示,规则层与评判器组合的 φ 中位数仅 +0.014(0/4 对显著),评判器两两组合则为 +0.430(6/6 显著),即规则层与评判器并不互补。研究还指出单层准确率无法预测其对堆叠的增量贡献,并记录 112 个批次中有 50 个由未请求的模型版本服务。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv cs.AI
    评估门控堆叠而非单层:Agent 动作的确定性门控与 LLM 门控会独立失效吗?

    在 1,119 条标注 agent 动作(三个语料)上检验运行时门控堆叠:两个 LLM 评判器组合约合 1.2–1.4 个乘性层,规则层加一个评判器为 1.86–2.09 层。规则层与评判器组合的 φ 中位数仅 +0.014(0/4 对显著),评判器两两组合为 +0.430(6/6 显著)。单独准确率无法预测某层的增量贡献,且 112 个批次中有 50 个由未请求的模型版本服务。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。