跳到正文
原文
arXiv cs.AI· Chenglin Yang·· 4 小时前AI 评分42

评估门控堆叠而非单层:Agent 动作的确定性门控与 LLM 门控会独立失效吗?

Evaluate the Stack, Not the Layer: Do Deterministic and LLM Gates for Agent Actions Fail Independently?

AI 导读

在 1,119 条标注 agent 动作(三个语料)上检验运行时门控堆叠:两个 LLM 评判器组合约合 1.2–1.4 个乘性层,规则层加一个评判器为 1.86–2.09 层。规则层与评判器组合的 φ 中位数仅 +0.014(0/4 对显著),评判器两两组合为 +0.430(6/6 显著)。单独准确率无法预测某层的增量贡献,且 112 个批次中有 50 个由未请求的模型版本服务。

来源:arXiv cs.AI · arxiv.org