跳到正文
原文
arXiv cs.CL· Jiayi Li, Ruizhe Li·· 4 小时前AI 评分40

SAKIKO:修正何时变成修复?工具调用 LLM 内部干预的机制审计

When Does Correction Become Repair? Mechanistic Auditing of Internal Interventions in Tool-Using LLMs

AI 导读

SAKIKO 审计框架把工具调用 LLM 的内部激活干预落到目标端核验:在 When2Call 与 MetaTool 上的七个 LLM 中,通道键控干预在五个模型产生方向特定净增益,59 个预算匹配随机方向在三项封存评估中均未达到校准目标增益。

来源:arXiv cs.CL · arxiv.org