arXiv cs.CL· Jiayi Li, Ruizhe Li·· 4 小时前AI 评分40
SAKIKO:修正何时变成修复?工具调用 LLM 内部干预的机制审计
When Does Correction Become Repair? Mechanistic Auditing of Internal Interventions in Tool-Using LLMs
AI 导读
SAKIKO 审计框架把工具调用 LLM 的内部激活干预落到目标端核验:在 When2Call 与 MetaTool 上的七个 LLM 中,通道键控干预在五个模型产生方向特定净增益,59 个预算匹配随机方向在三项封存评估中均未达到校准目标增益。
来源:arXiv cs.CL · arxiv.org