跳到正文
热点事件持续更新

SAKIKO:工具调用 LLM 内部干预审计框架

1 篇报道1 个报道来源4 小时前更新

先了解这件事

AI 综述

2026 年 9 月 30 日,arXiv cs.CL 收录论文《SAKIKO:修正何时变成修复?工具调用 LLM 内部干预的机制审计》,提出 SAKIKO 审计框架,把对工具调用 LLM 的内部激活干预落到目标端核验。作者在 When2Call 与 MetaTool 两个基准的七个 LLM 上检验:通道键控干预在其中五个模型产生方向特定的净增益;同时,59 个预算匹配的随机方向在三项封存评估中均未达到校准目标增益,由此区分“修正”与“修复”。报道未给出更多实验细节。

AI 根据报道生成 · 3 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

9月30日
  1. arXiv cs.CL
    SAKIKO:修正何时变成修复?工具调用 LLM 内部干预的机制审计

    SAKIKO 审计框架把工具调用 LLM 的内部激活干预落到目标端核验:在 When2Call 与 MetaTool 上的七个 LLM 中,通道键控干预在五个模型产生方向特定净增益,59 个预算匹配随机方向在三项封存评估中均未达到校准目标增益。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。