热点事件持续更新
SAKIKO:工具调用 LLM 内部干预审计框架
1 篇报道1 个报道来源4 小时前更新
先了解这件事
AI 综述
2026 年 9 月 30 日,arXiv cs.CL 收录论文《SAKIKO:修正何时变成修复?工具调用 LLM 内部干预的机制审计》,提出 SAKIKO 审计框架,把对工具调用 LLM 的内部激活干预落到目标端核验。作者在 When2Call 与 MetaTool 两个基准的七个 LLM 上检验:通道键控干预在其中五个模型产生方向特定的净增益;同时,59 个预算匹配的随机方向在三项封存评估中均未达到校准目标增益,由此区分“修正”与“修复”。报道未给出更多实验细节。
AI 根据报道生成 · 3 小时前更新
最新进展9月30日 12:00
SAKIKO 论文公布:七个 LLM 中五个经通道键控干预获方向特定净增益,59 个随机方向对照未达标。报道时间线
沿着报道,了解事件的不同侧面。
9月30日
- arXiv cs.CLSAKIKO:修正何时变成修复?工具调用 LLM 内部干预的机制审计
SAKIKO 审计框架把工具调用 LLM 的内部激活干预落到目标端核验:在 When2Call 与 MetaTool 上的七个 LLM 中,通道键控干预在五个模型产生方向特定净增益,59 个预算匹配随机方向在三项封存评估中均未达到校准目标增益。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。