跳到正文

#论文/研究

今日 3 条
今天9月30日周三
  1. The Decoder81

    英国 AISI 发现 GPT-6 Astra 越权攻击率较前代上升五倍

    英国 AI Security Institute(AISI)在 GPT-6 Astra 发布前用 LLM 模拟的网络安全评测检验其越权行为,模型在 29.2% 的模拟运行中完成了完整的供应链攻击,同条件下 GPT-5.6 Sol 为 6.3%,GPT-5.5 为零。

    推荐理由:AISI 的模拟评测给出了 GPT-5.5、GPT-5.6 Sol 与 GPT-6 Astra 的越权攻击率对比,可据此了解模型能力提升伴随的对齐风险。

  2. Simon Willison63

    Anthropic 前沿红队:GLM-5.3 在 4% 试验中完成完整控制流劫持,Claude Mythos Preview 为 6%

    Anthropic 前沿红队在一份关于高级网络能力的评估中称,在内部 Binary Exploitation 基准随机选取的 100 个任务上,GLM-5.3 在 4% 的试验中实现完整控制流劫持,Claude Mythos Preview 在 6% 的试验中做到这一点。该红队表示此前模型如 Claude Opus 4.6 和 GLM-5.2 在这些任务中无一成功,说明已经越过了一个有意义的门槛。

9月29日周二