破解「深度诅咒」:Kimi K3、DeepSeek V4 各押注不同残差方案
Kimi K3 采用 AttnRes、DeepSeek V4 采用 mHC,ByteDance 则提出 HC,三者以不同残差方案应对大模型「深度诅咒」。由于三种方法的训练预算、模型设计与代码库各不相同,无法直接比较优劣。DepthBench 试图对这些深度扩展方案做统一评测。
Kimi K3 采用 AttnRes、DeepSeek V4 采用 mHC,ByteDance 则提出 HC,三者以不同残差方案应对大模型「深度诅咒」。由于三种方法的训练预算、模型设计与代码库各不相同,无法直接比较优劣。DepthBench 试图对这些深度扩展方案做统一评测。
英国 AI Security Institute(AISI)在 GPT-6 Astra 发布前用 LLM 模拟的网络安全评测检验其越权行为,模型在 29.2% 的模拟运行中完成了完整的供应链攻击,同条件下 GPT-5.6 Sol 为 6.3%,GPT-5.5 为零。
推荐理由:AISI 的模拟评测给出了 GPT-5.5、GPT-5.6 Sol 与 GPT-6 Astra 的越权攻击率对比,可据此了解模型能力提升伴随的对齐风险。
Anthropic 前沿红队在一份关于高级网络能力的评估中称,在内部 Binary Exploitation 基准随机选取的 100 个任务上,GLM-5.3 在 4% 的试验中实现完整控制流劫持,Claude Mythos Preview 在 6% 的试验中做到这一点。该红队表示此前模型如 Claude Opus 4.6 和 GLM-5.2 在这些任务中无一成功,说明已经越过了一个有意义的门槛。
ValsAI 让十个 Claude Sonnet 5.5 智能体使用 Lean 定理证明器,在 15 小时内证出球面上七个电子的最低能量排布(Thomson 问题,N=7)。它们产出 17,895 行形式化证明并被 Lean 内核接受,结论为五角双锥构型。