跳到正文
热点事件持续更新

RISys-Lab 发布 KaliBench 网安 CLI 基准

1 篇报道1 个报道来源1 小时前更新

先了解这件事

AI 综述

2026年10月2日,AGI Hunt 报道,RISys-Lab 发布名为 KaliBench 的基准,用于评测大模型把自然语言意图转成可执行 CLI 命令的能力。该基准由 8504 个 query-command 对构成,覆盖 1642 个工具、23 个能力维度与 5 个安全阶段。评测在 24 个开源模型配置、3 种评测模式下进行,结果显示在无约束设置中,没有任何开源模型的精确命令准确率超过 42%。报道还称,KaliBench 提供的可验证奖励可用于 SFT+RL 训练,使 8B 模型的表现接近 685B MoE 模型。截至该报道,这是本事件唯一一篇报道,尚无与此前说法相矛盾的后续信息。

AI 根据报道生成 · 59 分钟前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月2日
  1. AGI Hunt
    KaliBench:8504 条指令对评测 LLM 网安 CLI 能力,开源模型无一超 42%

    RISys-Lab 发布 KaliBench 基准,用 8504 个 query-command 对评测 LLM 将自然语言意图转为可执行 CLI 命令的能力。该基准覆盖 1642 个工具、23 个能力维度、5 个安全阶段;在 24 个开源模型配置、3 种评测模式下,无约束设置中无开源模型精确命令准确率超过 42%。其可验证奖励用于 SFT+RL,可让 8B 模型接近 685B MoE 模型。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。