热点事件持续更新
RISys-Lab 发布 KaliBench 网安 CLI 基准
1 篇报道1 个报道来源1 小时前更新
先了解这件事
AI 综述
2026年10月2日,AGI Hunt 报道,RISys-Lab 发布名为 KaliBench 的基准,用于评测大模型把自然语言意图转成可执行 CLI 命令的能力。该基准由 8504 个 query-command 对构成,覆盖 1642 个工具、23 个能力维度与 5 个安全阶段。评测在 24 个开源模型配置、3 种评测模式下进行,结果显示在无约束设置中,没有任何开源模型的精确命令准确率超过 42%。报道还称,KaliBench 提供的可验证奖励可用于 SFT+RL 训练,使 8B 模型的表现接近 685B MoE 模型。截至该报道,这是本事件唯一一篇报道,尚无与此前说法相矛盾的后续信息。
AI 根据报道生成 · 59 分钟前更新
最新进展10月2日 15:17
RISys-Lab 发布 KaliBench 基准,称无约束评测下无开源模型精确命令准确率超 42%。报道时间线
沿着报道,了解事件的不同侧面。
10月2日
- AGI HuntKaliBench:8504 条指令对评测 LLM 网安 CLI 能力,开源模型无一超 42%
RISys-Lab 发布 KaliBench 基准,用 8504 个 query-command 对评测 LLM 将自然语言意图转为可执行 CLI 命令的能力。该基准覆盖 1642 个工具、23 个能力维度、5 个安全阶段;在 24 个开源模型配置、3 种评测模式下,无约束设置中无开源模型精确命令准确率超过 42%。其可验证奖励用于 SFT+RL,可让 8B 模型接近 685B MoE 模型。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。