跳到正文
原文
AGI Hunt· RISys-Lab·· 2 小时前AI 评分42

KaliBench:8504 条指令对评测 LLM 网安 CLI 能力,开源模型无一超 42%

KaliBench:8504 条指令对测 LLM 网安 CLI 能力,开源模型无一超 42%

AI 导读

RISys-Lab 发布 KaliBench 基准,用 8504 个 query-command 对评测 LLM 将自然语言意图转为可执行 CLI 命令的能力。该基准覆盖 1642 个工具、23 个能力维度、5 个安全阶段;在 24 个开源模型配置、3 种评测模式下,无约束设置中无开源模型精确命令准确率超过 42%。其可验证奖励用于 SFT+RL,可让 8B 模型接近 685B MoE 模型。

来源:AGI Hunt · agihunt.info