跳到正文
热点事件持续更新

SLM 微任务资格阈值评测:16 项配置均不达标

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

2026 年 10 月 2 日,arXiv cs.AI 论文《测量微任务合格性差距:现成 SLM 何时足以支撑 Agent Harness?》给出了对小模型能否胜任 Agent 任务的评测结果。该工作在 4 个 Agent Harness 微任务上测试了 Qwen3 0.6B、1.7B、4B、8B 共 16 个 FP16 配置,结果全部未通过预设阈值。基准判定采用两条依据:一是锚定非 LLM 基线的阈值 τ,二是基于置信区间的合格性规则。论文还引入 logprob 决策阈值诊断,把未通过阈值的失败区分为两类——模型自身能力不足,以及仅靠调整解码阈值即可达标的可调解码问题。目前该结果以论文形式公开,报道中未提及其复现、修正或其他后续动作。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月2日
  1. arXiv cs.AI
    测量微任务合格性差距:现成 SLM 何时足以支撑 Agent Harness?

    在 4 个 Agent Harness 微任务上,Qwen3 0.6/1.7/4/8B 的 16 个 FP16 配置全部未通过预设阈值。基准以锚定非 LLM 基线的阈值 τ 和 CI 合格性规则判定,并用 logprob 决策阈值诊断把失败分为能力不足与可调解码阈值两类。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。