arXiv cs.AI· Jundong Hu, Shekar Ramachandran·· 4 小时前AI 评分40
测量微任务合格性差距:现成 SLM 何时足以支撑 Agent Harness?
Measuring the Microtask Eligibility Gap: When Is an Off-the-Shelf SLM Enough for an Agent Harness?
AI 导读
在 4 个 Agent Harness 微任务上,Qwen3 0.6/1.7/4/8B 的 16 个 FP16 配置全部未通过预设阈值。基准以锚定非 LLM 基线的阈值 τ 和 CI 合格性规则判定,并用 logprob 决策阈值诊断把失败分为能力不足与可调解码阈值两类。
来源:arXiv cs.AI · arxiv.org