跳到正文
原文
AGI Hunt· Gold-Bat-3225·· 3 小时前AI 评分44

InferBench:MiMo V2.6 Pro 追平 GPT-6 Astra 的意图理解

AI 导读

InferBench 新基准用 12 个模型、20 个场景、2.8k 对话测试 LLM 推断用户真实优先级,GPT-6 Astra 得 76%、MiMo V2.6 Pro 75%、Gemini 3.1 Pro 69%。优先级被明确说出时模型 89% 选对,部分未明说时降至 60%,开源权重模型表现超出预期。隐忧是模型犯错时依然自信:288 次错误决策中有 105 次以 >90% 的置信度提交。

来源:AGI Hunt · agihunt.info