热点事件持续更新
InferBench 基准发布:评测模型意图理解
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
2026 年 10 月 7 日,新基准 InferBench 发布,用于评测大模型理解用户真实意图的能力。该基准用 12 个模型、20 个场景、2.8k 对话,测试 LLM 能否推断用户没说出口的真实优先级。结果显示,GPT-6 Astra 得分 76%,MiMo V2.6 Pro 以 75% 紧随其后,Gemini 3.1 Pro 为 69%;开源权重模型表现超出预期。分场景看,当优先级被明确说出时,模型 89% 能选对,而部分未明说时降至 60%。报道同时指出隐忧:模型犯错时依然自信,288 次错误决策中有 105 次以高于 90% 的置信度提交。
AI 根据报道生成 · 1 小时前更新
最新进展10月7日 07:52
InferBench 新基准发布,MiMo V2.6 Pro 以 75% 逼近 GPT-6 Astra 的 76%。报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- AGI HuntInferBench:MiMo V2.6 Pro 追平 GPT-6 Astra 的意图理解
InferBench 新基准用 12 个模型、20 个场景、2.8k 对话测试 LLM 推断用户真实优先级,GPT-6 Astra 得 76%、MiMo V2.6 Pro 75%、Gemini 3.1 Pro 69%。优先级被明确说出时模型 89% 选对,部分未明说时降至 60%,开源权重模型表现超出预期。隐忧是模型犯错时依然自信:288 次错误决策中有 105 次以 >90% 的置信度提交。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。