跳到正文
原文
AGI Hunt· rohanpaul_ai·· 3 小时前AI 评分46

长周期经营任务测试 8 个顶尖模型:最佳组合 Qwen3.7-Max + Hermes 仅达人类 27.3% 水平

测试 8 个顶级模型:长周期经营任务 AI 仅达人类 27.3% 水平

AI 导读

一项长周期智能体压力测试让 8 个前沿模型面对一整年相互关联的决策、延迟反馈和自身历史行为的后果,最佳组合 Qwen3.7-Max + Hermes 在模拟经营结束时手里的钱只有人类参与者平均的 27.3%。测试显示顶级模型相对人类表现大幅崩塌,距离可靠的长期任务执行能力还差得远。

来源:AGI Hunt · agihunt.info