AGI Hunt· CurieuxExplorer·· 3 小时前AI 评分29
可验证任务已被 Opus 5.5 秒杀,不可验证的才是新战场
可验证任务已被 AI 秒杀,不可验证的才是新战场
AI 导读
在会计任务上,Opus 5.5 几乎瞬时完成全部手动会计工作且准确率 100%,而人类耗时更久还错误频出;两年前 GPT-4o 还输给普通会计。发帖人由此总结,凡是可检验的任务,前沿模型如今已比专家做得更快更好,真正开放的问题是那些无法验证的任务。
来源:AGI Hunt · agihunt.info