跳到正文
原文
AGI Hunt· DynamicWebPaige·· 3 小时前AI 评分39

谷歌 Android Bench 2.0:约 30 个多天级长任务专测编码模型

AI 导读

Android 团队发布 Android Bench 2.0,评测重点从修 bug 和加小功能升级为约 30 个长周期复杂开发任务,专门衡量模型的长时程(long-horizon)工程能力。这些任务涵盖从零创建新应用、迁移依赖与设计、跨平台应用移植到 Android,属于工程师通常要花数天到一周才能完成的工作。

来源:AGI Hunt · agihunt.info