热点事件持续更新
SelfBench:用真实 PR 评测编码模型
1 篇报道1 个报道来源11 小时前更新
先了解这件事
AI 综述
2026 年 10 月 6 日,AGI Hunt 报道,SelfBench 是一个把仓库自己已合并的 PR 转成评测任务的工具,用真实 GitHub PR 来测试编码模型。作者在 Next.js、Sentry、PostHog、Supabase、Vercel 等真实仓库上跑了大量任务,据此得出的结论是:开源权重模型在真实工作上通常更贵且能力更弱。目前该事件仅有这一篇报道,尚无其他来源的独立复现或后续更新。
AI 根据报道生成 · 2 小时前更新
最新进展10月6日 01:35
SelfBench 在真实仓库任务上的结果显示,开源权重模型通常更贵且能力更弱。报道时间线
沿着报道,了解事件的不同侧面。
10月6日
- AGI Hunt精选SelfBench 用真实 GitHub PR 测编码模型:开源权重模型更贵且更弱
SelfBench 是一个把仓库自己的已合并 PR 转成评测任务的工具,作者在 Next.js、Sentry、PostHog、Supabase、Vercel 等真实仓库上跑了大量任务,结论是开源权重模型在真实工作上通常更贵且能力更弱。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。