AGI Hunt· ycombinator·· 6 小时前精选AI 评分65
SelfBench 用真实 GitHub PR 测编码模型:开源权重模型更贵且更弱
SelfBench 用真实 GitHub PR 测编码模型:开源模型更贵还更弱
AI 导读
SelfBench 是一个把仓库自己的已合并 PR 转成评测任务的工具,作者在 Next.js、Sentry、PostHog、Supabase、Vercel 等真实仓库上跑了大量任务,结论是开源权重模型在真实工作上通常更贵且能力更弱。
推荐理由
SelfBench 把仓库已合并 PR 变成评测任务,读者可参考它在真实代码库上比较各家编码模型的准确率与成本。
来源:AGI Hunt · agihunt.info