跳到正文
原文
AGI Hunt· ycombinator·· 6 小时前精选AI 评分65

SelfBench 用真实 GitHub PR 测编码模型:开源权重模型更贵且更弱

SelfBench 用真实 GitHub PR 测编码模型:开源模型更贵还更弱

AI 导读

SelfBench 是一个把仓库自己的已合并 PR 转成评测任务的工具,作者在 Next.js、Sentry、PostHog、Supabase、Vercel 等真实仓库上跑了大量任务,结论是开源权重模型在真实工作上通常更贵且能力更弱。

推荐理由

SelfBench 把仓库已合并 PR 变成评测任务,读者可参考它在真实代码库上比较各家编码模型的准确率与成本。

来源:AGI Hunt · agihunt.info