跳到正文
热点事件持续更新

SelfBench:用真实 PR 评测编码模型

1 篇报道1 个报道来源11 小时前更新

先了解这件事

AI 综述

2026 年 10 月 6 日,AGI Hunt 报道,SelfBench 是一个把仓库自己已合并的 PR 转成评测任务的工具,用真实 GitHub PR 来测试编码模型。作者在 Next.js、Sentry、PostHog、Supabase、Vercel 等真实仓库上跑了大量任务,据此得出的结论是:开源权重模型在真实工作上通常更贵且能力更弱。目前该事件仅有这一篇报道,尚无其他来源的独立复现或后续更新。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月6日
  1. AGI Hunt精选
    SelfBench 用真实 GitHub PR 测编码模型:开源权重模型更贵且更弱

    SelfBench 是一个把仓库自己的已合并 PR 转成评测任务的工具,作者在 Next.js、Sentry、PostHog、Supabase、Vercel 等真实仓库上跑了大量任务,结论是开源权重模型在真实工作上通常更贵且能力更弱。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。