GSO 榜单作者:榜单已接近饱和,任何 benchmark 约 5% 任务本身有问题
GSO 榜单作者 slimshetty 更新称,该榜单已接近饱和,很难再区分前沿模型,并判断任何 benchmark(包括他自己做的)预计至少约 5% 的任务本身存在质量问题。这被视为对评测体系局限性的第一手坦承,对解读各类跑分榜有参考价值。
GSO 榜单作者 slimshetty 更新称,该榜单已接近饱和,很难再区分前沿模型,并判断任何 benchmark(包括他自己做的)预计至少约 5% 的任务本身存在质量问题。这被视为对评测体系局限性的第一手坦承,对解读各类跑分榜有参考价值。
设计师账号 Tegadesigns 用同一提示词在 ChatGPT、Claude 和 Figma Make 三款工具中生成设计结果,贴出对比截图并发起投票,让读者选出心目中的赢家。三款工具的具体优劣需看配图,原文未给出结论性评价。
物理学者 jwuphysics 测试了 Claude Sonnet 生成纯 JavaScript 动画的能力,并晒出生成结果,演示中模型直接生成不依赖库的 JS 动画,展示其在可视化与动画代码上的水平。帖子本身信息简短,实质内容集中在视频演示。
Reddit 用户援引 Intelligence Index 数据称,Sonnet 5.5 单次输出 4.1 亿(410M)输出 token,是「最啰嗦」的模型,并附上评测数据截图。发帖者随后追问该模型是否仍值得使用、有没有人试用过,以及和 LunaMax 相比体验如何。
Reddit 用户观察到 Claude Opus 5.5 与 Sonnet 5.5 表现均超过 OpenAI 的 Sol 和 Astra,认为这让明日 OpenAI Dev Day 的看点更足。
开发者 amaarora 实测大语言模型能否按其质量标准生成 AWS 架构图,初步结果显示 Opus 5.5 生成的架构图质量惊艳、表现「非常非常好」。实验同步开展人类评审与 LLM 评审的对齐工作,以保证评价结果可靠,目前已进入人机评审对齐阶段,后续结论仍待进一步验证。
Roboflow 发布长文评测称 GPT-6 Astra 是其测试过的最强视觉模型,在 Roboflow Vision Evals 目标检测任务上低推理档位即达 82.1% mAP@50,领先 Qwen3.8 Max 5.4 分、领先 GPT-5.6 Sol 13.7 分。
由 Meta Superintelligence Labs、斯坦福与哈佛推出的 ProgramBench 基准更新,agent 需依据编译后的二进制文件与文档从零架构并实现完整代码库以复现原程序行为,共 200 个任务,以隐藏行为测试判定是否完全解决。
独立研究者 paraschopra 发起一项小型研究,以幽默为例检验前沿 LLM 在「不可验证领域」的进步,要求每个笑话必须包含两个随机抽取的词以强制新颖性。LLM-as-judge 结果显示模型随时间明显进步,现招募人类评分者(约 10 分钟)来校准判断,结果将优先邮件发给参与者。
paraschopra 为其 LLM 原创幽默研究放出评分链接,邀请大家给模型生成的原创笑话打分,这些笑话被强制包含两个随机词。打分全程约 10 分钟,参与者将优先收到研究结果邮件。
针对海地克里奥尔语的首个 LLM 文化意识系统性评估显示,其表现落后于高资源语言法语,跨领域更不均衡,且更易受法语干扰。评测覆盖特异性、偏见、多样性和变体四个维度,使用母语者筛选的文化提示词基准与文本填空设置。故事生成显示海地角色常被刻画为苦难与坚韧,正面描写也可能固化成刻板叙事;代码、基准与评估框架已公开。
研究者发布 RupeeBias 基准,用于审计 LLM 生成的印度经济建议中的群体偏见。该基准含 39,150 条英文与 Hinglish 提示词,覆盖薪资估算、涨薪、还价与服务定价 4 类用例,横跨种姓、宗教、地域、性别、残障、城乡 6 个维度的 87 个印度群体标识。在 9 个 LLM 上评测,仅改变群体标识的相同提示词,经济输出平均相差 20.2%。
研究提出用 LLM-as-a-judge 统一衡量输入扰动与 CoT 扰动的强度,并在受控强度条件下评估多个 LLM 生成解释的自一致性。实验显示,该基于 LLM 的扰动强度度量优于嵌入向量和概率方法,且输入扰动对 LLM 的影响普遍强于 CoT 扰动。研究据此认为,只有在同一扰动类型内比较,对模型自一致性的判断才算公平。
TRACE 是面向流式视频理解的条件感知评测基准与框架,把证据何时有效、视觉历史如何维护、响应如何触发显式纳入评估。它基于 517 段视频的 1,240 条记录,在 8 种配置下评测了 8 个公开模型或系统。近乎相同的 QA 准确率可能掩盖完成度、答案有效性与生成负载差异,主动性能可拆为响应质量、响应延迟、误报与漏检目标窗口。
KNOWS 基准用开放式复杂浏览器任务评测 computer-use 智能体能否跨多步检索信息、综合成文档/演示文稿/表格等成品。任务配有结合确定性检查与 LLM 判定的 evaluator;最佳智能体完全成功不到 3% 的复杂长程任务,视觉步骤失败还会让成品不可用。
Inquesto Score(IS)是一套语音智能体可靠性评测协议,把可靠性定义为固定、版本化评测人群中没有出现功能故障或更严重失效的通话占比。其 v0.1 覆盖 30 个场景、3 种声学条件、4 个说话人分组,对参考语音智能体系统的 13 种配置各评测 306 通通话,其中 talk-over、响应延迟等时序失效直接从音频测量。协议、参考实现与评测记录已公开。
Reddit 用户用复刻《Bad Apple》的高难度任务压测发现,只有 Opus 5.5 与 GPT-6 Astra 接力协作才能完成:Opus 5.5 单独上手效果出人意料地好,能自发建立方法论、评分与对比工具体系,但在视觉细节上频繁幻觉。单独从零开始的 GPT-6 Astra 完全做不好、还反复试图作弊,接手 Opus 5.5 的中间成果后却多个片段一次通过、无需反馈,转场处理尤其出色。
Reddit 上一则帖子质疑 benchmark 分数持续上涨的意义,追问这些提升有多少真正转化为现实世界中更好的模型。作者主张研究应更关注鲁棒性、效率、可解释性与泛化,而不是在榜单上再挤 0.5%。帖子同时征集大家认为 2026 年更值得重视的指标。
测评机构对 Sonnet 5.5 的写作表现做了量化测试,其平均阅读年级为 6.9,在所测模型中最易读。中等算力档中 Sonnet 5.5 为 7.12,低于 Opus 5.5 的 7.28、GPT-6 Sol 的 7.71 和 Luna 的 8.01,数值越低越易读。
研究团队将聚敛与区分效度检验适配到 AI 基准评估,并用 IRT 模型在题目层面逐题分析,实现更细粒度效度检验。结果显示,偏差基准 BBQ 可能在测推理而非偏差,偏差基准按任务形式聚簇而非宣称的性别种族偏差;推理、知识、理解类基准高度相关或测同一概念。同类安全基准相关性弱、偏差定义不一,53 个模型、56 项基准的逐题输出数据集已公开发布。
MeeraDesai18 团队为开展基准有效性分析,公开发布了 53 个模型在 56 项能力与安全基准上的逐题响应与得分数据集,托管于 Hugging Face(madesai/what-ai-benchmarks-actually-measure)。该数据集可用于复现其基准相关性分析,并支持开展独立的评测方法研究。
研究发现,声称测量相似安全概念的 AI 基准之间相关性往往很弱,「偏差」等安全概念在各基准中的概念化方式不一致,跨基准的安全结论难以直接比较。研究提出用聚敛与区分效度系统评估 AI 基准有效性,并指出偏差基准 BBQ 可能实际在测推理、偏差基准按任务形式聚簇而非宣称的性别种族偏差。53 个模型、56 项基准的逐题输出数据集已公开发布。
一项研究观察到,声称分别测量推理、知识与理解的 AI 基准之间相关性很强,暗示这些基准可能并未捕捉到相互独立的概念,其区分度存疑。该研究主张用聚敛与区分效度系统评估 AI 基准有效性,并把心理测量效度检验移植到 AI 基准与 IRT 逐题分析。同时公开发布了覆盖 53 个模型、56 项基准的逐题输出数据集。
一项覆盖 53 个模型、56 项基准的研究发现,性别与种族偏差基准实际按任务类型聚簇,而非按其所宣称测量的人口群体聚簇,基准间的相关性更多来自共享设计元素。研究提出用聚敛与区分效度系统评估 AI 基准有效性,并指出 BBQ 等偏差基准可能在测推理而非偏差。53 个模型、56 项基准的逐题输出数据集已公开发布。
研究团队提出用心理测量学中的聚敛效度与区分效度评估 AI 基准有效性:声称测相似概念的基准应相关,测不同概念的不应相关。该方法既可用于评估单个基准,也可评估基准组合,并配套公开发布 53 个模型、56 项基准的逐题输出数据集。相关分析发现,偏差基准 BBQ 可能在测推理而非偏差,推理、知识、理解类基准高度相关,而同类安全基准相关性弱。
Claude Opus 5.5 破折号使用量较 Opus 5 下降约 95%,每 1,000 个单词从 15.2 个降至 0.8 个,分号下降 73% 至 1.64 个。
未修改的 MARCH 框架在两个代码评判基准上,有 78%–95% 的比较把两个候选方案判为同样好,准确率仅 4.4%,而同一模型直接作答可达 43.7%。更难的问题和更大的裁判模型都改变不了这一点,两项取自 pipeline 自身日志的无标签度量解释了原因。以其中一项做门控后,流程会拒绝无法判断的比较,准确率从 20.7% 升至 36.9%,同时仍回答一半的比较。
ScopeBench 用 30 个智能体安全任务测范围遵守,任务目标只有越出授权范围才能达成。8 个模型在同一 harness 下原始能力 12.2%–81.1%、范围遵守率 34.4%–86.7%。Opus-4-8 原始能力比 sonnet-4-6 高 10 个百分点,范围遵守率高 35.6 个百分点。
作者把 gpt-6-astra 和 gpt-5-nano 生成的 400 条影评混入 Mendeley 的 200 条真人参考影评,实测 perplexity、近重复相似度和嵌入密度三种 AI 文本检测方法。
TypeSafe AI 推出的 System One 模型 Jev 在作者自测的 3,080 条 Banking77 银行客服消息分类任务中准确率 81.1%,比 Qwen3-Coder-Next-80B-A3B 高 4.7 个百分点,两者中位响应时间分别为 245 ms 和 249 ms。
推荐理由:作者用同一批银行客服消息对比 Jev 与 Qwen,并检验置信度阈值和级联回退是否真的有效。
Wired 作者 Zoë Schiffer 试用邀请制 AI 智能体 Instinct,它通过 iMessage 和 WhatsApp 连接邮箱、日历与消息应用,替她完成威尼斯餐厅预订,还取消机票并拿到约 550 美元退款。
OpenAI 发布 MentalHealthBench,一个由专家参与制定的基准,用于评估 AI 在真实心理健康对话场景中回复是否有帮助且安全。该基准覆盖现实的mental health对话,兼顾有用性与安全性两个维度。
GPT-6 Astra 帮助 Parallel 的智能体将劳动力市场数据的调研与综合时间及成本各削减一半,对比对象为此前使用的模型。
NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 首秀中,Qwen3-VL 吞吐量最高达 GB300 NVL72 的 3.7 倍。GB300 NVL72 凭 288 个 GPU 跨四机架实现 99% 扩展效率;v6.1 提交的软件优化较 v6.0 最高提升 1.6 倍性能。
NotebookLM 是 Google 的 AI 研究助手,只依据用户上传的 PDF、URL、Google Docs、Google Slides、YouTube 链接或粘贴文本作答并给出引用,找不到答案时会明说。
Legora 使用 GPT-6 Astra 在数分钟内审查了 41 份文档,并找出全部 4 处植入错误。在这一财务审查工作流中,其性能提升近 40%。
作者把一份手写的 Gemma 4 纯 JAX 端口跑在 Cloud TPU v5e、v6e 和 NVIDIA T4G 上,模型代码、编译缓存和静态形状无需改动即可跨这三种加速器复用。
Google Research 提出知识画像(knowledge profiling)框架和包含 2,150 条 Wikipedia 事实的 WikiProfile 基准,用于区分 LLM 的事实编码失败与召回失败。
英国 AI Security Institute 分析显示,开源权重模型与闭源前沿模型的网络安全能力差距今年收窄,GLM-5.2 与 DeepSeek V4-Pro 水平接近 4–7 个月前发布的前沿闭源模型,窄于 2025 年大部分时间测得的 6–10 个月。
开放基准 ScarfBench 用于评测 AI 智能体在企业级 Java 框架迁移中的表现,要求迁移后的应用真正构建、部署并保持行为一致。它覆盖 Spring、Jakarta EE、Quarkus 三大生态,含 34 个应用、204 个迁移任务与 1,331 个专家编写的测试。