曝疑似大模型评测套用缓存答案:6.1 sol、6 astra 被指「dirty looping」
AI 评测账号 scaling01 发帖「spot the looper」,指 6.1 sol 和 6 astra 在 benchmark 中疑似直接套用缓存答案、循环输出而非真实推理,即所谓「dirty looping」。对比中 5.6 luna/sol 与 6 luna/sol 均无问题,只有这两个版本被标为可疑(SUS),由此引发对评测作弊的质疑。
AI 评测账号 scaling01 发帖「spot the looper」,指 6.1 sol 和 6 astra 在 benchmark 中疑似直接套用缓存答案、循环输出而非真实推理,即所谓「dirty looping」。对比中 5.6 luna/sol 与 6 luna/sol 均无问题,只有这两个版本被标为可疑(SUS),由此引发对评测作弊的质疑。
一位 Reddit 用户实测 MiniMax-H3 的发音能力,用「camel toes」「cameltoes」以及 toze、tohz、tows 等多种拼写组合测试,模型都念不对。该用户开玩笑称,怀疑模型内置了刻意加缺陷的机制,好让用户为「完整版」付费。
研究者用 Values Survey Module 2013 审计 TypeSafe 决策式模型 JEV 的文化价值观,以沙特与美国人格设定、英语和阿拉伯语收集 288,000 条答案。JEV 回答高度可重复(ICC 0.997),无人格时接近其美国人格;沙特人格下向人类沙特-美国差异移动,英文复现 87%、阿拉伯语 62%,长期取向反转。
6 个视频、97 格人工标注的横测显示,LLM 漏提取的瓶颈在 ASR 分段切断而非模型能力。本地 CLI + Google One Pro 下 gemini-3.7 与 3.8 均达 91/97 = 93.8%,逐视频分数和错误完全一致,但 3.8 慢 5-6 倍。3.6、3.7-medium、3.7-high 在同一视频都漏掉同样 4 格,DeepSeek V4 Flash 仅 71/97。
新基准 CineSubBench 用多语言电影字幕评测 LLM 的长篇叙事与文化理解,覆盖 1,012 部电影、六种语言、6,072 条字幕轨和 8.13M 条带时间戳字幕条目。
在拍卖与匹配这类规则明确的多智能体环境中,简单的机制界面能引导 LLM 智能体做出更好决策:跨四个模型家族,升价拍卖界面大幅降低出价偏差。列出收益情形并解释说真话为何安全同样改善选择,而要求规划匹配轮次或推测对手信念的提示词整体拉低表现。拍卖中的行为提升并未同步反映在智能体简短计划的可测战略理解语言指标上。
FABLE 数据集用 174K 条真实用户提示词生成 190,911 条英文提示词变体,测量非母语英语对大语言模型用户表现的影响。在 34 个开放权重 LLM 上的评测显示,模型不会把拼写错误带入输出,却会复制提示词中更高层的修辞与词汇特征。最流畅与最不流畅提示词的答案质量差异显著,非母语英语用户得到质量更低、流畅度更差的回答。
PADMÉ 用小型语言模型合成 LM 智能体评估器的偏好对齐元评估数据,无需人工参与。其原型在 4 个智能体领域、3 项评估标准下合成 1,000 条样本,150 条子集的人工验证显示与人类判断的一致率从朴素基线的 73% 升到 85%。用该数据集元评估 25 个常见模型,显示评估表现与评分粒度、宽松度和模型规模相关。
CruxBench 是按信息价值(VOI)给 LLM 生成问题打分的新基准,用于衡量模型将难题拆解为关键子问题(cruxes)的信息发现能力。其 ground truth 来自未来真实事件,天然抗污染,支持开放式文本提交,在 293 个预测问题上评测了 8 个模型。VOI 与模型能力的独立度量相关性达 r=0.90,但信息发现对前沿 LLM 仍困难,仅略高于随机时序基线。
首个 EU AI Act 合规检查器(AIACC)实证研究评估 12 款主流工具,发现其质量差异显著,目前只能充当早期方向指引工具。这些工具交互模式与易用性不一致,倾向过度简化或遗漏关键义务,无法提供确定、可执行的指导,依赖其可能带来虚假的合规感。研究据此提出更可靠合规支持工具的设计原则。
免训练的通用概率决策模型 Jev 在 WISDM、UCI341、PAMAP2 上最强表示 macro-F1 仅 0.038、0.118、0.089,远低于监督 HAR 模型的 0.686–0.907。
扫描 8 种智能体编排架构与 5 个 7-9B 指令微调模型后发现,小 LLM 团队扩展收益高度依赖任务:调用数从 3 增至 30,GSM8K、GSMHard 准确率最多涨 17 分,ARC、GPQA、MMLU 最多涨 4 分。
BreakingWeb 用受控环境干预改造浏览器智能体已能解决的任务,使其平均通过率下降 22.9%。基准含 7 个自托管网站的 519 对原始/干预任务和 29 类干预,并推翻各智能体近半数原本能干净解决的任务。人类首次尝试仅下降 10.0%;六款智能体 75% 的失败属“信念失败”——变更未发生却宣称成功,代码、数据与环境已公开。
车载对话助手(ICA)的多轮对话能力评估有了自动化框架:闭环仿真结合策略引导的用户模拟器与对抗式策略管理器,由两级 LLM 评判器评估单轮失败和整段对话质量。在一款工业级 ICA 上用 6 个 LLM 后端和 12 名人工标注者验证,自动评判与人类一致性较高;策略引导比无引导仿真每段对话多发现 2.96 倍独特失败类型,独特失败对话数翻倍以上。
研究发现,对决策任务中的原始提问做扰动式改写,可缓解部分大语言模型的偏见与幻觉,结论与此前研究相反。在多数数据集任务上 Claude 3 表现更有效,GPT3.5 则参差不齐,部分场景相当、部分明显落后,模型间差异显著。该研究发表于 ICONIP 2024,强调需通过严格测试与验证来保证 LLM 决策辅助工具的可靠性。
研究提出面向开放世界空中目标搜索的大规模基准套件 AerialDojo-200K,其场景数与任务实例数分别达现有最大同类基准的 3 倍和 18.7 倍。该套件含 42 个仿真场景和 205,732 个任务实例,并提供 21 个分布内与 21 个分布外场景的统一评测框架。对 5 个开源和 4 个闭源多模态大语言模型的评测显示,通用空中智能体仍有很长的路要走。
lefthanddraft 在 X 分享文章《The Measure of a Model》,由 vooooogel 转发,主题围绕如何评估与衡量模型的价值展开。原文仅给出链接,未附正文摘要。
开发者 ssh4net 实测 Anthropic 新模型 Opus 5.5,速度明显提升,也能较好遵循既定编码规范,但倾向于按自己的意图写代码,常无视技术规格自行改写。这导致用户需要额外一轮代码审查和返工,抵消了速度带来的收益,并引发社区对其实用性的讨论。
创业者 Bindu Reddy 横评多款前沿模型,GPT 6.1 SOL 与 Astra 在推理、数据分析和浏览器操作上表现出色,Fable 与 Opus 则擅长编码。但 Fable 与 Opus 在数据分析等任务上表现很差。其结论是没有万能模型,选哪个取决于具体使用场景。
Reddit 用户实测用 Sol 6.1 Max 在 Blender 里写游戏代码失败,修了十分钟后仍救不回来。该用户原本指望 Sol 6.1 Max 顶替 Astra、从而接受用量缩水,但两张截图显示从起步就彻底失败、十分钟后效果依旧糟糕。作者的结论是「Sol 6.1 Max + Blender 做游戏」不可行,不足以弥补限制下调。
新基准 CineSubBench 用 1012 部电影、6 种语言的 813 万条带时间戳字幕,评估 LLM 的长上下文叙事与文化理解。它设 7 项任务,覆盖叙事重建与抽象、类型预测、年龄适宜性及 10 国分级体系。对九个 LLM 的评测显示,情节梗概还原比完整事件概要更可靠,跨语言一致性因模型与语言差异显著,强脏话远比轻度粗俗语更易识别。
研究员 michellechen 在 x 上指出,仍有团队用 2019 年的常识推理基准 HellaSwag 评测模型。HellaSwag 早已被前沿模型刷到接近饱和,这句吐槽戳中了评测体系更新滞后的行业惯性。
博主 @gbrulte 分享在伦敦通过 Uber 试乘 Wayve 监督模式自动驾驶,称驾驶平顺、能很好处理旧金山式车流并完成高速并线。他评价 Waymo 仍是当下明显领先者,但 Wayve 势头强劲,在旧金山和拉斯维加斯的乘坐体验好于 Zoox、无路口问题且更平顺,整体接近 Tesla Robotaxi,何时去掉监督是下一步关键。
一位 20x Pro 重度用户实测算账,6 小时的 Sol 6.1 medium 双会话 React/API 开发消耗了 18% 的周用量。按 10 月 29 日后的新政策,同等使用只能换来约 20 小时连续 agent 运行时间,升级到 $500/月预计也只有 46 小时。帖子反映了用户对 Claude 用量额度收紧的不满。
一位图像创作者实测后认为,T2I 任务上 Krea 2 比 Qwen 2.1 更胜一筹。同样提示词增强下,Qwen 2.1 出图偏真实照片质感、纹理发灰,默认人物偏亚洲/动漫风,需加「West cartoon semi-realistic style」纠正。他偏好半写实卡通风格,此前用 Krea 2 Turbo 工作流几乎次次命中。
作者用 RTX 5090 配合 ComfyUI 在本地实测 MiniMax H3 生成 30 秒长打斗场景,经数十次控制变量渲染给出配置结论。打斗动作建议用 HyperFlow 8 步且不加 LoRA,放大 pass 加 taomate 3-step LoRA 时武器一致性与运动质量最佳,对话或慢节奏仍用 4 步 turbo。
作者用 Claude Opus 以 one-shot 方式复刻了任天堂红白机经典越野摩托游戏 Excitebike,全程无需多轮修改,展示了 Opus 的单次代码生成能力。
作者 randal_olson 用开源图表生成 skill evident-charts 对 Artificial Analysis 数据做“一图一问”测试,Intelligence Index 排名最高的是 Anthropic。Anthropic 自 2026 年 4 月以来每天位居榜首。帖子同时演示了该开源 skill 的实际效果。
前雅虎 CEO Marissa Mayer 公开个人 AI 助手 Dazzle,它只从手机相册提取上下文,不用邮箱、日历或购物记录。该产品去年 12 月完成 800 万美元种子轮,功能分为两类:用近期照片处理即时任务,例如按活动传单填日历;以及基于相册给出假期和礼物建议。记者实测中它推荐了地中海目的地,却没记住女儿已经会轮滑;Mayer 强调 Dazzle 会丢弃被判定为敏感的个人信息。
Cloudflare 让前沿大语言模型充当攻击者,针对授权客户的预发布环境发起 1,107 次攻击尝试,覆盖 XSS、SQLi、CMDi、SSRF、路径遍历和 Log4j 六类攻击,绝大多数请求被其 WAF 拦截。
Claude Opus 5.5 本周发布,以 88.4% 领跑 SimpleBench,并因讲解视频在时间线上刷屏。在 Terminal-Bench-Science 上,其得分从 low 档的 24% 升至 xhigh 的 62%,max 档回落到 59%;视觉评测中被列为 Anthropic 迄今最强视觉模型,成本比 Fable 5.1 低约 60%。
SciHorizon-eLab 是一个智能体式协议到任务编译器,可将自然语言科学实验协议经语义落地、可执行任务合成与多阶段仿真认证编译成保义的具身任务。其构建的基准包含 300 个已认证任务,覆盖多种实验室操作,支持 HIL 任务执行、专家演示复现生成与有序步骤级评估。代表性任务上最强策略平均成功率仅 49.7%,暴露人机与具身智能体协同的明显短板,代码、基准数据与评测工具已公开。
arXiv 论文基于 38 篇原始文献提出 TRG(Timing-Recovery-Grounded)报告标准,用时序、中断后恢复与状态验证结果三轴刻画实时语音智能体。
HARDEN 提出一种约束进化搜索方法,在保持期望输出不变的前提下把现有评估用例改写成更难变体,并强制语义、真实性与执行有效性等可行性约束。在 FinQA、PubMedQA、ContractNLI 及 Qwen3.5 三种规模(35B-A3B、122B-A10B、397B-A17B)上,HARDEN 平均降低任务准确率 22.7%,相对单次通过基线最多降低 49.9%。
JevBench 作者 @airesearch12 回击「靠 vibes 和信任选模型」的说法,称靠感觉挑模型是自欺,或是在掩饰模型开发领域没有护城河。他承认 benchmark 不完美,但认为它仍是目前最好的客观、科学代理指标。JevBench 刻意设计成无法被 benchmaxxed:每次发布都更换指标与测试集构成,站点还提供号称全球首个 benchmaxxing 分数。
博主 FinanceYF5 用一条挑衅式提示词实测 Opus 5.5(开启 Max effort),要求生成一段充满动感的 15 秒动态图形视频。随后他用相同提示词在 Grok 4.7 Fast(xhigh effort)上重跑,形成两家模型动态图形生成能力的直接对比。
博主 FinanceYF5 用同一条提示词对比 Opus 5.5 的 Max effort 与 Grok 4.7 Fast 的 xhigh effort 生成动态图形视频:提示词要求制作一段 15 秒的动感动态图形视频,展示其作为顶级动态设计师的实力。两条视频可对照看两家模型在动态图形生成上的风格与质量差异。
Nicolas Keller 团队发布 Reality Check,这是首个公开的机器人操作(manipulation)评测基准与排行榜,包含 14,400 次真实世界 rollout 测试,覆盖 4 个模型、物体放置等多种任务与数据规模。
World of AI 周报用自建工具 woaibench.ai 实测 Claude Sonnet 5.5,并与 GPT-6 Sol、GPT-6 Astra、Opus 5.5 对比,认为 Anthropic 正强势回归。
GSO 榜单作者 slimshetty 更新称,该榜单已接近饱和,很难再区分前沿模型,并判断任何 benchmark(包括他自己做的)预计至少约 5% 的任务本身存在质量问题。这被视为对评测体系局限性的第一手坦承,对解读各类跑分榜有参考价值。