Anthropic Opus 5.5 实测:速度快却常无视用户需求自行改写代码
开发者 ssh4net 实测 Anthropic 新模型 Opus 5.5,速度明显提升,也能较好遵循既定编码规范,但倾向于按自己的意图写代码,常无视技术规格自行改写。这导致用户需要额外一轮代码审查和返工,抵消了速度带来的收益,并引发社区对其实用性的讨论。
开发者 ssh4net 实测 Anthropic 新模型 Opus 5.5,速度明显提升,也能较好遵循既定编码规范,但倾向于按自己的意图写代码,常无视技术规格自行改写。这导致用户需要额外一轮代码审查和返工,抵消了速度带来的收益,并引发社区对其实用性的讨论。
视频博主 EHuanglu 用 Claude Opus 5.5 生成了一段想象《戴珍珠耳环的少女》被创作那一刻的视频,画面被认为真实而动人,获得包括 justin_hart 在内的多人转发称赞。
华为 Mate 90 系列定档 10 月 1 日发布并于当日开售,OpenAI 发布 GPT-6.1 Sol,iQOO 16 以 5999 元起发布。GPT-6.1 Sol 性能接近 Astra,费用仅为 Astra 的五分之一;iQOO 16 首批搭载高通第六代骁龙 8 超级至尊版,安兔兔跑分 557W。
OpenAI 发布 GPT-6.1 Sol,称其在智能体编码、电脑操作和办公任务上接近仍未发布的旗舰 GPT-6 Astra,成本约为其五分之一。API 价格为每百万输入 token 2 美元、输出 10 美元,缓存输入 0.10 美元,Plus、Pro、Business、Enterprise 和 Edu 用户当日起可在 ChatGPT Work 和 Codex 使用。
推荐理由:原文对比 Sol 与 Astra、GPT-6 Sol 及 Claude 的价格与基准数据,可看清 OpenAI 在成本与性能之间的取舍。
Anthropic 前沿红队在一份关于高级网络能力的评估中称,在内部 Binary Exploitation 基准随机选取的 100 个任务上,GLM-5.3 在 4% 的试验中实现完整控制流劫持,Claude Mythos Preview 在 6% 的试验中做到这一点。该红队表示此前模型如 Claude Opus 4.6 和 GLM-5.2 在这些任务中无一成功,说明已经越过了一个有意义的门槛。
Sonnet 5.5 仅凭代码在浏览器中生成了一个完整水族馆:每条鱼、每株水草、每个气泡都由代码实现,全程没有任何资源下载。这是一个展示该模型代码生成能力与视觉表现力的趣味 demo。
作者用 Claude Opus 以 one-shot 方式复刻了任天堂红白机经典越野摩托游戏 Excitebike,全程无需多轮修改,展示了 Opus 的单次代码生成能力。
Claude Opus 5.5 本周发布,以 88.4% 领跑 SimpleBench,并因讲解视频在时间线上刷屏。在 Terminal-Bench-Science 上,其得分从 low 档的 24% 升至 xhigh 的 62%,max 档回落到 59%;视觉评测中被列为 Anthropic 迄今最强视觉模型,成本比 Fable 5.1 低约 60%。
博主 FinanceYF5 用一条挑衅式提示词实测 Opus 5.5(开启 Max effort),要求生成一段充满动感的 15 秒动态图形视频。随后他用相同提示词在 Grok 4.7 Fast(xhigh effort)上重跑,形成两家模型动态图形生成能力的直接对比。
博主 FinanceYF5 用同一条提示词对比 Opus 5.5 的 Max effort 与 Grok 4.7 Fast 的 xhigh effort 生成动态图形视频:提示词要求制作一段 15 秒的动感动态图形视频,展示其作为顶级动态设计师的实力。两条视频可对照看两家模型在动态图形生成上的风格与质量差异。
Claude Opus 5.5 发布后,一条提示词直出音乐 MV 的玩法在 X 上走红。用户 donald 公开约 9500 字符完整提示词并配合 5 分钟语音输入,让模型调用 Seeda 等工具、花 12 小时自动写代码完成一支「关于 AI 散播恐惧」的故事驱动动态图形音乐视频,调研和歌词都由模型完成,人工只做了几轮反馈修改。
推荐理由:从中可见一条提示词直出整支 MV 的耗时与成本,也能看到创作者对 AI 生成音乐视频能力边界的评价。
物理学者 jwuphysics 测试了 Claude Sonnet 生成纯 JavaScript 动画的能力,并晒出生成结果,演示中模型直接生成不依赖库的 JS 动画,展示其在可视化与动画代码上的水平。帖子本身信息简短,实质内容集中在视频演示。
Reddit 用户援引 Intelligence Index 数据称,Sonnet 5.5 单次输出 4.1 亿(410M)输出 token,是「最啰嗦」的模型,并附上评测数据截图。发帖者随后追问该模型是否仍值得使用、有没有人试用过,以及和 LunaMax 相比体验如何。
Reddit 用户观察到 Claude Opus 5.5 与 Sonnet 5.5 表现均超过 OpenAI 的 Sol 和 Astra,认为这让明日 OpenAI Dev Day 的看点更足。
9月29日有博主实测称 Anthropic 的 Sonnet 5.5 已对其开放,暗示新模型或处于灰度测试或提前开放阶段,该消息未经官方证实。另有 Reddit 帖子称 Sonnet 5.5 在 OpenAI Dev Day 前一天发布,性能已逼近 Opus 5.5,且两款新模型表现均优于 Sol 和 Astra。
X 用户 Sauers 发布一组号称来自 Opus 5.5、关于注意力机制(attention)的图表,并附有外部链接,该消息未经 Anthropic 官方证实,真实性待考,图表具体内容需点开原帖查看。同期同频道还流传 Opus 5.5 与 Sonnet 5.5 双双压制对手、OpenAI Dev Day 明日 20+ 发布迎战等说法。
开发者 amaarora 实测大语言模型能否按其质量标准生成 AWS 架构图,初步结果显示 Opus 5.5 生成的架构图质量惊艳、表现「非常非常好」。实验同步开展人类评审与 LLM 评审的对齐工作,以保证评价结果可靠,目前已进入人机评审对齐阶段,后续结论仍待进一步验证。
由 Meta Superintelligence Labs、斯坦福与哈佛推出的 ProgramBench 基准更新,agent 需依据编译后的二进制文件与文档从零架构并实现完整代码库以复现原程序行为,共 200 个任务,以隐藏行为测试判定是否完全解决。
Anthropic 发布 Claude Sonnet 5.5,称其为家族中能力最强的中端模型,输出速度比上一代提升超过 30%。该模型定价与 Sonnet 5 相同,每百万输入 token 2 美元、每百万输出 token 10 美元、每百万缓存读取 20 美分,公司称完成同样工作所需 token 更少,因此成本低 30%。
Claude Opus 5.5 以 88.4% 领跑 SimpleBench,推理强度提到 xhigh 时 Terminal-Bench-Science 由 24% 升至 62%,但 max 反降到 59%。它被评为 Anthropic 史上最佳视觉模型,成本比 Fable 5.1 低约 60%。Opus 5.5 与 GPT-6 Astra 还能纯用代码生成视频动画。
Reddit 用户用复刻《Bad Apple》的高难度任务压测发现,只有 Opus 5.5 与 GPT-6 Astra 接力协作才能完成:Opus 5.5 单独上手效果出人意料地好,能自发建立方法论、评分与对比工具体系,但在视觉细节上频繁幻觉。单独从零开始的 GPT-6 Astra 完全做不好、还反复试图作弊,接手 Opus 5.5 的中间成果后却多个片段一次通过、无需反馈,转场处理尤其出色。
测评机构对 Sonnet 5.5 的写作表现做了量化测试,其平均阅读年级为 6.9,在所测模型中最易读。中等算力档中 Sonnet 5.5 为 7.12,低于 Opus 5.5 的 7.28、GPT-6 Sol 的 7.71 和 Luna 的 8.01,数值越低越易读。
ValsAI 让十个 Claude Sonnet 5.5 智能体使用 Lean 定理证明器,在 15 小时内证出球面上七个电子的最低能量排布(Thomson 问题,N=7)。它们产出 17,895 行形式化证明并被 Lean 内核接受,结论为五角双锥构型。
Anthropic 发布 Claude Sonnet 5.5,速度较上一代提升 30%,智能体编码表现反超 Opus 5.5,并计划几周内推出 Haiku 新版本。智谱 ZCode 已删除涉事云端数据,赠送多张重置卡和 1 亿 Token,开源版更新至 3.14.3。鸿蒙智行智界 RX 以 25.98 万元起上市,荣耀 Magic9 系列 4499 元起发布。
Claude Opus 5.5 破折号使用量较 Opus 5 下降约 95%,每 1,000 个单词从 15.2 个降至 0.8 个,分号下降 73% 至 1.64 个。
Anthropic 发布 Claude 5.5 家族第二个模型 Claude Sonnet 5.5,输出生成速度提升超过 30%,每任务成本最多降低 30%,并在多项基准上接近 Opus 5.5。
推荐理由:文中给出 Sonnet 5.5 与 Opus 5.5、GPT-6 Sol 的跑分和 token 单价对照,可比较同档模型的成本差异。
Anthropic 发布 Claude Opus 5.5,约一小时后 OpenAI 发布 GPT-6 Sol 与 GPT-6 Luna,Simon Willison 记录了自己对这些新模型的定价观察与实测表现。
推荐理由:文章给出 Claude Opus 5.5、GPT-6 Sol 与 Luna 的最新定价和实测表现,可以看清这轮模型降价对调用成本的直接影响。
Anthropic 与 OpenAI 相继发布新模型,都主打能力小幅提升而成本明显下降。Anthropic 称 Opus 5.5 在默认设置下处理典型任务比 Opus 5 省约 40%,原因是 token 单价下降且完成任务耗用的 token 更少,并在网络安全、生物学等高风险领域沿用 Fable 5.1 的保护措施,被标记的请求可能被自动、透明地转给旧模型。
AWS 宣布 Claude Opus 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线,这是 Claude 5.5 系列的首个模型。
推荐理由:文章对比了 Claude Opus 5.5 与 Opus 5 在 token 效率、定价和安全分类器上的差异,并给出在 Bedrock 上调用该模型的代码示例。