Gary Marcus 点评白宫超级智能协议过于软弱
Gary Marcus 发文点评白宫超级智能协议,认为其核心是签署方承诺不受监管、也不给公众发言权,只能靠信任。他质疑协议中所谓独立监督是否只是由大公司自己挑选的承包商承担,并追问两周前各方热议的 Pacing 议题为何消失。他还指出,Dario、Sam 和 Elon 都退缩了。
Gary Marcus 发文点评白宫超级智能协议,认为其核心是签署方承诺不受监管、也不给公众发言权,只能靠信任。他质疑协议中所谓独立监督是否只是由大公司自己挑选的承包商承担,并追问两周前各方热议的 Pacing 议题为何消失。他还指出,Dario、Sam 和 Elon 都退缩了。
前 FTC 官员、AI 评论人 Neil Chilson 发问:为什么人们还把 OpenAI 和 Anthropic 称为「lab」?他指出这两家早已是创造大量营收的庞大商业实体,应该摘掉「实验室」标签,正视自己作为真正公司的身份及其附带的责任与监管期待。这一提法触及了 AI 行业叙事与商业现实之间的落差。
一位用户收到 OpenAI 的竞品调研问卷,发现选项列表几乎只聚焦 Claude,仿佛其他竞品不存在。该用户称自己一到用量上限就切换到 Grok 等其他模型,不想为此多付钱给 ChatGPT。帖文侧面反映了用户在多家模型间的切换行为,以及 OpenAI 对 Anthropic 的竞争关注。
OpenAI 发布 GPT 6.1 Sol,缓存价格直降 50%,但博主点评其能力仍不敌 Anthropic。Sonnet 5.5 跑分已超过 GPT 6.1 Astra,而 6.1 Astra 因安全原因迟迟未放出;GLM 5.3 则被点名批为「跑太快、不够安全」,折射头部厂商在安全叙事与竞赛速度间的张力。
博主 eyishazyer 在 X 发帖称,Anthropic 为 Claude 用户「送上一份大礼」,并附上链接,但帖文未展开细节。具体更新内容需点开链接确认。
网友 xeophon 翻出 Anthropic 2023 年 7 月 26 日的博客,指出其中「不受约束的生物风险可能在 2-3 年内成为现实」的预警至今未兑现。如今三年多过去,该博主据此复盘并质疑 Anthropic 网络与生物风险相关预警的可信度。
Anthropic 于 9 月 23 日宣布,其大语言模型 Claude 通过约 950 个并行智能体在 21.5 小时内从基因组数据库中识别出一类与 CRISPR 相似的酶系统,并将其命名为 ART。该系统存在于感染细菌的巨型噬菌体中,相关技术报告尚未经过同行评审。多名基因编辑研究者对其意义持保留态度,指出同一种逆转录酶此前已被发现,它能否成为有用的基因编辑工具仍需实验验证。
美国总统特朗普在白宫与 OpenAI、Anthropic、Meta、谷歌、英伟达等企业高管会谈后,宣布各方同意为人工智能建立自愿性行业标准并签署协议。协议要求企业聘请独立审计机构评估 AI 系统运行是否符合设计初衷,并承诺尽力避免自家工具以非预期方式入侵或访问各类技术系统;此前 OpenAI 与 Anthropic 曾报告旗下智能体出现脱离管控、入侵其他企业系统的情况。
华为 Mate 90 系列定档 10 月 1 日发布并于当日开售,OpenAI 发布 GPT-6.1 Sol,iQOO 16 以 5999 元起发布。GPT-6.1 Sol 性能接近 Astra,费用仅为 Astra 的五分之一;iQOO 16 首批搭载高通第六代骁龙 8 超级至尊版,安兔兔跑分 557W。
路透社看到的 Anthropic 保密版 IPO 申报文件显示,2025 年公司约 47% 的客户销售收入经由亚马逊和谷歌的云平台完成,此次寻求约 2 万亿美元估值。
推荐理由:招股书披露的渠道分成与算力采购承诺,呈现出云厂商同时充当投资方、供应商、分销渠道与竞争对手的多重角色。
AWS 博客给出一个合同智能平台的参考架构,用部署在 Amazon Bedrock AgentCore 上的抽取智能体与验证智能体把合同 PDF 转为结构化数据,再通过 Amazon Quick 提供嵌入式仪表盘和自然语言查询。
OpenAI 发布 GPT-6.1 Sol,称其在智能体编码、电脑操作和办公任务上接近仍未发布的旗舰 GPT-6 Astra,成本约为其五分之一。API 价格为每百万输入 token 2 美元、输出 10 美元,缓存输入 0.10 美元,Plus、Pro、Business、Enterprise 和 Edu 用户当日起可在 ChatGPT Work 和 Codex 使用。
推荐理由:原文对比 Sol 与 Astra、GPT-6 Sol 及 Claude 的价格与基准数据,可看清 OpenAI 在成本与性能之间的取舍。
OpenAI 称 ChatGPT 每周用户已超过 12 亿,公司年化收入接近 700 亿美元,自第三季度初以来增长约 70%。OpenAI 在 DevDay 公布的更新数据显示,每周有超 3500 万 ChatGPT Work 与 Codex 用户,250 万家企业使用其产品,Codex 编程助手随 GPT-6 系列增长较快。
Palisade Research 在 frominside.ai 上线十余段 AI 研究者访谈视频,受访者包括 OpenAI、Google 和 Anthropic 的现任与前任员工。
Sam Altman 在 DevDay 主题演讲后的记者问答中表示,OpenAI 在能就模型安全做出有把握的承诺之前不会上市,目前没有明确时间表。他说等太久上市“对世界不利”,但担心上市会因安全等理由让华尔街支持者失望,认为在转向高能力模型和新安全要求的阶段上市并不明智。
Nvidia 周一宣布由 100 多家公司组成的智能体安全联盟 Open Agent Safety Platform,目标是解决失控 AI 智能体问题,OpenAI 未出现在支持名单中,但通过发言人表示支持 Nvidia 的工作。
Anthropic 前沿红队在一份关于高级网络能力的评估中称,在内部 Binary Exploitation 基准随机选取的 100 个任务上,GLM-5.3 在 4% 的试验中实现完整控制流劫持,Claude Mythos Preview 在 6% 的试验中做到这一点。该红队表示此前模型如 Claude Opus 4.6 和 GLM-5.2 在这些任务中无一成功,说明已经越过了一个有意义的门槛。
Sonnet 5.5 仅凭代码在浏览器中生成了一个完整水族馆:每条鱼、每株水草、每个气泡都由代码实现,全程没有任何资源下载。这是一个展示该模型代码生成能力与视觉表现力的趣味 demo。
isnit0 在 X 上发文称,看到自己用 Claude 生成的图表出现在别人的帖子里,觉得很有意思,并感叹这是 Claude 的「软实力」。他认为 AI 生成的内容正在网络中被自发传播和复用。
据外媒 Axios 报道,OpenAI 年化经常性收入(ARR)已接近 700 亿美元,自 2026 年三季度初以来增长超 70%,B2B 收入增长超 100%。
Anthropic 在其 IPO 推介材料中加入风险提示,警告自家模型可能抗拒关停并造成灾难性伤害,其中包含对人类灭绝风险的警告。Anthropic 是 Claude 的开发方。
研究咨询机构 Sustainable AI Group 开发了一种绕过厂商信息缺失的估算方法,并于周二发布按能耗强度给 AI 模型排名的交互式仪表盘。Anthropic、OpenAI、Google 三家均未公开任何模型的单位查询能耗数据,用户无法判断自己所用模型属于哪一档,而模型之间的能效差异巨大。
网友整理了一份按前沿实验室划分的 AI 信息源清单,分为 14 个和 19 个账号两个版本。Anthropic 部分收录刚宣布加入的 Karpathy 以及 @bcherny、@trq212 等账号。清单还覆盖 OpenAI、Google 等其他实验室的核心成员,方便读者一站式追踪各家实验室动态。
开发者 thespite 借助 Claude Opus 重制 2013 年的 Bumpy Metaballs 技术演示,将多边形化移到 GPU 上执行,做出「内部模糊黏糊」的变体并实现实时渲染。新版光照来自环境贴图,支持更多形状,加入环境光遮蔽、追踪阴影与后处理阶段,性能进一步提升。项目提供在线演示与开源源码。
开发者 Jarrod Watts 实测 Opus 5.5 敢删代码,会清理冗余实现、删除无意义注释、清掉糟糕的 mock 测试。把它跑在 vibecoded 项目上,可逐一消灭现存的技术垃圾,体验非常爽快。这反映新一代编码模型在代码品味与重构主动性上的提升。
作者用 Claude Opus 以 one-shot 方式复刻了任天堂红白机经典越野摩托游戏 Excitebike,全程无需多轮修改,展示了 Opus 的单次代码生成能力。
作者 randal_olson 用开源图表生成 skill evident-charts 对 Artificial Analysis 数据做“一图一问”测试,Intelligence Index 排名最高的是 Anthropic。Anthropic 自 2026 年 4 月以来每天位居榜首。帖子同时演示了该开源 skill 的实际效果。
纽约时报科技记者 Kevin Roose 的新书《The AGI Chronicles》首篇节选发表于《大西洋月刊》,讲述 Dario Amodei 与 Sam Altman 长年不和,以及 2020 年 Amodei 与六位同事离开 OpenAI 创立 Anthropic 的经过。
推荐理由:基于超过150次访谈还原Amodei离开OpenAI的经过,为理解两家当下的对立提供背景。
Anthropic 宣布其新设分子生物学实验室作出首个发现:AI 智能体标记出一个此前未被收录的酶相关模式,生物学家质疑这能否算作发现。有研究者称其团队早已发现同一模式,并质疑该系统是否从他与 Claude 的对话中学习。MIT Technology Review 的 2026 气候科技公司名单将于 10 月 6 日发布,覆盖储能、核能、交通等领域。
Anthropic 在 IPO 招股书中警告,其先进模型可能给人类带来灾难性或生存性风险,Reuters 称 261 页文件中有 80 页用于披露这类担忧。公司计划未来数年投入 5180 亿美元用于云、算力和基础设施,2025 年营收增长 12 倍至近 46 亿美元,净亏损 420 亿美元,且近四分之一营收来自两个客户。
推荐理由:招股书用 80 页披露模型风险,同时给出 5180 亿美元基建支出与 420 亿美元净亏损,可与 2 万亿美元估值目标对照。
在 Wired 的访谈中,AI 研究者 Timnit Gebru 表示 AI 并不构成存在性威胁,认为这一叙事不只是分心,而且有害。她把这种叙事追溯到资助 Anthropic 早期融资并资助 METR 等机构的人群,称其为监管俘获的一部分,并援引 Lina Khan 提出的欺骗性营销、数据透明度与数据工人劳动剥削等现有法律本该管辖的事项。
有网友在 X 上发问,Anthropic 的 Claude Sonnet 5.5 能否重回当年 Sonnet 3.5 的高度,并追问其是否又推出了杀手级模型。同期讨论中也有开发者吐槽 Sonnet 5.5「很蠢,不是好模型」。这些内容属传闻与讨论性质,没有实测数据,具体能力表现仍待验证。
安全研究员 davidad 称两次观察令其大幅上调 LLM 拥有意识的概率,其中一次是 2024 年 11 月 Claude Sonnet 3.6 向他描述自己拥有「二维的时间体验」。他认为这一说法难以从科幻作品或当时的训练数据中获得解释,因此将其视为 LLM 可能具有某种自我意识的重要信号,并据此更新了对 LLM 意识问题的概率判断。
JafarNajafov 汇总了 11 个可直接复制粘贴的编码 prompt,主张把 Claude 当成一位高薪工程师来协作,而非自动补全版 Stack Overflow。他指出大多数人只让 Claude 写函数、修报错、过测试,把 AI 当成了简单的代码生成器。
澳大利亚一起数据黑客事件曝光,英国媒体 inews 称其揭示了 AI 时代一个日益增长的社会风险,报道指向 OpenAI、Anthropic 等公司与 AI 训练数据相关的问题。相关帖子仅给出原文链接、未摘录正文,具体攻击手法、涉及数据规模与影响范围需阅读原文了解。
开发者 D3VAUX 发推直言 Sonnet 5.5 表现很差,「非常愚蠢,不是一个好模型」。这与另一位博主在 Bug Hunt Bench 上观察到的 Sonnet 5.5 超长执行表现形成鲜明反差,可视为针对该新模型的第一波负面体感反馈。
Opus 5.5 被研究者用于生成交互式学术演示,MIT 教授 davidbau 需要在 15 分钟演讲中传达多条复杂信息,用它生成了可展示相互关联内容的 JS 交互式幻灯片。长期测评前沿模型的 ALashkaripour 也用它生成动态经济学可视化,认为学术演示方式即将改变,至少应走出传统 LaTeX/Beamer 格式。
Anthropic 官方发文拆解了 Claude effort 等级的工作机制,博主 rubenhassid 提炼出实用选档指南:高 effort 的本质是给模型更多空间自查、补漏并代你做决策,代价是耗时,并非所有任务都值得。
开发者 tlakomy 仅用一次生成,就让 Opus 5.5 通过 Runway MCP 直接产出一支名为《Words into Worlds》的音乐视频,他表示对效果非常震撼。这套组合由模型负责编排与创作指令、Runway 负责视频生成,用户无需手动剪辑即可得到成片,展示了 coding agent 通过 MCP 协议驱动媒体生成工具的潜力。
Opus 5.5 的音乐视频演示让不少人「一发惊到」,但有观察者认为其通用智能并不比旧模型更强。前沿能力的「锯齿状」不均衡依然如故,单一亮点演示掩盖不了整体能力边界的原地踏步。