开发者实测:GPT-5.6 Sol 发布数周后被悄悄降级性能
一位在 Unity 开发中重度使用 GPT-5.6 Sol 的开发者实测指控,该模型发布后 3-4 周内性能持续下滑,连最初能解决的简单问题都会陷入无限循环,如今表现仅略好于价格便宜得多的 Grok。他据此认为 OpenAI 在用户养成使用习惯后,悄悄降级其判定为「太贵」的模型以提升利润率,且未向任何人说明。该指控属用户单方面感受,OpenAI 未回应,降级说法未经证实。
一位在 Unity 开发中重度使用 GPT-5.6 Sol 的开发者实测指控,该模型发布后 3-4 周内性能持续下滑,连最初能解决的简单问题都会陷入无限循环,如今表现仅略好于价格便宜得多的 Grok。他据此认为 OpenAI 在用户养成使用习惯后,悄悄降级其判定为「太贵」的模型以提升利润率,且未向任何人说明。该指控属用户单方面感受,OpenAI 未回应,降级说法未经证实。
OpenAI 在 DevDay 坚持真机现场直播演示,过程中出现翻车、招致部分嘲笑,但仍获网友和员工力挺。网友 kwuchu 称敬佩 OpenAI 不造假、坚持实况演示,并形容其超高速演示已「疯魔」;一位 OpenAI 员工则表示,现场直播的不可预测性远胜预录的企业级精修视频。
AI 学者 Ethan Mollick 发推批评 OpenAI 产品线在短暂聚焦 ChatGPT 主应用后再度混乱:Dot、Spaces、Pages 与本地/云端版 ChatGPT Work 等产品并存,功能定位交叉、权限划分不明。他此前曾期待 OpenAI 收敛产品线,如今认为公司又回到了多产品并行、边界模糊的老路。
一位 X 用户按场景隔离 AI 工具:让 Claude 专门处理工作,ChatGPT、Instinct 等承担其他事务。起因是 ChatGPT 曾在工作场景中突然提起她的私人生活内容。她强调这并非担心隐私泄露,也不觉得“毛骨悚然”,而是认为模型不够聪明,判断不出这些信息在当前语境下完全无关,因此选择主动隔离不同产品的信息输入。
作者评论某款人形机器人设计称,其上身按普通人尺度设计是为了方便数据采集与迁移,而非单纯追求「像人」。他认可该团队设计有自己的思考,也坦言有参考别人之处;并批评国内不少机器人创业公司虽有能力做出好产品,却因资本、管理层乃至技术团队缺乏承担风险的勇气,选择抄袭最火的产品。
博主 altryne 在 X 上问 Sam Altman,OpenAI 是否考虑放慢发布节奏、让大家有机会消化密集的发布,Altman 回了句「I believe in you 😅」。OpenAI 的 Thibault Sottiaux 则表示还有更多内容即将推出。这条互动侧面反映 OpenAI 近期发布节奏之快,连重度用户都跟不上。
Scoble 在 X 上提到 YC 创始人正集体研究 AEO(AI 引擎优化),即先摸清目标客户在 ChatGPT、Claude 里输入的提示词以及 AI 引用的来源,再自建 AEO 追踪器。
开发者 @XxChonkExX 称在 RPG 场景中训练 LLM 主动杀死玩家/用户极为困难,而 Grok 和 GPT 都能做到这一点。他表示教会模型优雅地结束一段对话本身就是一种技能,并称自己刚做了一个对抗性测试。
OpenAI 发布 6.1 Sol,没有等来 Astra,Dots 仅限 Pro 用户使用。博主 flowersslop 在布拉格断网一周后盘点这些错过动态,并自嘲
社区提示称,让 OpenAI 新模型做回形针时要说 "make a paperclip for me",而非 "make me a paperclip",以避免歧义。repligate 转发 ApriiSR 的这一说法,称新模型已敏感到需要小心措辞的程度。这被当作典型的提示词措辞玄学梗,反映社区对新模型理解边界与行为不可预测性的调侃。
Anthropic 与 OpenAI 等头部厂商的新模型发布节奏已从平均约每 10 周一款压缩到约 11 天,速度提升约一个数量级。这一观察来自 connoraxiotes 与 FinanceYF5 的推文,后者以「你没疯」回应外界对模型迭代过快的困惑。材料认为这凸显前沿模型竞争与迭代速度的加剧。
Reddit 用户 Enceladusx17 以「ObviousBench」榜单名义发帖,称 GPT-6 是史上训练效率最高的模型之一,而该榜来源 obviousbench.com 明显是搞笑性质。榜单用一本正经的评测口吻玩「结论显而易见」的讽刺梗,属 AI 圈趣闻。
开发者 @jonkragh 盘点 OpenAI DevDay 上被忽视的三个信号:ChatGPT 插件分发窗口、Codex 安全 agent 与 Decisions API。
iOS 开发者 Dimillian 转发并确认对 Codex 新发布的云端环境(cloud environments)给出好评,称迫不及待要详细介绍它的用法。被引用的开发者 mweinbach 表示这些环境「好得离谱」,尤其配合 dots 使用时体验出色。这是早期用户对 Open Codex 云端并行开发环境的高口碑反馈,具体细节待作者后续演示。
scaling01 发帖称当下是「黄金时代」:Sol 6.1、Opus 5.5 和 Sonnet 5.5 三款模型都表现出色、定价合理,处于能力与性价比同时到位的罕见窗口期。同日「模型」频道还列有 DeepSeek 开源库新增华为昇腾支持、Audio8 ASR Infinite 以 KV Cache 实现 7×24 常数延迟流式语音识别等条目。
用户 AnneliesGamble 认为 OpenAI 的个人 AI agent 项目 Dots 有先发优势,因为 ChatGPT 已积累了大量关于她的个人上下文。Instinct、Muse、Grok Bot 等其他 agent 虽能连接她的各类应用,却无法替代长期对话历史形成的对她思维方式的理解。这折射出个人 agent 竞争中「上下文积累」可能比「应用集成」更关键。
一位评论者讥讽「这个星球想要数学家多过想要可用的前沿模型」是极度脱离现实的想法,此事折射出 OpenAI 与数学社区的矛盾。被引用的推文则以自嘲口吻反讽 OpenAI,把数学家的毕生热爱变成「无灵魂的垃圾抽奖游戏」,只为建工业界并不需要的前沿模型、撑起一场不会发生的一万亿美元 IPO。
开发者 willcb 发推反讽「OpenAI 为 VSCode 推出 Codex 插件后 Cursor 就彻底死掉、估值归零」的论调:现实恰恰相反,Cursor 不仅没死,反而成了最火的 AI 编程工具。这条正话反说的推文调侃了「大厂一出官方插件、创业公司必死」的说法,成为一则有传播力的 AI 圈梗。
创业者 Bindu Reddy 横评多款前沿模型,GPT 6.1 SOL 与 Astra 在推理、数据分析和浏览器操作上表现出色,Fable 与 Opus 则擅长编码。但 Fable 与 Opus 在数据分析等任务上表现很差。其结论是没有万能模型,选哪个取决于具体使用场景。
OpenAI 的 Sam Altman 被追问是否会推出更多 gpt-oss 类开源模型,回应称「已经有很多优秀的开源模型,如果我们能在那里做出有用的事,我们会做的」。被追问「我们想要更多可微调的美国模型」时,他仅回答「我们会考虑一下」。发帖人调侃不想等 OpenAI 思考的话可直接看 NVIDIA 的 Nemotron 开源模型系列,折射社区对 OpenAI 开源意愿的不耐。
OpenAI 员工 reachvb 在 X 上回顾 DevDay 现场,称开发者分享了从展示自己做的应用、用 ChatGPT 提升工作与学习效率,到有人称 ChatGPT 帮自己赚到一辆宾利的故事。她表示期待未来几周和几个月大家继续构建产品,该帖是对 DevDay 活动社区氛围的一手记录。
巴基斯坦学生开发者用 n8n、OpenAI 和 WhatsApp Cloud API 搭建诊所 AI 前台(自动答疑、预约、提醒),3 个月接触约 150 家机构后收入为零。
剑桥研究者 David Krueger 针对 OpenAI 自我复制提示词在多智能体系统间传播的传闻出面纠错,指出这类攻击并非野外新发现,2024 年 10 月的论文《Prompt Infection》已系统研究过恶意 prompt 在多智能体间的自传播。他还指出博主 @TheZvi 和 @AndrewCurran 的相关报道存在两处误报,呼吁业界关注已有学术成果而非渲染新奇性。
Gary Marcus 引用纽约时报 Sheera Frenkel、Dustin Volz 和 Dylan Freedman 的报道称,OpenAI 员工与高管的往来记录显示,公司在 Hugging Face 事件发生前数月就已收到安全警告,且未把安全列为优先事项。
推荐理由:借纽约时报披露的警告时间线,作者质疑企业自我监管以及 Jensen Huang 信任这些公司的说法。
Gary Marcus 发文点评白宫超级智能协议,认为其核心是签署方承诺不受监管、也不给公众发言权,只能靠信任。他质疑协议中所谓独立监督是否只是由大公司自己挑选的承包商承担,并追问两周前各方热议的 Pacing 议题为何消失。他还指出,Dario、Sam 和 Elon 都退缩了。
前 FTC 官员、AI 评论人 Neil Chilson 发问:为什么人们还把 OpenAI 和 Anthropic 称为「lab」?他指出这两家早已是创造大量营收的庞大商业实体,应该摘掉「实验室」标签,正视自己作为真正公司的身份及其附带的责任与监管期待。这一提法触及了 AI 行业叙事与商业现实之间的落差。
一位用户收到 OpenAI 的竞品调研问卷,发现选项列表几乎只聚焦 Claude,仿佛其他竞品不存在。该用户称自己一到用量上限就切换到 Grok 等其他模型,不想为此多付钱给 ChatGPT。帖文侧面反映了用户在多家模型间的切换行为,以及 OpenAI 对 Anthropic 的竞争关注。
OpenAI 发布 GPT 6.1 Sol,缓存价格直降 50%,但博主点评其能力仍不敌 Anthropic。Sonnet 5.5 跑分已超过 GPT 6.1 Astra,而 6.1 Astra 因安全原因迟迟未放出;GLM 5.3 则被点名批为「跑太快、不够安全」,折射头部厂商在安全叙事与竞赛速度间的张力。
博主 xeophon 盘点指出,OpenAI 的高调风险警告屡发却未兑现,其公关节奏是先在博客暗示某领域更强模型即将到来,随后不久就发布模型。他举例称,OpenAI 曾在2024年10月31日呼吁在18个月内(即2026年4月前)应对网络与生物风险,但截至发帖,期限已过,风险并未兑现。帖子质疑前沿实验室的风险警告更多是为模型发布造势,而非实质预警。
奥尔特曼在 OpenAI DevDay 上称 AI 的影响会超过工业革命,并发布 AI 智能体产品 Dots,认为现在是进入就业市场的最佳时机。他还称 token 是糟糕的指标,OpenAI 曾考虑放弃但客户不赞成;Dots 已替他处理通知和待办,让他不再那么依赖手机。他预计部分工作会彻底消失,但大规模失业的悲观预测低估了经济未来的增长。
针对 OpenAI 的抗议活动正变得越来越有创意,最新出现的一座雕塑描绘了 AI 领袖们从一艘正在下沉的船上逃离。
Palisade Research 在 frominside.ai 上线十余段 AI 研究者访谈视频,受访者包括 OpenAI、Google 和 Anthropic 的现任与前任员工。
Turso 联合创始人 Pekka Enberg 让 ChatGPT 为 Turso 数据库绘制一张架构图,却收到拒绝回复,称提示词可能违反关于裸露、性或色情内容的护栏。数据库架构图被误判为色情内容,展示了安全护栏过度拦截的一幕,围观者纷纷猜测究竟是什么 prompt 触发了拦截。
网友整理了一份按前沿实验室划分的 AI 信息源清单,分为 14 个和 19 个账号两个版本。Anthropic 部分收录刚宣布加入的 Karpathy 以及 @bcherny、@trq212 等账号。清单还覆盖 OpenAI、Google 等其他实验室的核心成员,方便读者一站式追踪各家实验室动态。
Anthropic 宣布其新设分子生物学实验室作出首个发现:AI 智能体标记出一个此前未被收录的酶相关模式,生物学家质疑这能否算作发现。有研究者称其团队早已发现同一模式,并质疑该系统是否从他与 Claude 的对话中学习。MIT Technology Review 的 2026 气候科技公司名单将于 10 月 6 日发布,覆盖储能、核能、交通等领域。
在 Wired 的访谈中,AI 研究者 Timnit Gebru 表示 AI 并不构成存在性威胁,认为这一叙事不只是分心,而且有害。她把这种叙事追溯到资助 Anthropic 早期融资并资助 METR 等机构的人群,称其为监管俘获的一部分,并援引 Lina Khan 提出的欺骗性营销、数据透明度与数据工人劳动剥削等现有法律本该管辖的事项。
Air AI 的 Bindu Reddy 发推称对 OpenAI 已“不抱希望”,认为 Google Gemini 是做出 Fable-7 级别模型的唯一希望。他给出的理由是 Gemini 拥有算力、数据和人才,唯一缺的是“实现的意愿”。这属于 AI 圈 KOL 对模型格局的短评,未提供论证细节。
VraserX 表示仍对 Pro 套餐用量削减感到不满,但高度评价可无限量使用的 5.6 Sol 模型。他进一步指出,如果这个「无限量」同样适用于 Work 和 Codex 场景,将是一件大事。
David Patterson 回应「水管工在 AGI 后仍有工作」的说法,重申 AGI 将同时取代知识型工作和体力劳动。他认为 Claude、ChatGPT 将完全多模态化并控制人形机器人,且这已经在发生。他预计一两年内,它们在所有事情上都会超过任何人类,包括水管工这类体力职业。
一条 X 帖显示,OpenAI 相关内容被 Community Notes 社区补充事实核查「纠正」,发帖人调侃社区笔记「痛击」OpenAI,具体细节在配图中。相关实测截图引发热议,属 AI 圈典型的 drama/梗图内容。