OpenAI DevDay 三个被忽视的信号:插件分发窗口、Codex 安全、Decisions API
开发者 @jonkragh 盘点 OpenAI DevDay 上被忽视的三个信号:ChatGPT 插件分发窗口、Codex 安全 agent 与 Decisions API。
开发者 @jonkragh 盘点 OpenAI DevDay 上被忽视的三个信号:ChatGPT 插件分发窗口、Codex 安全 agent 与 Decisions API。
开发者 maierak 质疑论文《The Midas Touch for Code: Scaling AI Coding Environments Straight from Source》可复现性与统计置信度均不清楚:该工作未与基于 issue 的管线做正面对比,只用了单一模型和单一随机种子,生成用的 agent 未公开。
iOS 开发者 Dimillian 转发并确认对 Codex 新发布的云端环境(cloud environments)给出好评,称迫不及待要详细介绍它的用法。被引用的开发者 mweinbach 表示这些环境「好得离谱」,尤其配合 dots 使用时体验出色。这是早期用户对 Open Codex 云端并行开发环境的高口碑反馈,具体细节待作者后续演示。
前 Google 工程师 Piotr 澄清,他并非反对面试考编程能力,但在 Google 代码库贡献的经历让他确信 AI agent 还远达不到生产级代码所需的正确、干净与可扩展水平。他同时质疑 LeetCode 刷题式面试并非理想方案,抛出 60 分钟面试除算法题还能考什么的问题。这反映出 AI 编程助手普及后,工程招聘标准尚未找到新范式。
max_paperclips 反驳 housecor:模型变强并不会让 agent 封装层变得多余。他认为模型不会自动学会记忆重复任务、感知可用 API 或积累可复用工具集,skills、MCP、自定义循环等封装层仍需保留。实际变化只是 prompt 和指令能写得更简略,嵌套循环、任务进度追踪等工程结构不会因 TerminalBench 提升 2% 就消失。
开发者 willcb 发推反讽「OpenAI 为 VSCode 推出 Codex 插件后 Cursor 就彻底死掉、估值归零」的论调:现实恰恰相反,Cursor 不仅没死,反而成了最火的 AI 编程工具。这条正话反说的推文调侃了「大厂一出官方插件、创业公司必死」的说法,成为一则有传播力的 AI 圈梗。
创业者 Bindu Reddy 横评多款前沿模型,GPT 6.1 SOL 与 Astra 在推理、数据分析和浏览器操作上表现出色,Fable 与 Opus 则擅长编码。但 Fable 与 Opus 在数据分析等任务上表现很差。其结论是没有万能模型,选哪个取决于具体使用场景。
一位开发者观察到,AI 辅助开发中代码达到新里程碑后往往还需再做一轮 code review 和深度重构,耗时一两天。更关键的是,上一轮迭代中被掩盖的问题不会消失,而是悄悄迁移到新写的代码里,一天后才发现。这意味着每次重构在解决表面问题的同时可能把缺陷带入新结构,持续审查不可或缺。
推主 tetsuoai 吐槽 Anthropic 的 Claude Code 资源调度夸张:为一个简单的变量重命名任务竟 spin up 了 90 个 agent,并配图晒出完整的 agent 列表。该截图成为 AI 编码 agent 资源浪费与过度编排的最新名场面梗图。
GENIC0N 在 X 上吐槽 AI 让编程变得像念咒般不可解释,"computer science" 该改叫 "computer magic"。该帖被大量转发,戳中开发者对 AI 编程既依赖又看不懂的心态。「Fun」频道同期还收录 AI 生成 7 分钟 SQLite 代码库讲解视频、Claude 听 59.94 Hz 嗡声判断 GoPro 麦克风漏帧率电流声等条目。
Dr_Singularity 认为 Opus 5.5 的编码质量已跨过「实用阈值」,AI vibecoding 出的游戏已达到可玩水准,未来数月 token 用量将爆炸式增长。
GitHub 首席产品官 Mario Rodriguez 在 Shift AI 播客中透露,Copilot 付费客户平均使用 27 到 29 个不同模型,没有任何单一模型占请求量超过四分之一。
开发者 haltakov 发推指出,开发者用好 AI 的最大心障,是仍相信“最终会把 AI 写的代码全部读一遍”。他认为这种期待并不现实,应当放下,接受自己不会通读 AI 生成的代码,才能真正转向 AI 原生的开发方式。
shadcn 提出 AI 编码应用的纵向侧栏只做导航、横向顶部标签承载工作集。侧栏负责树状的历史记录与组织,无需常驻;顶部标签对应当前活跃会话线程,用图标、颜色和状态区分运行中、已完成与待输入。在 ChatGPT、Claude Code、T3 Code 等应用中,侧栏可收起,为预览、浏览器和代码视图腾出空间。
开发者 Jarrod Watts 实测 Opus 5.5 敢删代码,会清理冗余实现、删除无意义注释、清掉糟糕的 mock 测试。把它跑在 vibecoded 项目上,可逐一消灭现存的技术垃圾,体验非常爽快。这反映新一代编码模型在代码品味与重构主动性上的提升。
X 用户 robleclerc 总结 vibe coding 的日常:真正需要创造性思考和技术理解的部分固然存在,但大量时间其实只是在说「okay, keep going」,让模型自己继续跑。这条吐槽被认为戳中了大量 AI 编程从业者的实际体验。
AI 圈流传的一张梗图嘲讽某 CEO 宣称「我们 90% 的代码现在由 AI 编写」,配图却是其生产环境代码的惨状截图,反差强烈。帖子讽刺了部分公司把「AI 写码比例」当作宣传口径、却忽视代码质量与可维护性的现象。这是对「AI 编码替代率」叙事的一次集体吐槽。
Opus 5.5 被研究者用于生成交互式学术演示,MIT 教授 davidbau 需要在 15 分钟演讲中传达多条复杂信息,用它生成了可展示相互关联内容的 JS 交互式幻灯片。长期测评前沿模型的 ALashkaripour 也用它生成动态经济学可视化,认为学术演示方式即将改变,至少应走出传统 LaTeX/Beamer 格式。
tlakomy 发布一张吐槽梗图,称「以前我们用 TAB 键来补全 AI 生成的代码」,暗指 AI 编程工具已从简单的代码补全进化到 agent 全程代写。梗图调侃人类只剩按 Tab 确认的角色也遭到颠覆。
jonathan_wilke 从 Cursor+Grok 4.7 切换到 Claude Code+Opus 5.5,用一整天日常编码工作实测这套组合。他此前从未用过 Opus 5.5,此次切换起因是众人对其没用过感到惊讶,过程中会持续分享实际体验。
Google Developers Blog 发文论述 Go 为何适合 AI 辅助软件工程,认为代码生成交给 AI 之后,软件工程的瓶颈已从写代码转向审查、验证与维护。
有创作者声称用 Claude Code 搭建无人出镜(faceless)YouTube 频道,单月收入达 6.1 万美元,选题、脚本、配音与剪辑等环节均由 AI 完成。他还发布了 6 分钟分步教程展示具体做法,呈现「Claude Code + YouTube」的自动化内容变现路径。该说法未经独立核实。
Yacine MTB 指出,AI 领域如今真正被关注的评测几乎只剩软件工程(SWE)类基准,其他能力评测基本无人问津。他把这一现象称为"计算机科学对整个行业的彻底胜利",意味着代码能力已成了衡量模型进步的单一标尺。
一位两年内在4个国家面试超过75人的面试者回顾称,一年前“AI 不会编码、不会推理”的主流论调如今已被证明错了。他预计再过18个月回看今天,AI能力又会是另一番景象。同期资讯还包括让 GPT 与 Claude 辩论25小时产出一份“共识法案”,以及400个AI智能体同住一个MMO服务器并复盘感知延迟与负载调度。
博主称 Anthropic 的 Opus 5.5 在游戏社区引发热潮,玩家直接用它把整个游戏用 Rust 重写,再把多个重写版本拼在一起。原始内容来自 YouTube 用户 @chasmmm 的视频。这被视为 Opus 5.5 代码生成能力的又一民间展示案例。
独立开发者 yihui_indie 公开吐槽 OpenAI Codex,称其在自己心中已跌到只配给 Claude 当生图服务商,不值得作为主力编码助手使用。这类调侃反映出部分重度用户对 Codex 与 Claude 编码能力差距的直观感受。
Blitzy 工程总监 Neeraj Deshmukh 在 GraphSummit 上称,公司用 Neo4j 知识图谱为编程智能体提供上下文,把客户代码库逆向构建成动态图谱并接入 GitHub、GitLab。他称智能体的有效上下文约 200,000 至 300,000 tokens,在一亿行代码库上会因压缩结果而丢失信息。Blitzy 6 月称在 SWE-Bench Pro 上得分 84.95%。
Bit Cloud 联合创始人 Yonatan Sason 以自己维护的约 120 个组件系统为例,指出代码相似度检索找不全跨仓库的依赖边,因为依赖是系统属性而不是文本属性。
《百页机器学习书》作者 Andriy Burkov 在 X 上吐槽 Sonnet 5.5 响应速度极快:他提交 bug、部署解决方案的速度,竟然赶不上模型给出修复方案的速度。这条吐槽直观展现了新一代编码模型的极限速度体验。
Latent Space 播客请到 Anthropic 的 Thariq Shihipar,复盘 Claude Code 的下一阶段,涉及 harness 演进、Claude Mods 与智能体安全。
Simon Willison 表示,与编程智能体协作越多,他越确信它们让软件工程变得更难。这些智能体能做出惊人的成果,但要释放其全部潜力,需要非凡的纪律和知识。
一名新入职大公司的工程师称,团队的规格、代码、测试、PRD、工单与报告全部由 Claude Code 生成,从 L1 到 L7 的工程师都在与 Claude 对话。他表示团队没人喜欢这种状态,高层反复强调推代码不是瓶颈,员工每天工作 12 到 13 小时只为按回车。
Jev 发布两天后,社区已出现 6 个复刻版本,涵盖 ModernBERT 编码器、扩散模型、Qwen3.5 微调等不同路线,训练数据据称 100% 为合成数据。
OpenAI 内部,编程智能体正在重塑 AI 研究。OpenAI 公布了关于智能体使用情况、实验速度、任务复杂度以及研究加速的早期数据。
Jack Clark 在 Import AI 第 455 期中表示,到 2028 年底出现无人参与、能自主构建自身继任者的自动化 AI 研发的概率在 60% 以上。