GitHub CPO:Copilot 付费用户平均用 27-29 个模型,竞争不在模型层
GitHub 首席产品官 Mario Rodriguez 在 Shift AI 播客中透露,Copilot 付费客户平均使用 27 到 29 个不同模型,没有任何单一模型占请求量超过四分之一。
GitHub 首席产品官 Mario Rodriguez 在 Shift AI 播客中透露,Copilot 付费客户平均使用 27 到 29 个不同模型,没有任何单一模型占请求量超过四分之一。
OpenAI 在开发者日活动上于 Codex 和 ChatGPT Work 推出 GPT-6.1 Sol 模型,官方称其在处理复杂任务时性能接近 Astra,但成本低于 Astra。
推荐理由:官方称该模型在复杂任务上性能接近 Astra 且成本更低,并给出每百万 tokens 定价,便于与现有方案比较成本。
OpenAI 在 2026 年开发者日推出 Ultrafast 全新服务层级,GPT-6 Astra 在 Codex 中最高可实现每秒 300 个词元生成,API 调用最高提速 6 倍。
OpenAI 在开发者活动日发布 GPT-6.1 Sol,官方称其为同等性能下性价比最高的模型,标准输入输出 token 价格只有 GPT-6 Astra 的五分之一。
推荐理由:原文给出 GPT-6.1 Sol 与 Astra、Opus 5.5 的定价和基准对比,读者可据此判断其单任务成本与定位。
GPT-6.1 Sol 已在 Amazon Bedrock 正式可用,作为 GPT-6 Sol 的重大升级,面向智能体编码、计算机操作和专业工作负载提供更强推理。
推荐理由:文章给出 GPT-6.1 Sol 与 Astra、GPT-6 Sol 的评测及单任务成本对比,可据此评估智能体编码任务的性价比。
OpenAI 发布 GPT-6.1 Sol,称其在智能体编码、电脑操作和办公任务上接近仍未发布的旗舰 GPT-6 Astra,成本约为其五分之一。API 价格为每百万输入 token 2 美元、输出 10 美元,缓存输入 0.10 美元,Plus、Pro、Business、Enterprise 和 Edu 用户当日起可在 ChatGPT Work 和 Codex 使用。
推荐理由:原文对比 Sol 与 Astra、GPT-6 Sol 及 Claude 的价格与基准数据,可看清 OpenAI 在成本与性能之间的取舍。
OpenAI 在旧金山 DevDay 2026 上扩展 Codex 和 API,新增 Codex Security Cloud 安全扫描、Decisions API 与 Ultrafast 加速档位。
OpenAI 在 DevDay 2026 开发者大会发布 Dots 常驻智能体,可自主跟进项目并处理修复 bug、发送发票等任务。每个 Dot 配有带浏览器的云端电脑,运行在 GPT-6 Astra 上,用户可通过 ChatGPT、Slack 和 Microsoft Teams 的文字或语音与它交互,插件可连接 4,000 多个应用。
推荐理由:Dots 与三周前发布的 Meta Muse 在设计上相近,读者可对比两家常驻智能体的能力边界与权限设计。
OpenAI 在 DevDay 上发布 GPT-6.1 Sol,称其在智能体编码、计算机操作和专业工作上接近 GPT-6 Astra,而标准输入输出 token 价格仅为后者的五分之一。
推荐理由:GPT-6.1 Sol 与 GPT-6 Astra 的能力和价格对比,以及 Astra 版本因安全顾虑被搁置,构成本次发布的背景。
OpenAI 在 DevDay 上为编码智能体 Codex 推出可跨设备访问的云端开发环境,让任务启动更快,并为团队提供带批准设置和权限的共享工作区。Codex CLI 支持用语音启动和调度任务,新增 /agents 视图和更简洁的终端界面,Codex 还接入 ChatGPT 桌面应用中的代码审查体验,可读取摘要、查看改动或就潜在问题提问。
OpenAI 发布 GPT-6.1 Sol,面向编码、计算机操作和专业工作场景,官方称其智能水平接近 Astra。该模型的 API 输入与输出 token 价格均为 Astra 标准价的五分之一。
推荐理由:官方给出 GPT-6.1 Sol 相对 Astra 的 token 定价比例与能力定位,可用于判断其成本取舍。
Sonnet 5.5 仅凭代码在浏览器中生成了一个完整水族馆:每条鱼、每株水草、每个气泡都由代码实现,全程没有任何资源下载。这是一个展示该模型代码生成能力与视觉表现力的趣味 demo。
开发者 haltakov 发推指出,开发者用好 AI 的最大心障,是仍相信“最终会把 AI 写的代码全部读一遍”。他认为这种期待并不现实,应当放下,接受自己不会通读 AI 生成的代码,才能真正转向 AI 原生的开发方式。
OpenRouter 开源编码模型 token 份额排名中,GLM 5.3 Flash 以 29.2% 居首,DeepSeek V4.1 Flash 25.6%、Kimi K3 18.9% 紧随其后。
OmniNode 作者提出「双向验证法」测试编码智能体写的检查:验证器需同时验证故意写坏的输入必须 fail、对应合法版本必须 pass,只测坏输入会让「全部拒绝」的验证器看起来完美。作者还倾向对真实故障后补的检查保留最小复现及修复版本,让检查能区分两者,并询问社区是用回归用例、变异测试还是人工评审。
shadcn 提出 AI 编码应用的纵向侧栏只做导航、横向顶部标签承载工作集。侧栏负责树状的历史记录与组织,无需常驻;顶部标签对应当前活跃会话线程,用图标、颜色和状态区分运行中、已完成与待输入。在 ChatGPT、Claude Code、T3 Code 等应用中,侧栏可收起,为预览、浏览器和代码视图腾出空间。
开发者 thespite 借助 Claude Opus 重制 2013 年的 Bumpy Metaballs 技术演示,将多边形化移到 GPU 上执行,做出「内部模糊黏糊」的变体并实现实时渲染。新版光照来自环境贴图,支持更多形状,加入环境光遮蔽、追踪阴影与后处理阶段,性能进一步提升。项目提供在线演示与开源源码。
OpenAI 在 DevDay 2026 开幕前官宣将一天内带来超过 20 项新发布,具体内容全部保密。CEO Sam Altman 亲自发帖预告「We have found a new thing」,OpenAI 员工 Platon Mazarakis 称将展示 Codex 团队酝酿一年的成果。
QwenLM 的 qwen-code 发布 v0.24.7,含十余项改动,属常规迭代、无重大新能力。managed-agent 新增 workspace 绑定会话免执行准入与 managed-tool-result/1 契约定义,acp-bridge 支持在 legacy 与 managed 引擎间路由会话。
开发者 Jarrod Watts 实测 Opus 5.5 敢删代码,会清理冗余实现、删除无意义注释、清掉糟糕的 mock 测试。把它跑在 vibecoded 项目上,可逐一消灭现存的技术垃圾,体验非常爽快。这反映新一代编码模型在代码品味与重构主动性上的提升。
X 用户 robleclerc 总结 vibe coding 的日常:真正需要创造性思考和技术理解的部分固然存在,但大量时间其实只是在说「okay, keep going」,让模型自己继续跑。这条吐槽被认为戳中了大量 AI 编程从业者的实际体验。
作者用 Claude Opus 以 one-shot 方式复刻了任天堂红白机经典越野摩托游戏 Excitebike,全程无需多轮修改,展示了 Opus 的单次代码生成能力。
作者 randal_olson 用开源图表生成 skill evident-charts 对 Artificial Analysis 数据做“一图一问”测试,Intelligence Index 排名最高的是 Anthropic。Anthropic 自 2026 年 4 月以来每天位居榜首。帖子同时演示了该开源 skill 的实际效果。
数据科学家 Randy Olson 开源了面向 AI 编码 agent 的图表 skill evident-charts(GitHub 49 star),让 Claude Code、Codex、Cursor 等在画图时遵循清晰、诚实的原则,并在用户看到之前自动检查每张图。
AI 圈流传的一张梗图嘲讽某 CEO 宣称「我们 90% 的代码现在由 AI 编写」,配图却是其生产环境代码的惨状截图,反差强烈。帖子讽刺了部分公司把「AI 写码比例」当作宣传口径、却忽视代码质量与可维护性的现象。这是对「AI 编码替代率」叙事的一次集体吐槽。
JafarNajafov 汇总了 11 个可直接复制粘贴的编码 prompt,主张把 Claude 当成一位高薪工程师来协作,而非自动补全版 Stack Overflow。他指出大多数人只让 Claude 写函数、修报错、过测试,把 AI 当成了简单的代码生成器。
JafarNajafov 分享一个调试类 AI 编程 prompt,要求在修复 bug 前先让 AI 列出 5 个按可能性排序的根因。每个根因需说明需要什么证据确认、该打什么日志验证,并指出代码中可能错误的前提假设,同时给出隔离问题的最小测试。其核心思路是把 AI 当作诊断伙伴,而非一键修复器。
JafarNajafov 在 X 上分享了一个架构决策记录(ADR)prompt,用于在两个技术选项之间做选择时让 AI 辅助决策。该模板要求 AI 覆盖背景与约束、各方案的 trade-off、10 倍负载下什么能撑住什么会崩、没人提的隐藏成本、带推理的推荐,以及两年后可能后悔的点,并按真实 ADR 文档格式输出。作者称这是 Staff+ 工程师做决策的方法。
Opus 5.5 被研究者用于生成交互式学术演示,MIT 教授 davidbau 需要在 15 分钟演讲中传达多条复杂信息,用它生成了可展示相互关联内容的 JS 交互式幻灯片。长期测评前沿模型的 ALashkaripour 也用它生成动态经济学可视化,认为学术演示方式即将改变,至少应走出传统 LaTeX/Beamer 格式。
作者用 Puku CLI 配合 Opus,结合 Three.js、p5.js 和 Paper Shader 构建了一套完整的创意编码体验,并部署到 FuncHole。整个过程展示了 AI、代码与创意实验在一个闭环中完成的可能。
开源项目 AutonomousVehicleControlBeginnersGuide(1.7k star)将全部 38 个自动驾驶仿真演示汇总为一个画廊页面,演示描述由对应脚本的 docstring 生成,合并后由 CI 自动更新,无需手工维护文档。
针对 NetHack 的研究提出 CodeHack 代码技能库,让语言智能体调用带自然语言描述的可复用技能,而不是逐步选择原始动作。零样本评估中,技能相比原始动作使游戏进度接近提升至三倍,每回合推理成本降低 86%;在强化学习下,相同训练预算内技能智能体的地牢层数平均增益达 7.2 倍。技能与原始动作组合可保留大部分收益,CodeHack 及训练、评估代码已开源。
TISD 提出一种分支-重生成-蒸馏算法:强制教师选择的轨迹分支动作,由学生生成后续后缀,再用特权上下文条件教师蒸馏完整轨迹。在编码模型上,TISD 较 SDPO 将平均 Avg@4 提升 1.2 个百分点;在科学领域,等步数预算下平均 Avg@128 提升 0.8 分,等时间预算下提升 0.3 分。这些结果支持教师引导的分支可作为暴露有用后继上下文的自蒸馏方式。
ORCA 基准发布,用于评估 LLM 的数据科学代码翻译(DSCT)能力,含 1,600 项 ORCA-MAIN 任务(覆盖 Data Querying、Data Manipulation、Deep Learning)和 200 项 ORCA-PROJECT 完整项目任务。
论文分析了 Claude Code 和 Mini-SWE-Agent 在 SWE-bench Verified 四种配置下的 1,200 条轨迹,识别出 subsumed retrieval。
tlakomy 发布一张吐槽梗图,称「以前我们用 TAB 键来补全 AI 生成的代码」,暗指 AI 编程工具已从简单的代码补全进化到 agent 全程代写。梗图调侃人类只剩按 Tab 确认的角色也遭到颠覆。
jonathan_wilke 从 Cursor+Grok 4.7 切换到 Claude Code+Opus 5.5,用一整天日常编码工作实测这套组合。他此前从未用过 Opus 5.5,此次切换起因是众人对其没用过感到惊讶,过程中会持续分享实际体验。
OpenAI 发布 Codex CLI rust-v0.159.0,新增 instantinterrupt,可在模型响应或长时间 code-mode 调用中用新输入实时引导 Codex。
IQuest 研究团队发布并开源 IQuest-Q1,这是总参数 320B 的 MoE 模型,每 token 仅激活 15B,256 个专家中每次激活 8 个,上下文长度达 524,288。
作者基于 Unsloth 做微调合并,发布名为 Gmcoder 的 9B 开源编码模型,已在 Hugging Face 上线。据称该模型在 HumanEval+ Mini 上超过 Ornith 1.5 和 Oxcoder,且不靠「过度思考」取胜,回答问题时 token 消耗比对手少 40–68%。这属于个人开发者的开源微调实战成果。