跳到正文

#编码

今日 51 条
今天9月30日周三
  1. AWS Machine Learning Blog67

    GPT-6.1 Sol 在 Amazon Bedrock 上正式可用

    GPT-6.1 Sol 已在 Amazon Bedrock 正式可用,作为 GPT-6 Sol 的重大升级,面向智能体编码、计算机操作和专业工作负载提供更强推理。

    推荐理由:文章给出 GPT-6.1 Sol 与 Astra、GPT-6 Sol 的评测及单任务成本对比,可据此评估智能体编码任务的性价比。

  2. The Decoder80

    OpenAI 发布 GPT-6.1 Sol,称以五分之一成本接近 Astra

    OpenAI 发布 GPT-6.1 Sol,称其在智能体编码、电脑操作和办公任务上接近仍未发布的旗舰 GPT-6 Astra,成本约为其五分之一。API 价格为每百万输入 token 2 美元、输出 10 美元,缓存输入 0.10 美元,Plus、Pro、Business、Enterprise 和 Edu 用户当日起可在 ChatGPT Work 和 Codex 使用。

    推荐理由:原文对比 Sol 与 Astra、GPT-6 Sol 及 Claude 的价格与基准数据,可看清 OpenAI 在成本与性能之间的取舍。

  3. The Decoder77

    OpenAI 在 DevDay 2026 发布常驻智能体 Dots,对标 Meta Muse

    OpenAI 在 DevDay 2026 开发者大会发布 Dots 常驻智能体,可自主跟进项目并处理修复 bug、发送发票等任务。每个 Dot 配有带浏览器的云端电脑,运行在 GPT-6 Astra 上,用户可通过 ChatGPT、Slack 和 Microsoft Teams 的文字或语音与它交互,插件可连接 4,000 多个应用。

    推荐理由:Dots 与三周前发布的 Meta Muse 在设计上相近,读者可对比两家常驻智能体的能力边界与权限设计。

  4. TechCrunch · AI69

    OpenAI 为 Codex 推出可跨设备复用的云端开发环境

    OpenAI 在 DevDay 上为编码智能体 Codex 推出可跨设备访问的云端开发环境,让任务启动更快,并为团队提供带批准设置和权限的共享工作区。Codex CLI 支持用语音启动和调度任务,新增 /agents 视图和更简洁的终端界面,Codex 还接入 ChatGPT 桌面应用中的代码审查体验,可读取摘要、查看改动或就潜在问题提问。

  5. OpenAI News62

    OpenAI 发布 GPT-6.1 Sol

    OpenAI 发布 GPT-6.1 Sol,面向编码、计算机操作和专业工作场景,官方称其智能水平接近 Astra。该模型的 API 输入与输出 token 价格均为 Astra 标准价的五分之一。

    推荐理由:官方给出 GPT-6.1 Sol 相对 Astra 的 token 定价比例与能力定位,可用于判断其成本取舍。

9月29日周二
  1. AGI Hunt47

    OmniNode 作者提出双向验证法:如何测试编码智能体写的检查

    OmniNode 作者提出「双向验证法」测试编码智能体写的检查:验证器需同时验证故意写坏的输入必须 fail、对应合法版本必须 pass,只测坏输入会让「全部拒绝」的验证器看起来完美。作者还倾向对真实故障后补的检查保留最小复现及修复版本,让检查能区分两者,并询问社区是用回归用例、变异测试还是人工评审。

  2. AGI Hunt47

    shadcn 谈 AI 编码工具为何横向用标签:纵向是导航,横向是工作集

    shadcn 提出 AI 编码应用的纵向侧栏只做导航、横向顶部标签承载工作集。侧栏负责树状的历史记录与组织,无需常驻;顶部标签对应当前活跃会话线程,用图标、颜色和状态区分运行中、已完成与待输入。在 ChatGPT、Claude Code、T3 Code 等应用中,侧栏可收起,为预览、浏览器和代码视图腾出空间。

  3. AGI Hunt44

    thespite 借助 Claude Opus 实现 13 年愿望:GPU 端 Marching Cubes 软糖体实时渲染

    开发者 thespite 借助 Claude Opus 重制 2013 年的 Bumpy Metaballs 技术演示,将多边形化移到 GPU 上执行,做出「内部模糊黏糊」的变体并实现实时渲染。新版光照来自环境贴图,支持更多形状,加入环境光遮蔽、追踪阴影与后处理阶段,性能进一步提升。项目提供在线演示与开源源码。

  4. AGI Hunt63

    JafarNajafov 分享调试 prompt:先列 5 个根因再动手修复

    JafarNajafov 分享一个调试类 AI 编程 prompt,要求在修复 bug 前先让 AI 列出 5 个按可能性排序的根因。每个根因需说明需要什么证据确认、该打什么日志验证,并指出代码中可能错误的前提假设,同时给出隔离问题的最小测试。其核心思路是把 AI 当作诊断伙伴,而非一键修复器。

  5. AGI Hunt56

    JafarNajafov 分享用 AI 写架构决策记录的 prompt 模板

    JafarNajafov 在 X 上分享了一个架构决策记录(ADR)prompt,用于在两个技术选项之间做选择时让 AI 辅助决策。该模板要求 AI 覆盖背景与约束、各方案的 trade-off、10 倍负载下什么能撑住什么会崩、没人提的隐藏成本、带推理的推荐,以及两年后可能后悔的点,并按真实 ADR 文档格式输出。作者称这是 Staff+ 工程师做决策的方法。

  6. AGI Hunt40

    Opus 5.5 让学术演示告别 Beamer 时代

    Opus 5.5 被研究者用于生成交互式学术演示,MIT 教授 davidbau 需要在 15 分钟演讲中传达多条复杂信息,用它生成了可展示相互关联内容的 JS 交互式幻灯片。长期测评前沿模型的 ALashkaripour 也用它生成动态经济学可视化,认为学术演示方式即将改变,至少应走出传统 LaTeX/Beamer 格式。

  7. arXiv cs.AI41

    抽象阶梯的上下:面向语言智能体的代码化技能

    针对 NetHack 的研究提出 CodeHack 代码技能库,让语言智能体调用带自然语言描述的可复用技能,而不是逐步选择原始动作。零样本评估中,技能相比原始动作使游戏进度接近提升至三倍,每回合推理成本降低 86%;在强化学习下,相同训练预算内技能智能体的地牢层数平均增益达 7.2 倍。技能与原始动作组合可保留大部分收益,CodeHack 及训练、评估代码已开源。

  8. arXiv cs.AI33

    TISD:带轨迹干预的在线策略自蒸馏

    TISD 提出一种分支-重生成-蒸馏算法:强制教师选择的轨迹分支动作,由学生生成后续后缀,再用特权上下文条件教师蒸馏完整轨迹。在编码模型上,TISD 较 SDPO 将平均 Avg@4 提升 1.2 个百分点;在科学领域,等步数预算下平均 Avg@128 提升 0.8 分,等时间预算下提升 0.3 分。这些结果支持教师引导的分支可作为暴露有用后继上下文的自蒸馏方式。