commit-rewriter 0.2
Simon Willison 于 9 月 24 日发布一条关于 commit-rewriter 0.2 的短记,标签为 git。该短记未给出这一工具的功能说明、版本变化或可用性信息。
Simon Willison 于 9 月 24 日发布一条关于 commit-rewriter 0.2 的短记,标签为 git。该短记未给出这一工具的功能说明、版本变化或可用性信息。
作者分享延长 Claude Code 与 Codex 订阅额度的做法,核心是让 Claude Fable、GPT-6 Astra 做编排,由 Claude Opus、GPT-5.6 SOL 执行子任务。
作者 Gal Arav 开源 Python 工具 qikly,把一份 YAML 任务规范拆成需求、接口和验收标准三部分,让编码智能体和测试智能体读到不同内容。验收标准在组装编码智能体提示词之前就被代码剥离,任何让标准透出的代码路径都会使项目自身的测试失败,运行 qikly --explain 可对比双方各自看到的任务文件。
OpenCode 可接入 Amazon Bedrock 的开放权重模型,作为终端 AI 编程智能体在本地运行、推理留在 AWS 账户,且无按席位费用。示例模型包括 Moonshot AI Kimi K3、OpenAI GPT-OSS 120B 与 NVIDIA Nemotron 3 Super 120B。
Airbnb 扩大对 GPT-6 Astra 及 OpenAI 前沿模型的接入范围,帮助工程团队排查 bug、设计系统并加快交付。
OpenAI 的 GPT-6 Sol 和 GPT-6 Luna 在 Amazon Bedrock 正式可用,API 定价显著低于 GPT-5.6 前代。GPT-6 Sol 面向开发与运维中反复出现的复杂任务,GPT-6 Luna 面向大批量重复任务,两者都支持显式提示词缓存。OpenAI 的内部事实性评测显示,GPT-6 Sol 的事实性错误约为 GPT-5.6 Sol 的一半。
推荐理由:两款模型按复杂任务与高频任务分层,API 定价低于 GPT-5.6 前代,可据此判断日常负载的选型。
一名新入职大公司的工程师称,团队的规格、代码、测试、PRD、工单与报告全部由 Claude Code 生成,从 L1 到 L7 的工程师都在与 Claude 对话。他表示团队没人喜欢这种状态,高层反复强调推代码不是瓶颈,员工每天工作 12 到 13 小时只为按回车。
Google 在 Google I/O 2026 重组 Gemini 订阅体系,新增约 $100 的 AI Ultra 档,并把所有方案从固定月度配额改为基于算力的用量上限。
Jev 发布两天后,社区已出现 6 个复刻版本,涵盖 ModernBERT 编码器、扩散模型、Qwen3.5 微调等不同路线,训练数据据称 100% 为合成数据。
Steve Yegge 关停编码智能体项目 Gas Town,承认每月数千美元的 agent 订阅只做成了这一个项目;Databricks 向约 3,500 名工程师铺开 GPT-6 Astra 后,整体编码支出增加约 60%。OpenAI 同期发布模型失准事件披露框架及六份案例报告。
OpenAI 展示如何借助 ChatGPT Work 与 Codex 的分析功能,把 AI 使用情况和支出转化为可追踪的业务价值。团队可据此了解 AI 的使用量与花费、识别培训需求,并将 AI 采纳程度与业务成果对应起来。
DACA-GRPO 为扩散语言模型强化学习引入去噪感知信用分配,可作为任意 GRPO 训练器的轻量即插即用增强。在三种 GRPO 基线方法上,它在涵盖数学推理、代码生成、约束满足与 JSON schema 遵循等七个 benchmark 上取得一致提升,最高增益分别为 5.6pp、7.4pp、36.3pp 和 5.9pp。
GPT-6 Astra 提升了 Cognition 旗下 Devin 测试软件并证明其可正常工作的能力,目标是让工程师减少代码审查、交付更多代码。Devin 由此可自行完成测试并验证结果是否可用。
一名 MIT 研究者用 GPT-5.6 Sol 搭配 Codex,自主运行量子计算实验并分析实验结果。GPT-5.6 Sol 还参与校准量子比特,这些实验步骤由模型自主完成。
1Password 使用 Codex 将工程生产力提升 21%,并让工程师快速构建新功能和内部工具。其工程师在维持严格安全政策的同时,将新功能和内部工具推进到生产就绪。
OpenAI 内部,编程智能体正在重塑 AI 研究。OpenAI 公布了关于智能体使用情况、实验速度、任务复杂度以及研究加速的早期数据。
GitHub 发布研究预览 Project HydraFusion,在 GitHub Copilot CLI 中通过运行时多模型编排为每个请求选择执行方案。它目前会在 Single、Cascade、Critique 三种模式中选择,用户通过 /experimental 和 /model 选用,费用按所调用模型的 token 标准费率计。
推荐理由:原文给出三种多模型编排模式,并列出三个编码基准上的质量与成本对比,便于评估这种编排方式的取舍。
OpenAI 发布 GPT-6 Astra,称其为目前最智能、对齐程度最高的模型,在计算机操作、编码、网络安全和科学等方向具备 SOTA 能力。官方摘要未给出参数规模、上下文窗口或开放时间等细节。
推荐理由:OpenAI 公布 GPT-6 Astra 在计算机操作、编码、网络安全与科学方向的能力覆盖,读者可据此了解新模型的定位。
Google 推出 Fairwind Program,面向 Google Cloud 客户、政府机构与网络安全伙伴提供 Gemini 3.8 Flash Cyber 加 CodeMender 的自主漏洞发现与修复能力。
Google DeepMind 发布 Gemini 3.7 Flash,称其为面向编码和 Agent 的最强主力模型,距 Gemini 3.6 Flash 发布仅三周。
推荐理由:原文列出 Gemini 3.7 Flash 相对 3.6 Flash 的多项基准提升与半价定价,便于判断是否值得升级。
Hugging Face 公布 ICML 2026 Open Reproductions 挑战结果,1,221 名参与者用各自的编码智能体在 19 天内提交 6,816 份复现日志,覆盖 2,226 篇论文,占会议接收论文的 34%。
推荐理由:复盘给出 2,226 篇论文的复现结论分布,并说明人在智能体审查流程中仍承担的具体环节。
Epoch 与 METR 发布长周期编程基准 MirrorCode,测试 AI 在仅有 CLI 访问时重写大型程序的能力,Claude Opus 4.7 用 14 小时、251 美元推理成本完成 METR 估计人类需 2-17 周的任务。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和面向代码安全的 3.5 Flash Cyber 三款模型。
推荐理由:三款模型同时给出 token 效率、单 token 价格与智能体基准变化,可作为评估智能体工作流成本的参考。
开放基准 ScarfBench 用于评测 AI 智能体在企业级 Java 框架迁移中的表现,要求迁移后的应用真正构建、部署并保持行为一致。它覆盖 Spring、Jakarta EE、Quarkus 三大生态,含 34 个应用、204 个迁移任务与 1,331 个专家编写的测试。
Mistral 在 AI Now Summit 2026 上发布面向工业工程的 AI 栈,联合 Airbus、BMW 和 ASML 优化设计、仿真与生产,并强调对专有数据、IP 和生产环境的完全控制。
Mistral 发布统一 AI 智能体 Vibe,Le Chat 更名为 Vibe,把工作与编码合并为同一智能体和同一授权,原有对话、设置和套餐随之保留。
推荐理由:Le Chat 更名并整合为工作与编码双模式的智能体,可对照其分档定价与 VS Code 接入了解产品定位。
Mistral 发布 Mistral Medium 3.5,这是一个 128B 稠密模型,以开源权重、修改版 MIT 许可发布,并成为 Mistral Vibe 和 Le Chat 的默认模型。
推荐理由:把编码智能体迁到云端并以 128B 开源权重模型驱动,读者可据此判断自托管部署与异步并行任务的成本变化。
Google 在 Nature 发表论文介绍 ERA,这是用 Gemini 为科学家编写和优化科学代码的研究工具,在基因组学、公共卫生、卫星图像分析、神经科学预测、通用时间序列预测和数学等基准上达到专家级表现。
推荐理由:ERA 在基因组学、公共卫生等多个基准上达到专家级表现,正文另列出八项已发表的跨学科科研应用。
Google DeepMind 发布 Gemini 3.5 模型系列,首个版本 3.5 Flash 今天起在 Gemini 应用、Google Search 的 AI Mode、Google Antigravity 和 Gemini API 开放,3.5 Pro 已在内部使用并计划下月推出。
推荐理由:原文用 Terminal-Bench 2.1、MCP Atlas 等基准与 4 倍输出速度做横向对比,读者可据此判断速度与智能体能力能否兼得。
Google DeepMind 分享 Gemini 驱动的编程智能体 AlphaEvolve 发布一年来的跨领域落地成果。
Jack Clark 在 Import AI 第 455 期中表示,到 2028 年底出现无人参与、能自主构建自身继任者的自动化 AI 研发的概率在 60% 以上。
Google Research 提出的 ReasoningBank 让智能体从成功与失败经验中提炼高层推理模式,实现测试时自我演化。在 Gemini-2.5-Flash 上,WebArena 成功率比无记忆基线高 8.3%,SWE-Bench-Verified 高 4.6%,每任务少用近 3 个执行步骤。配套的 MaTTS 通过并行与串行扩展,把探索轨迹也转化为高质量记忆。
Mistral AI 发布 Spaces CLI,用 spaces init、cd、spaces dev 三条命令即可从零得到带热重载、数据库和自动生成 Dockerfile 的多服务项目。
推荐理由:Mistral 把 CLI 同时服务人类与编码智能体的设计原则整理成检查清单,可对照改造自家开发者工具。
Google 发布 Vibe Coding XR 工作流,将 Gemini 与基于 Web 的 XR Blocks 框架结合,把自然语言直接转成具备物理感知的 Android XR 应用,耗时低于 60 秒。
Mistral AI 发布 Mistral Small 4,称其是首个把 Magistral 的推理、Pixtral 的多模态和 Devstral 的编码智能体能力统一进单一模型的 Mistral 模型,以 Apache 2.0 许可开源。
推荐理由:Mistral Small 4 把推理、多模态与编码能力合进一个开源模型,读者可据此评估单模型替代多模型组合的部署取舍。
Mistral 发布 Leanstral,首个面向 Lean 4 的开源代码智能体,Apache 2.0 开源并提供免费 API。该模型激活参数 6B,采用稀疏架构,支持任意 MCP,并针对 lean-lsp-mcp 训练,也可在 Mistral vibe 的 agent 模式中使用。
Mistral 基于其开源编码助手 Vibe 构建了一个自动为 Rails 代码库生成和改进 RSpec 测试的智能体,可在 CI/CD 中无人干预运行。该智能体依靠仓库级 AGENTS.md 执行计划、按文件类型拆分的 Skills 文件,以及 RuboCop 与 SimpleCov 自定义工具完成生成、校验和自校正。
Mistral 发布终端原生编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型系列驱动。2.0 新增自定义子智能体、多选澄清、斜杠命令技能、统一智能体模式与自动更新,已在 Le Chat Pro 和 Team 套餐上线,超出额度可按量付费或自带 API key。
推荐理由:原文列出 Vibe 2.0 新增的子智能体、斜杠命令技能等控制项与定价变化,可供判断终端编码智能体的使用成本。
Mistral AI 发布新一代编码模型系列 Devstral 2,包含 123B 的 Devstral 2 和 24B 的 Devstral Small 2,两者均开源,分别采用修改版 MIT 和 Apache 2.0 许可。
推荐理由:材料给出 Devstral 2 在 SWE-bench Verified 上 72.2% 的成绩,并附上与 DeepSeek V3.2、Claude Sonnet 4.5 的人工评测胜负对比。
Mistral 发布 Codestral 25.08 及配套企业编码栈,涵盖补全、语义检索、智能体工作流和 Mistral Code IDE 插件,今日起可用于企业部署。