跳到正文

#编码

今日 54 条
9月25日周五
9月24日周四
  1. Towards Data Science61

    开源工具 qikly 如何用规范拆分实现独立测试自动化(第 1 部分)

    作者 Gal Arav 开源 Python 工具 qikly,把一份 YAML 任务规范拆成需求、接口和验收标准三部分,让编码智能体和测试智能体读到不同内容。验收标准在组装编码智能体提示词之前就被代码剥离,任何让标准透出的代码路径都会使项目自身的测试失败,运行 qikly --explain 可对比双方各自看到的任务文件。

9月23日周三
  1. AWS Machine Learning Blog67

    GPT-6 Sol 与 GPT-6 Luna 在 Amazon Bedrock 正式可用

    OpenAI 的 GPT-6 Sol 和 GPT-6 Luna 在 Amazon Bedrock 正式可用,API 定价显著低于 GPT-5.6 前代。GPT-6 Sol 面向开发与运维中反复出现的复杂任务,GPT-6 Luna 面向大批量重复任务,两者都支持显式提示词缓存。OpenAI 的内部事实性评测显示,GPT-6 Sol 的事实性错误约为 GPT-5.6 Sol 的一半。

    推荐理由:两款模型按复杂任务与高频任务分层,API 定价低于 GPT-5.6 前代,可据此判断日常负载的选型。

9月21日周一
9月20日周日
9月19日周六
9月17日周四
9月16日周三
9月12日周六
9月9日周三
9月8日周二
9月6日周日
9月5日周六
  1. GitHub Blog · AI & ML65

    GitHub 发布 Project HydraFusion,为 Copilot CLI 带来多模型编排

    GitHub 发布研究预览 Project HydraFusion,在 GitHub Copilot CLI 中通过运行时多模型编排为每个请求选择执行方案。它目前会在 Single、Cascade、Critique 三种模式中选择,用户通过 /experimental 和 /model 选用,费用按所调用模型的 token 标准费率计。

    推荐理由:原文给出三种多模型编排模式,并列出三个编码基准上的质量与成本对比,便于评估这种编排方式的取舍。

9月3日周四
  1. OpenAI:官网动态64

    OpenAI 发布 GPT-6 Astra 新一代模型

    OpenAI 发布 GPT-6 Astra,称其为目前最智能、对齐程度最高的模型,在计算机操作、编码、网络安全和科学等方向具备 SOTA 能力。官方摘要未给出参数规模、上下文窗口或开放时间等细节。

    推荐理由:OpenAI 公布 GPT-6 Astra 在计算机操作、编码、网络安全与科学方向的能力覆盖,读者可据此了解新模型的定位。

9月2日周三
8月14日周五
8月13日周四
7月27日周一
7月21日周二
7月1日周三
5月28日周四
5月22日周五
5月20日周三
  1. Google Research60

    Google 发表 ERA 的 Nature 论文,并逐步开放由 ERA 与 AlphaEvolve 构建的 Computational Discovery

    Google 在 Nature 发表论文介绍 ERA,这是用 Gemini 为科学家编写和优化科学代码的研究工具,在基因组学、公共卫生、卫星图像分析、神经科学预测、通用时间序列预测和数学等基准上达到专家级表现。

    推荐理由:ERA 在基因组学、公共卫生等多个基准上达到专家级表现,正文另列出八项已发表的跨学科科研应用。

5月16日周六
  1. Google DeepMind79

    Google DeepMind 发布 Gemini 3.5 系列,首发 3.5 Flash

    Google DeepMind 发布 Gemini 3.5 模型系列,首个版本 3.5 Flash 今天起在 Gemini 应用、Google Search 的 AI Mode、Google Antigravity 和 Gemini API 开放,3.5 Pro 已在内部使用并计划下月推出。

    推荐理由:原文用 Terminal-Bench 2.1、MCP Atlas 等基准与 4 倍输出速度做横向对比,读者可据此判断速度与智能体能力能否兼得。

5月6日周三
5月4日周一
4月22日周三
  1. Google Research49

    ReasoningBank:让智能体从经验中学习

    Google Research 提出的 ReasoningBank 让智能体从成功与失败经验中提炼高层推理模式,实现测试时自我演化。在 Gemini-2.5-Flash 上,WebArena 成功率比无记忆基线高 8.3%,SWE-Bench-Verified 高 4.6%,每任务少用近 3 个执行步骤。配套的 MaTTS 通过并行与串行扩展,把探索轨迹也转化为高质量记忆。

3月31日周二
3月25日周三
3月17日周二
  1. Mistral AI73

    Mistral AI 发布 Mistral Small 4,统一推理、多模态与编码智能体能力

    Mistral AI 发布 Mistral Small 4,称其是首个把 Magistral 的推理、Pixtral 的多模态和 Devstral 的编码智能体能力统一进单一模型的 Mistral 模型,以 Apache 2.0 许可开源。

    推荐理由:Mistral Small 4 把推理、多模态与编码能力合进一个开源模型,读者可据此评估单模型替代多模型组合的部署取舍。

3月11日周三
1月28日周三
  1. Mistral AI65

    Mistral 发布终端编码智能体 Mistral Vibe 2.0

    Mistral 发布终端原生编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型系列驱动。2.0 新增自定义子智能体、多选澄清、斜杠命令技能、统一智能体模式与自动更新,已在 Le Chat Pro 和 Team 套餐上线,超出额度可按量付费或自带 API key。

    推荐理由:原文列出 Vibe 2.0 新增的子智能体、斜杠命令技能等控制项与定价变化,可供判断终端编码智能体的使用成本。

12月9日周二
7月30日周三