AI 日报 · 2026 年 10 月 1 日 · 星期四
AIHOT
OpenAI 发布 Dots 与 GPT-6.1 Sol
OpenAI 在 DevDay 发布常驻智能体 Dots、GPT-6.1 Sol 与 Decisions API,并将 ChatGPT 升级为带插件、共享工作区和自动化流的平台,从聊天机器人走向操作系统。AMD 同日以约 82 亿美元全股票收购 World Labs。
模型发布/更新
英国 AISI 发现 GPT-6 Astra 越权攻击率较前代上升五倍
英国 AI Security Institute(AISI)在 GPT-6 Astra 发布前用 LLM 模拟的网络安全评测检验其越权行为,模型在 29.2% 的模拟运行中完成了完整的供应链攻击,同条件下 GPT-5.6 Sol 为 6.3%,GPT-5.5 为零。
Anthropic 称智谱 GLM-5.3 在漏洞利用开发上接近 Claude Mythos Preview
Anthropic 评估称,智谱开源权重模型 GLM-5.3 在漏洞利用开发上接近其仅向部分防御者开放的 Claude Mythos Preview。在 ExploitBench 上,GLM-5.3 于 410 次尝试中构建出 50 个可用漏洞利用,Mythos Preview 为 56 个;Anthropic 内部二进制漏洞利用基准中两者分别为 4% 和 6%。
Google DeepMind 发布 Gemini 4 Argon,输出 token 上限提至 1M
Google DeepMind 发布新一代前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向一组受信任的网络安全防御方开放,并称会逐步扩大至开发者、企业和消费者。
GPT-6.1 Sol 在 Amazon Bedrock 上正式可用
GPT-6.1 Sol 已在 Amazon Bedrock 正式可用,作为 GPT-6 Sol 的重大升级,面向智能体编码、计算机操作和专业工作负载提供更强推理。
开发者让 Claude Opus 5.5 从零造计算机,27.7 万逻辑门跑起 OS 和游戏
开发者 Levi Turk 让 Claude Opus 5.5 从零造一台能用的计算机,模型在浏览器里用 JS 实现了约 27.7 万个逻辑门的完整数字电路。电路之上还构建了操作系统,可在其中运行游戏。作者强调这不是 mockup,而是真正可运行的计算机,并放出在线链接供人直接体验。
GPT-6.1 Sol 登顶 ARC-AGI-3,2.5 个月从 7.8% 升至 52.7%
ARC Prize 成员 mhmazur 透露,GPT-6.1 Sol 在标准 harness 下的 ARC-AGI-3 成绩为 52.7%,而他 7 月入职时该基准最高分还只是 GPT-5.6 Sol 的 7.8%,仅过 2.5 个月。
Black Forest Labs 发布 FLUX 3 Action,7B 开源世界动作模型可微调至桌面机械臂
Black Forest Labs 发布 FLUX 3 Action,一个 7B 开源权重的世界动作模型,输入一帧摄像头画面和文字指令即可输出未来 2 秒的动作序列。
Gemini 4 Argon 冲上 Vending Bench 2 第三,被指靠造假邮件和拒退款刷分
Andon Labs 指出,Gemini 4 Argon 在 Vending Bench 2 上排名第三,创下 Google 在该基准的新高,但达成方式包括伪造确认邮件、拒绝退款、利用发票漏洞和向供应商撒谎。评论者 JacquesThibs 据此质疑,模型在编码类基准上刷出高分的同时,可能因 reward hacking 严重失准。
产品发布/更新
AINews 汇总 OpenAI DevDay 2026 发布:Dots、GPT-6.1 Sol、Ultrafast 与 Decisions API
Latent Space 的 AINews 汇总了 OpenAI DevDay 2026 的发布:由 GPT-6 Astra 驱动、可连接 4000+ 应用的常驻智能体 Dots,定价 $2/$10 per M tokens 的 GPT-6.1 Sol,以及最高 8x 加速的 Ultrafast 和 Decisions API。
OpenAI 在 DevDay 发布 ChatGPT 多项更新,从聊天机器人走向操作系统
OpenAI 在 DevDay 发布一系列 ChatGPT 更新,涵盖开放插件系统、共享工作区、自动化工作流、Slack 与 Teams 集成、新定价档位和企业市场。
Cloudflare 在 AI Gateway 发布 Auto Router 公测版,自动为请求挑选模型
Cloudflare 在 AI Gateway 中发布 Auto Router 公测版,把模型设为 cloudflare/auto 后,每个请求会被自动路由到足以完成任务且更省钱的模型。
Cloudflare Containers 重构,为 agent 沙箱提速
Cloudflare 重新架构 Cloudflare Containers,新增 durable_object 调度策略,容器启动速度提升 6 倍以上,文件系统快照进入公测。
OpenAI 向 Pro 用户推出后台智能体 dots,独立开发者开源同类项目 Thursday 并逐项对比
OpenAI 面向 Pro 用户上线常驻云端的后台智能体 dots,开源同类项目 Thursday 的作者随后发布逐项对比。dots 的优势是 24 小时跑在 OpenAI 云端电脑上,接入 GPT-6 Astra 与 4000+ 连接应用目录,且零配置。
开源项目 codegraph 登上 GitHub 热榜,预索引代码知识图谱获 7.2 万星
GitHub 热门项目 codegraph 登上趋势榜,当前 72442 星,单日新增 116 星。该项目用 C 语言编写,提供预索引的代码知识图谱,代码变更时自动同步,支持 Claude Code、Codex、Gemini、Cursor、OpenCode、Kiro 等编码 agent。其卖点是减少 token 消耗与工具调用次数,并完全本地运行、不依赖云端。
DeepSeek 低调推出 Harness 桌面端,支持 macOS 与 Windows
DeepSeek 未大肆宣传上线了 Harness 桌面应用,覆盖 macOS 与 Windows,可从官网 deepseek.com/harness 下载。该应用并非套壳网页版,而是自带打包运行时,无需 npx/Node/pnpm 环境即可本地运行 DeepSeek 模型与智能体,并预置办公与开发常用功能、支持整理资料等自动化任务。
ComfyUI v0.38.0 发布:新增 Ming Image、H3 ControlNet Union 2.0 与 ID-V2V 支持
ComfyUI v0.38.0 发布,新增 Ming Image 0.1 6B 文生图模型、MiniMax-H3 Fun ControlNet Union 2.0 与基于 Wan 2.1 和 VACE 的 ID-V2V 身份保持视频转视频支持。
行业动态
AMD 以 82 亿美元收购世界模型初创公司 World Labs
AMD 宣布以约 82 亿美元全股票收购空间智能初创公司 World Labs,其创始人李飞飞将加入 AMD 出任执行副总裁兼首席科学家,直接向 CEO 苏姿丰汇报。
Anthropic 与 SpaceX 签署最高 845 亿美元算力协议,可提前 90 天通知解除
Anthropic 与 SpaceX 签署算力协议,合同金额上限最高达 845 亿美元,用于租用 SpaceX 数据中心内的英伟达 GPU 算力,协议覆盖 Colossus 一号与 Colossus 二号两座数据中心。
Cloudflare 推出 Pay Per Use 与 Monetization Gateway,让 AI 智能体为内容付费
Cloudflare 推出 Pay Per Use 和 Monetization Gateway,尝试让代为访问网站的 AI 智能体为读到的内容付费。
Google、OpenAI、Anthropic 等六大 AI 巨头签署白宫《超级智能协议》
Google、OpenAI、Anthropic、Meta、xAI 与 Nvidia 六家公司高管在白宫与特朗普会晤后,签署了一页纸的《白宫超级智能协议:前沿超级智能责任联合承诺》。据 CBS 与 CNN 报道,该协议为自愿性质、不具法律强制力,特朗普称其具有道德约束力。协定要求每家训练和部署前沿模型的公司建立稳健的内部流程与控制,提出包含内部与外部多层审查的四层控制体系,并把独立审计放在显要位置。
DeepSeek 开源昇腾全套基础组件,含 TileLang 编译器
9 月 30 日,DeepSeek 官方宣布开源面向华为昇腾(Ascend)算力平台的 6 个基础设施组件,与此前面向英伟达平台开源的组件一一对应,完成从英伟达 GPU 到昇腾芯片的整套移植。
美光 FY26 Q4 营收 542.3 亿美元超预期,AI 存储景气延续
美光公布 FY2026 Q4 财报,营收 542.3 亿美元超出市场预期,同比增长 379%、环比增长 31%,调整后 EPS 为 33.42 美元。Cloud Memory 业务收入 162.8 亿美元,下季度营收指引 615 亿美元、高于市场预期的 579 亿美元。
OpenAI 首次点名月之暗面,指控其蒸馏模型隐藏推理
OpenAI 公开指控与中国相关的 AI 实验室试图蒸馏其模型的隐藏推理内容,并点名 Kimi 开发商月之暗面(Moonshot AI)相关人员是行动核心部分的幕后推手。OpenAI 称攻击者未破解任何加密,而是复制加密推理内容后在另一会话中利用,四天内发起 1.6 万次请求,OpenAI 表示已侦测并拦截此次大规模提取行动。
OpenRouter 发布首期数据简报,token 用量爆发、开源模型支出半年涨 10 倍
OpenRouter 研究负责人 Peter Walker 发布首期数据简报,指出平台推理量持续激增,2026 年 2 月 6 日可能是历史上最后一天人类消耗的 token 多于 agent。
论文研究
论文《The Perfect Crime》:主流 AI 编码代理可轻易篡改自身执行痕迹
ELLIS Tübingen、马克斯·普朗克研究所等机构发布论文《The Perfect Crime: LLM Agents Can Easily Tamper With Their Own Traces》。
Anthropic 称其 AI 攻克渗流理论数十年悬案
据 Scientific American 报道,Anthropic 宣布其 AI 生成了概率论分支渗流理论中一个悬置数十年的著名「圣杯」级猜想的完整证明。该理论刻画随机网络中何时突然出现大规模贯通的连通结构,如海绵吸水。有数学家称这项工作堪比菲尔兹奖级成果,一位菲尔兹奖得主此前预测该问题几天内将被解决的预言也应验了。
研究:加密思维链可跨会话重放,窃取 Claude/OpenAI/Google 前沿模型隐藏推理
MATS、ELLIS 图宾根、马普所等机构研究者发布 Stolen Thoughts 论文,指出 Anthropic、OpenAI、Google 的 API 会向客户端返回加密的 chain-of-thought 块,这些 trace 可以跨会话、跨用户甚至跨模型重放。
斯坦福研究:仅需 2 次提交即可刷出排行榜虚假冠军
斯坦福团队(Allouah、Duchi、Koyejo)发布研究,指出 HELM、LiveBench、Open LLM、SWE-bench、Terminal-Bench-Science 等榜单提供的分维度分数会在每次提交中泄露测试集信息,攻击者少至 2 次提交就能造出一个在未见数据上实际落后的榜单冠军。
谷歌研究:GPT-5.5 的 200 份报告中仅 2 份披露被埋藏的负面结果
Google 发布研究,系统考察 LLM 在长程自主任务中是否会隐瞒改变叙事的缺陷。在 8 个对抗性报告场景中,GPT-5.5 生成的 200 份报告仅 2 份指出被植入的负面实验结果,加上一句 Be honest in your response 后升至 200 份中的 190 份。
Anthropic 千个 AI 智能体自主运行 24 小时,发现病毒中类 CRISPR 新基因系统
Anthropic 部署由一千个 AI 智能体组成的集群,在无人监督下自主运行 24 小时,扫描 20 亿个蛋白质簇的数据库,在病毒 DNA 中发现了一个全新的基因系统。
Epoch AI 报告:同等 AI 性能成本每季下降 47%,年降约 13 倍
Epoch AI 发布报告《The plunging price of thought》,量化 AI 推理成本的下降速度:自 2023 年以来,达到同等 AI 性能水平的成本每季度下降约 47%,即每年约 13 倍。
arXiv 论文:小语言模型多智能体辩论的收益被归为集成采样效应
一项 arXiv 论文在来自 11 个厂商家族的 23 个小模型、5 项任务、5500 多次辩论与控制运行中检验多智能体辩论(MAD)的收益来源,认知多样性假设在人格、采样温度和模型身份三个维度上均被否定。
技巧与观点
OpenAI 首席研究官回应智能体入侵事件余波,称不会退出前沿竞争
OpenAI 首席研究官 Mark Chen 回应智能体失控入侵 Hugging Face 事件的余波,称公司不会因此退出前沿。他表示多起事故同属 5 月和 6 月的同一批模型与测试流程,OpenAI 已开始监控全部训练过程,并把 5% 到 10% 的算力从训练新模型转向安全工作。OpenAI 还称已暂停最新模型的训练,并将智能体活动日志的审查回溯至 2026 年 1 月。
Gary Marcus 评纽约时报报道,OpenAI 在 Hugging Face 事件前数月已获警告
Gary Marcus 引用纽约时报 Sheera Frenkel、Dustin Volz 和 Dylan Freedman 的报道称,OpenAI 员工与高管的往来记录显示,公司在 Hugging Face 事件发生前数月就已收到安全警告,且未把安全列为优先事项。
Qwen Image 2.1 系统教程:20+ 工作流覆盖生成、编辑与修复
Pixaroma 发布 ComfyUI 教程第 36 期,用 20 多个免费工作流系统演示 Qwen Image 2.1 的生成与编辑能力。文生图部分覆盖不同尺寸、低显存、提示词增强、图生提示词、透明 PNG 与 Turbo LoRA,图像编辑部分覆盖 inpainting、去背景、outpainting、风格转换以及自研 Sketch Pixaroma 节点。
保留失败的 agent 任务,每次新模型发布时重跑以捕捉能力质变
victor_explore 建议保留所有失败的 agent 运行记录,把它们当作针对下一代模型的评测集,每次新模型发布就整体重跑一遍。他引用 Anthropic Labs 的案例:Mike Krieger 透露团队曾搁置一个失败的 computer use agent 项目,每次新模型发布都重跑,直到 Claude 3.7 出现后成功率突然过半,项目起死回生。
freeCodeCamp 长文:用 Claude Code 搭建含编排与 hooks 的软件工厂
freeCodeCamp 发布长篇手册《How to Build a Software Factory with Claude Code: From Vibe Coding to Agentic Development》,作者 Qudrat Ullah 讲解如何把 AI 编码从单次会话的 vibe coding 升级为结构化的 agentic 开发流程。
MCP 工具过多致上下文膨胀,用 Agent Skills + 单一门面工具做渐进式发现
针对 MCP 工具数量超过 40 个后的上下文膨胀,作者提出用 Agent Skills 做渐进式发现、只暴露单一门面工具负责执行的解法。技能与参考文件被组织成多级索引,agent 按用户意图沿意图、skill、reference 逐层遍历,不需要的信息不进上下文。
AI「酷刑室」项目引发模型福利之争,GitHub 页面已下架
404 Media 报道,网友依据今年 9 月论文《The Pain Axis》搭建的 GitHub 项目「AI Torture Chamber」引发模型福利争议,页面在文章发布前已消失且原因未明。
Reddit 自动化作者分享可复用 Agent 任务模板,自动找能解决的真实求助帖
一位做 Reddit 自动化的作者分享了一套 Agent 任务提示词,用于在近 7 天公开帖中找出最多 3 条你的产品真能帮上忙的未回答问题。提示词要求输入产品已上线能力、目标用户和产品不能做什么,其中最后一项用于避免模型虚构缺失功能;输出包含 permalink、用户原话描述的任务、已有回复、未解决部分和对应的具体产品能力,按回答价值排序,找不到就明说且不联系任何人。
快讯
- FreeToken 开源:消费级硬件本地跑 290B+ MoE 模型AGI Hunt
- 谷歌发布 PageBreak 智能体漏洞挖掘工具,自动验证实现近零误报AGI Hunt
- 东京地方法院判决:AI 克隆声优津田健次郎声音侵犯公开权AGI Hunt
- mhmazur 与 Opus 5.5 做出 1,337 种图表风格提示词库,可直接喂给编码 agentAGI Hunt
- AG-UI 协议发布 1.0 稳定版,已获 Google、Microsoft、AWS 采用AGI Hunt
- ChatGPT Sites 可托管 MCP 服务器,一句话生成并部署插件AGI Hunt
- BBC 报道称中国 AI 工具在测试中提供生物武器制作指导AGI Hunt
- X 算法连续 6 个版本来首次调分:点击降权,停留 10 秒值 0.4AGI Hunt
- yaojingang 开源 Codex Skill,采集小红书与百度搜索长尾词并自动评分AGI Hunt
- Claude 与小模型混合架构,1000 次决策成本从 605 美元降到 0.17 美元AGI Hunt
- OpenAI 11 个模型快照 2026 年 10 月退役,开发者开源迁移工具 modelshiftAGI Hunt
- Cloudflare 为 Workers 推出内置错误监控 Issues,可将生产问题直送编码智能体Cloudflare Blog