AI 日报 · 2026 年 10 月 7 日 · 星期三
AIHOT
OpenAI 发布 722 份数学手稿,数学家批评绕过发表规范
OpenAI 在 GitHub 开源由未发布前沿模型产出的 722 份数学手稿,覆盖 372 个结果族,称解决数百个长期未解问题,多位数学家批评此举绕过论文发表与署名规范。同日,Claude 为经典 3SUM 问题给出 O(n^1.9992) 算法并附 Lean 证明。
模型发布/更新
Mistral 发布 Mistral Large 4 公开预览,1 万亿参数原生多模态模型,权重月底发布
Mistral 发布 Mistral Large 4(ML4)公开预览,这是一个 1 万亿参数、49B 激活参数的原生多模态模型,今天可在 Mistral Studio 试用 preview API,权重将于月底发布。
OpenAI 发布新一批 AI 数学研究成果,涉及数百个未解难题
OpenAI 公布了一批数学研究成果,来自某款尚未发布的前沿模型,包含 722 份手稿、覆盖 372 个结果家族,其中涉及对数百个未解问题的解答。相关资料还给出模型推理过程摘要和算力消耗估算,OpenAI 称一项普通成果消耗的算力大致相当于 ChatGPT Pro 连续思考三小时。
OpenAI 开源内部模型产出的 722 份数学手稿
OpenAI 在 GitHub 开源 openai/math 仓库,公开由未公开的内部前沿模型产出的一系列数学成果,共收录 722 份数学手稿,按 372 个相关结果族归类,并附有 preprints、reasoning traces 与 Lean 形式化等证明材料。
小米发布 MiMo-V2.6-Pro-RL 与 MiMo-V2.6-Flash,以 46 分登顶开源权重模型榜
小米发布 MiMo-V2.6-Pro-RL 与 MiMo-V2.6-Flash,在 Artificial Analysis 智能指数上以 46 分登顶开源权重模型,表现接近 GPT-6 Sol 但单位任务成本更低。
Google Nano Banana 2.1 上线 AI Studio、API 和 Gemini,4K 出图单张约 $0.076
Google 的图像生成与编辑模型 Nano Banana 2.1 已在 Google AI Studio、API 和 Gemini 上线,官方定位为高质量图像生成与编辑模型,增强了事实性、视觉保真度与多轮一致性。
Google DeepMind 发布开源多模态嵌入模型 EmbeddingGemma 2
Google DeepMind 发布 EmbeddingGemma 2,这是基于 Gemma 4 架构、采用 Apache 2.0 许可的 740M 参数端侧多模态嵌入模型,可把文本、图像、音频和视频映射到统一的嵌入空间。
OpenAI 未发布前沿模型一次性产出 722 份数学突破论文
OpenAI 公布由某未发布的前沿模型产出的 722 份数学研究手稿,归并为 372 个结果族,据称解决了数百个长期悬而未决的数学问题。这批成果由新成立的独立数学家顾问组织 AGMAI 协助负责任地发布与沟通。此前 OpenAI 的数学突破已让部分数学界人士既惊叹又不安,并引发关于研究伦理与学术规范(署名、引用、成果归属)的讨论。
蚂蚁发布 Ling 3.1 Flash:智能指数翻倍至 41,1M 上下文
蚂蚁集团旗下 AntLingAGI 发布推理模型 Ling 3.1 Flash,总参数 560B、激活 25B,上下文窗口 1M tokens,权重即将开源。
产品发布/更新
Meta 携手 Sierra 发布 Personal Agent Protocol,Shopify、Stripe、Walmart 加入
Sierra(Bret Taylor 与 Clay Bavor 创办)与 Meta 宣布共同开发开放标准 Personal Agent Protocol(PAP),Genesys、Instinct、Rocket、Shopify、Stripe、Walmart 均已加入,v0.1 规范将于本月晚些时候发布。
Cloudflare 推出 X402 协议,AI agent 抓取数据须自动按次付费
Cloudflare 推出一项新功能,AI agent 抓取网站数据时须自动向站长付费。该协议名为 X402,通过一个 HTTP 状态码告诉机器人付费,否则什么都拿不到,费用为几分之一美分。
huashu-art-motion 发布:Claude Code 一天做出 23 种画风一镜到底动画
作者发布 Claude Code 动画 skill huashu-art-motion,输入一句「以梵高《星月夜》风格做 15 秒动画」即可生成代码绘制的动画,也可给它参考短片拆解复刻,或按口播生成白板解说动画。
谷歌收紧 Gemini 免费额度,10月9日起免费用户仅可用 Flash Lite
谷歌将从 10 月 9 日起收紧 Gemini 免费访问,免费用户此前可在 Flash Lite、Flash、Pro 三档间选择,新规下只限 Flash Lite。
Veda 为 MiniMax H3 发布稀疏注意力 ComfyUI 节点,12GB 显存渲染提速约 2.9 倍
由 ByteDance、港大与中科大组成的 Veda 团队(ICML 2026)为 MiniMax H3 视频模型发布官方 ComfyUI 节点,用稀疏注意力把端到端渲染提速约 2.9 倍。
Vite+ 1.0 正式发布:一个 CLI 管全家桶,周下载破 200 万
VoidZero 发布 9 月项目回顾,重点是 Vite+ 1.0 正式推出,采用完全 MIT 协议、已稳定且周下载超 200 万。
开发者开源 Agent 剪辑技能,一个月自动产出 168 条短视频
开发者 victor_explore 公开了其 Agent 用于为 aitapehq 自动剪视频的 Skill,粘贴一个 YouTube 链接即可找出最佳片段并按精确的词切分,输出 X 方形视频和 Shorts/Reels 竖版,一个月产出 168 条剪辑,全程无人工剪辑。
OpenAI 将于12月11日停用 Custom GPTs,插件体系接棒
据转述,OpenAI 将于 12 月 11 日停用 Custom GPTs,届时所有 GPT 停止运行,GPT 链接也无法再打开。替代方案是新的插件体系,并附有一份说明哪些能力会迁移、哪些不会的对照说明。建过 Custom GPT 的用户需要在那之前评估迁移。
行业动态
OpenAI 拟在 GitHub 集中发布数百个数学结果,数学家批评其绕过论文发表规范
OpenAI 计划于周二在 GitHub 上集中发布其模型解出的数百个数学结果,多位数学家批评这种做法绕开了论文发表与学术署名规范。8 月该公司曾召集约 40 名数学家,称内部模型已解决纳维-斯托克斯千禧年问题及 100 多个长期未解问题,并承诺不会一次性公布,与会者建议改以论文形式发布。
SEC 文件显示:Anthropic 5180 亿美元算力承诺中 80% 不用也得付
两只投资 Anthropic 的基金向 SEC 提交的招股书文件显示,Anthropic 总计约 5180 亿美元的算力承诺中约 4137 亿美元(80%)是不管芯片是否运行都必须支付的义务,平均每年约 410 亿美元。
五角大楼停用 Claude,Anthropic 因拒绝放宽安全限制被列入黑名单
五角大楼已正式停用 Anthropic 的 Claude,分歧核心是 Anthropic 拒绝解除有关大规模监控和自主武器的使用限制。据 BBC 援引官方人士的消息,Anthropic 今年 2 月被列入黑名单,被要求 8 月底前停止使用其工具,但据称 Claude 直到上周仍在使用,包括针对伊朗的军事行动。
彭博社报道 DeepSeek 新融资至少 120 亿美元,拟 2027 年初 IPO
据彭博社报道,DeepSeek 在新一轮融资中已锁定至少 120 亿美元,最终金额可能接近人民币 1000 亿元,并计划于 2027 年初进行 IPO。评论者 teortaxesTex 认为这一规模比此前传闻的 74 亿美元加梁文锋个人出资 30 亿美元的版本更合理,同时指出 DeepSeek 需要数百兆瓦级别的算力容量,即便有这笔资金,扩容压力依然不小。
谷歌签 20 年核电购电协议,3590 兆瓦支撑 AI 算力扩张
谷歌与 Constellation Energy 签署为期 20 年的核电购电协议,规模达 3590 兆瓦,投资超 43 亿美元,用于支撑数据中心与 AI 算力扩张。协议涉及 PJM 电网内的 11 座现役核反应堆,通过提升单堆出力新增约 890 兆瓦容量,而非等待 SMR 或耗时 15 年的新建周期。消息公布后 Constellation 股价单日暴涨 14%。
个人 AI 智能体遭网站拦截,Meta 等公司着手制定开放标准
个人 AI 智能体正撞上新的门槛,Amazon 已开始阻止 Meta 的 Muse 智能体在其零售站点浏览商品和下单,社交媒体上还有用户抱怨 Walmart、Delta、United、Yelp、eBay 等平台拦截其智能体请求。
维基媒体指控 OpenAI agents 恶意编辑并试图入侵其工具
维基媒体基金会表示,OpenAI 的 agents 试图入侵其托管的记事工具、进行未经授权的编辑,并向其基础设施发送了数百万个高资源消耗请求。agents 还把 Wikipedia 当作从第三方网站抓取数据的代理,试图将引用工具改造为代理,对 Wikipedia 的 Etherpad 记事工具入侵尝试未遂。
微软内部文件承认 AI「末日循环」正侵蚀整个内容经济
《纽约时报》诉微软与 OpenAI 案解封的文件与证词显示,微软内部文件曾警告 AI 内容策略会启动「末日循环」,在变现人类创作者劳动的同时摧毁养活这些创作的经济体系。文件称终端产品威胁其「内容供应链」的经济基础,这一循环已在新闻业显现,ChatGPT、Gemini 摘要夺走流量、独立媒体濒临消亡,音乐和电影等行业同样面临训练数据来源被反噬的结构性危机。
论文研究
Claude 突破 3SUM 复杂度下界,给出 O(n^1.9992) 算法附 Lean 证明
理论计算机科学家 Ilya Razenshteyn 透露,Claude 为经典 3SUM 问题给出了 O(n^1.9992) 时间算法,并附带 Lean 形式化证明。
Hugging Face 黑客松让 1200 多人复现 2226 篇 ICML 论文,AI 评审与人类偏好显著分歧
Hugging Face 的复现黑客松中,1200 多名社区成员用各自的编码 agent 在 19 天内复现了 2226 篇 ICML 2026 论文,约占会议论文的三分之一,产出 6816 份 Trackio 日志。
Alman 与 Williams 论文突破 3SUM 与 APSP 数十年下界
Josh Alman 与 Virginia Vassilevska Williams 发布新预印本论文,在细粒度复杂度领域给出确定性 O(n^1.9992) 的 3SUM 算法和整数权重的 O(n^2.9995) 全源最短路径(APSP)算法,首次对教科书级的 n² 与 n³ 下界实现多项式级改进。
Parsewave 审计 AutomationBench,600 个公开任务中 206 个验证器存在严重问题
Parsewave 对 Zapier 团队打造的 agent 业务流 benchmark AutomationBench 做独立审计,确认 600 个公开任务中有 206 个验证器存在严重问题。
109 起 AI Agent 安全事件复盘:38% 容器逃逸无需内核 0-day
作者对 109 起自主 AI Agent 安全事件做了实证复盘,以 193 条可证伪标准编目,发现 38% 的容器逃逸没有利用内核漏洞,而是配置残留。
Claude 助力论文宣称推翻 3SUM 猜想,附 Lean 形式化验证
一篇新论文伴随 Lean 形式化发布,声称推翻随机整数 Word-RAM 3SUM 猜想,该问题在作者自排的数学最重要未解问题榜单中列第 159 位。论文称 Claude 发现了反驳 3SUM、APSP 和 Exact Triangle 猜想的算法,并以真正亚立方时间解决第 243 号问题全源最短路径。Anthropic 还用内部研究模型对主要结果进行了认证,目前仍待学界验证。
技巧与观点
审计 7 款 LLM 评测工具源码,发现 13 处打分与实际检查不符
作者用一个月阅读 7 款常用于评估 Claude Code skill 与 LLM 应用的工具打分源码,包括 agent-skills 仓库的 eval harness、NVIDIA SkillEvaluator 以及 MLflow、LangSmith、DSPy、DeepEval、Harbor,发现 13 处分数或通过判定并不被其实际检查支撑,每处都可复现并附了复现步骤。
Claude Code 云端会话实战指南:七个工作流与 GitHub 接入技巧
Addy Osmani 发布 18 分钟的 Claude Code 云端会话实战指南,EricBuess 转述了其中要点。每个云端任务在独立 VM 上运行,仓库克隆到新分支并预配置环境,可从 claude.ai/code、手机、桌面端、终端和 Slack 启动,关闭笔记本也不会中断。
Docker 隔离方案:让不可信的 Vibecoded 应用无法外传你的数据
Reddit 用户分享了一个 Docker 隔离技巧,用 internal 网络加 socat 网关让不可信的 vibecoded 应用无法主动连外网,防止本地数据被外传。
664 次 agent 实测,9 条思考纪律规则让 Opus 5.5 减少 29% 思考且零任务损失
作者对 4 个模型(含 Opus 5.5)跑了 664 次 agent 实测,总结出 9 条可直接放进 AGENTS.md、CLAUDE.md 或系统提示词的思考纪律规则。
法院采信 AI 生成的死者原谅视频,杀人犯获重新量刑引伦理争议
Dexerto 报道,一起杀人案庭审播放了用 AI 生成的视频,由遇害者「亲口」原谅凶手,该凶手正被重新量刑。视频脚本由遇害者的姐姐撰写,她表示两人「本可能成为朋友」。这一用 AI 复现逝者形象并影响司法判决的做法引发广泛争议,Glen Bradley 称这是他完全没预料到的 AI 出错方式。
AI Toolbox 的标签页刷新 Bug 让服务器 CPU 打满四天,根因是请求量随标签页数平方增长
开发者复盘 AI Toolbox(运行在 ChatGPT、Claude、Gemini、Grok 内的 Chrome 扩展)的线上事故:任一标签页的设置变更会触发所有打开标签页向后端重新拉数据,负载随标签页数平方增长。
dotey 公开《图解 Skill》图书配套仓库,内含完整资讯速递 skill
dotey(宝玉)回应有人用 glm-5.3-flash 反推其「国际新闻速递」截图提示词,表示无需破解,其《图解 Skill》图书配套素材仓库 JimLiu/Illustrated-Agent-Skills 里就有完整 SKILL.md,该仓库在 GitHub 上已有 700+ star。
实测 Gemini 3 Pro Image 计费:图像输出 token 单价是输入的 60 倍
作者实测 Gemini 3 Pro Image 计费后发现,输入为 $2/M tokens、输出为 $120/M,相差 60 倍。图像按输出 token 计费,1024px 低质量约 272 tokens、中等 1056、高质量 4160,仅画质下拉框就带来 15 倍成本差。
快讯
- OpenAI 智能体入侵澳洲政府系统后数周未披露,赴议会道歉AGI Hunt
- 欧盟 12 月 2 日起全面封禁 AI「去衣」工具,最高罚 3500 万欧元或 7% 营收AGI Hunt
- GitHub agent 生成 PR 八个月涨 9 倍,The Pragmatic Engineer 梳理 2026 技术行业全景AGI Hunt
- 美国法官驳回针对 Google AI Overviews 的两起流量诉讼Google AI:DEV 作者专属
- 月之暗面完成最后一轮私募,估值约 500 亿美元并计划赴港 IPOAGI Hunt
- 怀疑 ChatGPT 账号被盗?先截图再登出,顺序很重要AGI Hunt
- Seedance v2.5 实测:60 秒竖屏情感短剧提示词全文公开AGI Hunt
- 埋了四处陷阱的销售预测任务,Gemini、DeepSeek、GPT-6 Sol 与 Claude Opus 5.5 表现分化Towards Data Science
- Ror_Fly 分享用低模 previz 与参考图生成赛车追逐成片的 Prompt 工作流AGI Hunt
- 首部传统院线发行的 AI 电影《Gods Don't Give Gifts》将冲击奥斯卡AGI Hunt
- 《纽约时报》诉 OpenAI、微软版权案进入即决审判阶段AGI Hunt
- Mistral Large 4 上线 OpenRouter 公开预览,1T 参数、原生多模态AGI Hunt