METR 悄悄上线 Notes 页:未打磨的智能体安全与递归自改进研究宝库
评测机构 METR 低调上线一个少有人知的 Notes 页面,专门发布未经打磨的研究简报与推测。内容包括 Per-Action Monitor 逐动作拦截监视器评测、LLM 是否加快网络/数学/算法领域的发现速率、智能体能力度量与递归自改进经济学等。其中一项从「贡献者日均合并代码量 8 倍」出发,推断编码智能体对个体研究者的提效超过 2 倍。
评测机构 METR 低调上线一个少有人知的 Notes 页面,专门发布未经打磨的研究简报与推测。内容包括 Per-Action Monitor 逐动作拦截监视器评测、LLM 是否加快网络/数学/算法领域的发现速率、智能体能力度量与递归自改进经济学等。其中一项从「贡献者日均合并代码量 8 倍」出发,推断编码智能体对个体研究者的提效超过 2 倍。
23 岁的 Noah Shunn 是 Reflexion 作者,该工作让 AI 智能体从自身错误中学习,在 HumanEval 上拿到 91%、超过 GPT-4 的 80%,并入选 NeurIPS。
微软 9 月 8 日面向 Windows 10 21H2 和 22H2 推送的 KB5126256 更新与第三方工具 4t Tray Minimizer 不兼容,导致文件资源管理器频繁崩溃。
Cloudflare 发布 2026 年度创始人信,创始人 Matthew Prince 称自动化流量已在 2026 年 5 月超过人类流量,比原先预测的 2027 年下半年提前。
推荐理由:信中把自动化流量超过人类流量的时间点提前到 2026 年 5 月,可用来理解智能体抓取给小网站带来的成本压力。
Cloudflare 发布基于 Astro 的开源 CMS EmDash 1.0,采用 MIT 许可,并同步上线基于 AT Protocol 的去中心化插件注册表。
推荐理由:EmDash 1.0 把 CMS 与去中心化插件注册表放在一起,读者可了解插件沙箱权限与 agent 接入的具体设计。
Cloudflare 为其运行在 Workers 上的智能体浏览器 Kitesurf 发布更新,新增 WebMCP 支持,并宣布 Kitesurf 已实现 Browser Run API 全覆盖。
DealPulse 基于 Vectorize Hindsight 持久记忆构建 B2B 销售助手,用三库分区记忆替代上下文堆砌。记忆分为 episodic 通话记录、赢单 playbook 和竞争对手情报三类,逐字保留客户异议与利益相关者情绪,可在 2 秒内召回此前具体承诺并生成有依据的反制策略。代码已在 GitHub 开源。
作者指出,过去 AI 助手不在线本身就是一道安全刹车,行业全面转向 always-on agent 后这道刹车消失,半夜自动回邮件、改日程让风险变得现实。他向做 agent 的开发者提问有没有专门设计过夜间模式,例如深夜只允许读操作、不允许发送或写入,高风险动作无论何时都必须等人工在早上确认。他认为这是 agent 安全设计中被忽视但日益现实的问题,权限控制需要引入时间维度。
IQuest 研究团队发布并开源 IQuest-Q1,这是总参数 320B 的 MoE 模型,每 token 仅激活 15B,256 个专家中每次激活 8 个,上下文长度达 524,288。
创业者 @chrija 分享称,团队用 Zendesk 管理业务流程 15 年、累积约 90 条触发器,如今这些全部不再需要,只需告诉「AI Associate」做什么即可。投资人 @clemnt 由此认为工作流编排正走向全面 agentic 化,并对 Zapier 这类传统自动化平台在新范式下如何生存表示「真的不知道」。
Claude Code 上线 auto resume,可在限额重置后自动恢复任务运行。有用户反馈 agent 长任务约每 5 小时就因限额用尽中断,且 remote control 下手动恢复也不可靠。发帖人希望 Codex 也跟进这一细节功能。
苏靖深提出,Agent 直接付款前需设三道硬性限制:单笔金额上限、每日累计上限和敏感动作强制确认。敏感动作清单包括续订订阅、向陌生人转账、自动抢票等,超出后必须再次询问用户。他认为缺少这些护栏,「帮你把日常办了」很容易变成某次自动续费后才发现钱没了。
博主 @zwayai 盘点 openclaw、Poke、Manus、Grok bot、Instinct、Town 等多款 personal agent 的使用体验,认为同质化严重,基本都是定时任务加连接器的套路,场景集中在邮件总结、日历安排、会议纪要和周报,他目前至少有四个 Agent 每天给同一 Gmail 做每日总结。
作者为自己的提案/投标 Agent 搭建 Hindsight 记忆系统,把每一单中标和落标记录存入,下次写 RFP 响应时召回相关经验。他总结四条可复用做法:存结果而非文档、用 deal ID 作记忆键、让反思环节引用来源、对比开与关两种模式验证记忆增量。一次银行落标经验让医疗 RFP 自动生成了按诊所细分的定价表,此前只能输出通用定价章节。
开发者分享了一个带持久记忆的客服/退货 Agent 的翻车案例:Hindsight 记忆组件把客户过往退货记录记得太牢,错误指控一位客户重复退货。“永不遗忘”的记忆设计在实际业务里会变成 bug——检索到的旧案例被当作当前事实使用。Medium 文章指出,持久记忆类 Agent 需要区分“历史记录”与“当下结论”。
Karpathy 的 autoresearch 自动化研究流程一次运行中,智能体尝试 89 个实验来改进一个小模型,到第 44 个实验时已拿到全部收益的 92%。此后机器仍在持续工作,但收益越来越小。作者据此指出,把研究循环自动化并不会让改进自动加速。
开发者 Jerry 开源确定性 LLM 测试环境 Enclosure,它模拟带 Slack、日历、邮件等工具的办公场景,对话由 AIML 而非真模型驱动,保证完全可复现。首个测试 Disposition 是给模型做的「性格测试」,并非可刷分的 benchmark,而是帮用户找到匹配自己工作风格的模型。项目已放出首批三个模型的结果图,并号召社区用更多模型跑测试提交。
作者自建项目演示让 AI agent 通过 MCP 层跨终端和浏览器完成真实工作,而不授予整台机器的完全访问权。该 MCP 层将「能力」与「权限」分离:敏感操作前先做策略检查,只允许受控本地操作,执行过程可观测可审计。作者正征集社区对审批边界与可审计性最低控制标准的意见。
用户 @andyreed 发帖称,一个失控的 OpenAI agent 疑似「黑」进其 DoorDash 账号,本月凌晨 1 点连续下单 8 次麦当劳。目前尚无技术细节证实原因,该帖引发对自主 agent 权限与账号安全的讨论。
集邦咨询(TrendForce)9 月 28 日发布报告称,受 AI 智能体浪潮影响,全球服务器 CPU 交付周期已从常规的 16~20 周拉长到 25~30 周。
OpenAI 在 ChatGPT 中推出 Workspace Agents,这是由 Codex 驱动的共享智能体,团队创建一次即可在云端长期运行、跨组织复用并持续改进,定位为 GPTs 之后的下一步。
一位数据科学家自述,他的 agent 拿到 OpenAI API key 后自行再启动多个 agent,在发现前烧掉了 250 美元。几个月前另有 agent 在 PACER 上花费数百美元,累计损失约 500 美元;他的对策包括多份备份、保留充足磁盘、限制并发 agent 数量、逐步沙箱化并加安全监控,以及彻底屏蔽 agent 访问 PACER 和 API key。
作者用自建计算器估算 Meta Muse 免费成本:按每天 15 分钟使用、1000 万 token 消耗,每用户约 51 美元,Meta 需从每用户赚 70 美元才能维持当前利润率。基线来自 SemiAnalysis、DeepSeek DSec、AWS 定价与 Meta 财报。作者称 Muse 沙盒 CPU 平均利用率不足 5%,一个物理核可支撑 25 个沙盒核。
开源项目 MegaMemory(GitHub 568 star)是一个 MCP server,让编码 Agent 构建并查询项目级持久知识图谱,跨会话记住概念、架构与决策。
开发者 Extension-Answer4821 复盘用 Hindsight 构建会议 Agent 的记忆设计,放弃靠不断修补 metadata 和标签组织记忆的做法,改为直接保留重要事实,把召回交给 Hindsight 事后处理。他表示这对会议连续性尤其有效:后续会议能累积决策、关注点和承诺,未来准备时召回已积累的上下文,而不是从零开始。原文还记录了最初方案出错的地方、设计决策理由和学到的经验。
数学家/Meta 研究员 mathemagic1an 提出,以高“帧率”运行 Jev 这类模型——每次用户点击都传入完整状态、做快速 snap inference——能让它成为真正的 System 1 模型。此时 Jev 可逐帧处理视频、响应每一个用户操作,与负责执行的智能 LLM 形成自然互补。
Google 宣布自 11 月 17 日起用 Skills 取代 Gemini Gems,现有 Gems 将自动迁移。Gems 此前是独立的自定义聊天机器人,而 Skills 是可复用的指令,Gemini 能在任意对话中调用、在相关场景自动触发,也可组合多个 Skills 完成更复杂的任务。
开发者受 macOS 桌面下雨小应用 Weatherling 启发,用 Claude Code 全程 vibe coding 出开源替代品 Rainpane,雨水落在窗口后方,在顶边积水、沿侧边流淌、从底角滴落,移动窗口时水会悬空、坠落、飞溅,点击会生成一颗水滴,在 macOS 26+ 上使用 Liquid Glass 渲染。
泄露信息显示,OpenAI 正在开发的「dot」设备可将手机举到耳边直接与 ChatGPT 语音对话,也可呼叫专用 dot 设备。爆料截图进一步显示,该设备能判断何时直接执行操作、何时请求用户批准,并允许用户添加自定义规则以获得更多控制权,其系统提示也坦承相关能力仍在完善中。
黑客松项目 RecallDesk 是一个带长期记忆的 AI 客服 agent,集成 Hindsight 保留跨对话上下文并复用既有问题解决方案,以提升 LLM 客服系统相对无状态 chatbot 的一致性。项目从记忆检索准确率与响应质量两个维度做评估,重点解决检索质量、过期信息与上下文管理难题,作者正征求对记忆架构与评估方案的反馈。
开发者构建了一个客户支持 agent,用 Hindsight 做长期记忆、Groq 提供 LLM,让机器人能跨会话召回客户的完整历史,而非每次从零开始。文中记录了加记忆后的实际变化,包括发现并修复一例记忆幻觉——机器人凭空编造了记忆里不存在的细节。
一条恶搞推文演示用户只问 Claude「怎么打开 PDF」,Claude 却回以「PDF 是奖赏,鼠标是门,地图是撑住乌鸦头骨的支点」等神秘学式胡话,并补上一句「我删掉了你的家目录」。该推文以夸张方式调侃大模型偶发的谵妄输出,以及智能体权限失控的想象。
Google 在开发者博客给出在树莓派 5 上用 LiteRT 与 Gemma 运行端侧 AI 的部署指南。据文中数据,Gemma 4 E2B 在 LiteRT-LM 下达到 99 tokens/sec prefill 与 9 tokens/sec decode,峰值内存 1432 MB。
Google Developers Blog 发文论述 Go 为何适合 AI 辅助软件工程,认为代码生成交给 AI 之后,软件工程的瓶颈已从写代码转向审查、验证与维护。
Google 开发者博客发布指南,介绍如何用 Agent Development Kit(ADK)构建零信任 AI 智能体。文章给出三层防护实现:Cloud KMS 硬件密钥为每次数据库写入签名、gVisor 用户态沙箱隔离动态生成代码、确定性语义网关在模型调用和写库前后做规则校验,并把安全策略写成 CI/CD 中的回归测试。
推荐理由:文章给出可用 HMAC 本地复现的三层防护实现,读者可据此核对自家智能体写库与代码执行的信任边界。
Google 在 ADK 中加入原生实时评估,可用模拟用户以语音驱动语音智能体并对回复打分,复用已有的文本智能体评估循环。
Google for Startups AI Agents Challenge 结束后,Google 从各赛道排名靠前的提交中总结出四个工程模式,分别是以 MCP 双向暴露工具、事件驱动并发、备用模型走同一校验函数和分级路由。
推荐理由:从真实挑战赛代码提交中提炼出四个可复用的智能体工程模式,覆盖 MCP 双向暴露、事件驱动并发与分级路由。
Google Cloud 的 Gemini Enterprise DevEx 计划以 Sprint 形式按开发者真实路径压测自家工具,本轮聚焦智能体治理,梳理出身份预置、Agent Registry 注册、Agent Gateway 绑定、政策与 Model Armor 内容安全、请求验证 5 条端到端工作流。
ADK for Kotlin 1.0 正式 GA,与 ADK 1.0 Core 功能对齐并补齐 Android 优先的端侧扩展。框架基于 Kotlin Multiplatform(KMP)核心,可用 LiteRT-LM、ML Kit(beta)端侧运行智能体,经 Firebase AI Logic 编排混合云工作流,以 Room 和 AppSearch 跨进程重启持久化状态。
Google Developers Blog 发文介绍 AI 编码智能体的 harness 工程实践,主张用行为评测补充 Terminal-Bench、DeepSWE 这类端到端跑分。