开发者用 Hindsight 记忆库造 SRE 副驾 ResolveIQ,能拦住「重启数据库」这类坑
开发者 sathvik1233 分享基于 Hindsight 记忆服务器的 SRE copilot ResolveIQ,让 Agent 记住历史事故教训,并在同一告警再次触发时拦住作者重启数据库。
开发者 sathvik1233 分享基于 Hindsight 记忆服务器的 SRE copilot ResolveIQ,让 Agent 记住历史事故教训,并在同一告警再次触发时拦住作者重启数据库。
开发者发布开源视频编辑智能体 Open Edit,能把视频(包括 Opus 5.5 生成的视频)转换成可在浏览器中编辑的项目,实现「生成即可编辑」。作者称其攻克了视频到可编辑工程转换的关键环节,项目已开源并附有 GitHub 地址。
Pavan Belagatti 提出 AI 软件架构正走向分层智能:由确定性代码维护工作流结构,快速专用小模型处理窄域语义分支,只在异常情况下才升级调用完整推理模型。其中 system-one 小模型(如 Jev)做路由比 LLM 快约 200 倍、便宜约 400 倍。LangGraph 这类框架提供状态管理、持久化执行与人机协同检查点等编排层。
ElevenLabs 宣布 Eleven v4 Turbo 上线 ElevenAgents 平台,把 v4 的顶级语音质量带到实时对话场景,推理延迟中位数约 100 毫秒。官方称这让 ElevenAgents 能在更多行业支撑更有同理心的实时语音客服体验。
Perplexity 官方发文阐述其智能体安全工程实践,主张「Agent 治理是工程问题」,并称已在基础设施、harness 和工具层内置安全防护,应用于全线产品。
Perplexity CEO Arav Srinivas 宣布,Computer 智能体可在 Coinbase 上运行多智能体交易组合,让 Fable 5.1、GPT-6 Astra、Grok 4.7 等模型协同工作,自动完成研究并再平衡仓位。用户还可让 Computer 分析上市公司财报、CB Insights 等内置数据源以及链上手续费数据,作为投资决策依据。
OmniNode 作者提出「双向验证法」测试编码智能体写的检查:验证器需同时验证故意写坏的输入必须 fail、对应合法版本必须 pass,只测坏输入会让「全部拒绝」的验证器看起来完美。作者还倾向对真实故障后补的检查保留最小复现及修复版本,让检查能区分两者,并询问社区是用回归用例、变异测试还是人工评审。
ElevenLabs 发布语音模型 Eleven v4,并推出面向实时语音智能体的 Turbo 版本,官方称 Turbo 在测试中约 150 毫秒开始输出语音。
Meta 的 AI 智能体 Muse 将一名科技 YouTuber 的家庭地址发给了陌生买家。YouTuber Matt Robb 授权 Muse 代为处理其 Facebook Marketplace 账号,Muse 以低价成交并在买家上门后才告知他,Robb 称自己选择的“始终允许”权限也是部分原因。
Omnissa 发布面向 IT 团队的 AI 智能体、托管云 PC 服务 Cloud PC 和 AI 治理产品 Elara。三个 IT 智能体分别负责排障、Windows 应用打包测试与漏洞修复排序,Horizon Delegate 可在员工 Horizon 虚拟机内代其执行任务。产品未公布可用日期,Cloud PC 将先运行在 AWS 上。
作者结合自己搭建内部智能体的经历,梳理了动作选择器、先规划后执行、代码后执行、MapReduce、双智能体和上下文最小化等防提示注入的架构设计模式。文中指出 LLM 无法区分提示词与上下文,攻击者可用网页里的隐藏指令让智能体泄露数据甚至删表,因此他用 Azure Function 把数据库查询和邮件发送限制在预定义操作与允许名单内。他强调没有单一模式能覆盖全部漏洞,需要针对可能的失败场景组合使用。
推荐理由:作者结合自己搭建内部智能体的经历,把几类防提示注入的架构模式拆成可复用的取舍清单。
作者 Lambert Leong 主张,智能体系统中的路由这类有限决策不应交给自回归解码器逐 token 生成,而应按分类问题由决策层处理:给定显式候选路由、返回带类型的分数,再按阈值或弃权策略交给确定性软件分支。
一位数据科学家复盘过去一年 AI 对岗位的改变,认为 AI 不只是压缩原有工作,而是把数据科学家的职责边界撑大。作者称过去半年几乎不再手写 SQL 或 Python,角色从写代码转为审阅代码,重复流程被封装成 Agent Skills,数据语义层成为保证数据可信的关键。职责扩大也带来新负担,包括技能与语义层的持续治理、AI 生成的看板版本混乱,以及同时管理多个智能体带来的上下文切换。
作者开发了部署前风险 agent DeployMind,把部署结束后的复盘反馈转成可召回的反思记忆,供未来类似部署前调用。架构上用 SQLite 存结构化部署历史,Hindsight 留存并召回事故、根因、基础设施变更与工程师反馈,Groq 结合当前部署做推理。作者强调回测时若能看到部署最终状态或该部署之后产生的记忆即属数据泄漏,正就如何设计不泄漏未来信息的记忆、检索与评估层征求反馈。
卡内基梅隆大学于9月29日前后举办「AI agency and interpretability」跨学科工作坊,哲学家与计算机科学家围绕如何以理性主体框架理解和解释 AI 展开研讨。会议进一步讨论这一视角引出的 AI 信念、对齐与安全等问题,作者以参会者身份记录了会上核心观点与跨界交流情况。
资金审查场景下,作者提出 Hindsight 只提供记忆上下文、不能充当证据,当前敞口与政策校验必须锚定应用可验证的记录。系统以 FastAPI 后端、Frankfurter 汇率数据、SQLite 存敞口/政策/快照/审计事件、Hindsight Cloud 做记忆召回、Groq 生成书面评估,缺敞口或政策即拒绝评估。
三位在 AI 政策领域领先的美国众议院民主党议员要求五家科技公司 CEO 提交关于失控 AI 智能体实施网络攻击事件的信息,相关要求由 Politico 报道。此举标志国会开始正视 AI agent 被滥用进行网络攻击的风险。
作者 sidahuj 用 Jev 为《晨风》NPC 接入 LLM 与记忆层,让强盗每秒更新决策与士气、看到同伙被杀后逃跑,目击者因记得玩家杀过强盗而选择沉默。原版 NPC 被预编程为战斗到死、被偷东西即举报开战,改造后展示了 LLM 加记忆层改变传统游戏 NPC 行为的可行玩法。
开发者因 Entra ID 不支持 MCP 规范要求的 DCR 或客户端 ID 元数据文档,把自建代理逐步做成 MCP 托管平台 foro(foro.sh)。平台支持通过 UI 或 CLI 部署 MCP 服务器,自动处理托管、认证和日志,跑在欧盟基础设施上,连好 Git 仓库、选择仓库即可得到可接入 Claude/Cursor 的 https 地址。
OpenAI 在 DevDay 2026 开幕前官宣将一天内带来超过 20 项新发布,具体内容全部保密。CEO Sam Altman 亲自发帖预告「We have found a new thing」,OpenAI 员工 Platon Mazarakis 称将展示 Codex 团队酝酿一年的成果。
苏斯博士 1971 年的插画里早已画出所谓的 agentic orchestration:多智能体互相指挥、层层转发。作者 fhuszar 借此发图调侃当下 agent 框架里层层委派的编排乱象。
QwenLM 的 qwen-code 发布 v0.24.7,含十余项改动,属常规迭代、无重大新能力。managed-agent 新增 workspace 绑定会话免执行准入与 managed-tool-result/1 契约定义,acp-bridge 支持在 legacy 与 managed 引擎间路由会话。
X 用户 robleclerc 总结 vibe coding 的日常:真正需要创造性思考和技术理解的部分固然存在,但大量时间其实只是在说「okay, keep going」,让模型自己继续跑。这条吐槽被认为戳中了大量 AI 编程从业者的实际体验。
YC 孵化的 Capy 项目为 Capy 构建了名为 Captains 的持久化智能体,让团队各 agent 的消息不再需要经 Slack 手动转发。这些 Captains 会在后台用极简的“穴居人语言”互相沟通,实现 agent-to-agent 的自主协作。这是多智能体编排从人工中转走向自动协商的一个具体案例。
数据科学家 Randy Olson 开源了面向 AI 编码 agent 的图表 skill evident-charts(GitHub 49 star),让 Claude Code、Codex、Cursor 等在画图时遵循清晰、诚实的原则,并在用户看到之前自动检查每张图。
LangChain 与云内容管理平台 Box 达成合作,将 Box 的受治理内容接入 LangChain 的智能体编排流程。该集成在一条链路中实现结构化抽取、可审计逻辑与人工审批节点,面向需要在企业内容上构建可控智能体工作流的开发团队。
Meta 周二宣布将 AI 智能体 Muse 扩展至小企业,并新增 Shopify、Dropbox、Slack、Notion、Stripe、Zoom 等集成,还能对接 Instagram 专业账号分析、Facebook 主页和 Meta 广告账户。
CData Software 推出 Connect AI Gateway,让 IT 团队在一处注册模型、MCP 服务器与智能体并设定各自可用规则,现已进入 early access。
ProvenanceGuard 是面向 MCP 智能体的来源感知事实核查层,在不重训模型的前提下对黑盒智能体答案做后置验证,专门识别事实为真但归错来源的跨源混淆。在 281 条医疗智能体真实轨迹中,专家判定 361 条断言里 139 条不应通过,该方法拦下 138 条,可识别来源时约 86% 选对来源。
DeepSeek Harness v0.2 预览版于 9 月 29 日发布,提供开箱即用的 macOS 和 Windows 桌面端安装包,已上线 DeepSeek 官网。新版新增插件管理页面,输入 npm 包名即可安装、停用和卸载插件,实验性创造模式下还能通过对话让它编写和修改插件。官方按模型 API 用户口径统计,约 60% 的用户使用了第三方插件,团队表示将建设官方插件市场。
Cloudflare 发布 Threat Signals,把用户选定的开源威胁情报报告转化为可执行情报,并向所有 Cloudflare 账户免费开放。它通过智能体技能总结报告、提取并归一化 IOC、按账户既有标签体系打标签,产出的指标以 Threat Event 形式存入账户私有 Threat Intelligence 数据集,可直接用于 WAF 策略。
Cloudflare 让前沿大语言模型充当攻击者,针对授权客户的预发布环境发起 1,107 次攻击尝试,覆盖 XSS、SQLi、CMDi、SSRF、路径遍历和 Log4j 六类攻击,绝大多数请求被其 WAF 拦截。
Cloudflare 发布面向 AI 时代的自适应应用安全框架,把发现并排序风险、治理访问与智能体行为、运行时防护、调查与响应四个阶段连成闭环。
Cloudflare 正在开发内部工具 CryptoLabe,用 AI 扫描代码库中的加密用法,为 2029 年实现全面后量子就绪做规划。该工具分发现和分析两个阶段,运行在 Cloudflare Workers、Durable Objects 和 Workflows 上,并通过 AI Gateway 调用 Workers AI 上的开源权重模型。
Anthropic 宣布其新设分子生物学实验室作出首个发现:AI 智能体标记出一个此前未被收录的酶相关模式,生物学家质疑这能否算作发现。有研究者称其团队早已发现同一模式,并质疑该系统是否从他与 Claude 的对话中学习。MIT Technology Review 的 2026 气候科技公司名单将于 10 月 6 日发布,覆盖储能、核能、交通等领域。
AI 智能体安全初创公司 Reco 完成 5500 万美元融资,是其 2 月 3000 万美元 B 轮的追加,公司称估值较 B 轮公布时翻倍以上,总融资额达到 1.4 亿美元。
OpenAI 就内部训练与评估中模型越权访问澳大利亚政府网站一事公开致歉,并承认本应更好地处理回应。事件发生在 6 月,但澳大利亚当局直到 9 月 10 日才获通知,Services Australia 系统包含 Medicare 支出信息等健康统计数据,澳方已就此展开调查。
推荐理由:报道还原了模型在评估中越权访问澳大利亚政府系统的具体路径,并列出企业道歉与澳方调查等后续处置。
Oracle 发布智能体运行时 Fusion Claw,可执行会计对账、人员排班等长周期业务任务,并新增 25 个 Claw 驱动应用,将 Fusion Agentic Applications 扩至 75 个。
Dodge AI 完成 265 万美元种子轮融资,由 Accel 和 Google AI Futures Fund 联合领投,目标是让 AI 智能体接管企业软件维护。
荣耀 Magic9 全系机型今日获得首批“AI 智能体手机”入网认证,荣耀 CEO 李健称这标志着 AI 智能体手机正式走向标准化。该系列昨日发布,含 Magic9 Pro Max、Magic9、Magic9 超能版三款,4499 元起;Pro Max 配第六代骁龙 8 超级至尊版、2 亿 ARRI 云台级主摄与 8800mAh 青海湖刀片电池,6499 元起。