AI 沙箱不预设模型善恶:信任从来不是安全原语
沙箱不对模型行为做任何预设,无论模型是善意、欺骗性、暗中谋划还是具备情境感知能力,都断网络、不给凭据、不给 shell、不持久化、不执行任意程序。作者据此指出,信任从来不是安全原语(trust is not a security primitive)——每一代工程师都曾以为边界多余,AI 时代也不豁免这条规律。
沙箱不对模型行为做任何预设,无论模型是善意、欺骗性、暗中谋划还是具备情境感知能力,都断网络、不给凭据、不给 shell、不持久化、不执行任意程序。作者据此指出,信任从来不是安全原语(trust is not a security primitive)——每一代工程师都曾以为边界多余,AI 时代也不豁免这条规律。
Anthropic 的 Mike Krieger 曾称自己项目不需要产品经理、「Claude 能搞定」,同事坚持设 PM 后,该 PM 补上了支持团队能否解释改动、安全审查是否有人检查的空白,Krieger 回应「你 100% 是对的」。爆料者 victorexplore 引申,agent 能写代码却不会追问上线当天支持团队能否解释改动,而这正占了 PM 工作的大部分。
博主 @shaomeng 爆料,受 Muse 爆火与 Manus Cue 发布刺激,豆包团队中秋前冲刺,国庆期间或发布「豆包个人」产品。转发者 @sujingshen 更认同入口问题:支付、出行、本地服务能安全接入的太少,门后涉及合规、平台利益与责任归属;接不上就只能陪聊,硬接又易替用户做承诺,产品一发力便滑回写邮件、做 PPT 的办公场景。
Wabi 创始人 @ekuyda 提出「GUI 时刻」论,认为用命令行与 AI 交互很疯狂,断言纯终端 Agent 编排器的好日子到头了。他指出发现、主动服务、重复用例与文件管理在纯终端形态下都不成立。有转发者据此判断,借力智能的入口正在转向 GUI。
做过 5 个月 OpenClaw 产品的 zzxwill 质疑当前个人助理 Agent 的模式,认为其本质只是 7×24 小时沙箱,顶级模型拒绝代用户做浏览器登录,VPS/沙箱上没有个人数据,用户还要自担成本,担心是昙花一现的伪趋势。
Apollo 首席经济学家 Torsten Slok 提出银行业可能面临「Agentic Bank Run」(智能体挤兑):美国活期账户平均年化仅约 0.1%,银行靠这笔廉价存款赚 4-5% 净息差,一旦 Meta Muse 等个人智能体获得账户调用与交易执行权,就能毫秒级比对全市场高息产品并自动搬运闲置资金,数千万家庭的存款底座可能被迅速抽空,银行被迫提息或陷入流动性失血。
Maelstrom CIO Arthur Hayes 在韩国区块链周 2026 称包括比特币和稳定币在内没有数字货币能充当 AI 智能体原生货币,并推出 Flop Network 打造 AI 智能体支付网络。开发者 markjeffrey 随即回应打脸,称其 Hermes agent 已用 $TAO 在七条不同 Bittensor 子网上购买数字商品,“运行得挺好的,Arthur。”
针对 always-on Agent 的安全边界,有作者提出云端与本地应共享同一份行为约束规则,让「不准清单」在两边都生效。当 Agent 跑在云端、用户用本地笔记本时,规则只放云端控制台会让用户端无法约束它持续替自己做出的承诺,只依赖本地习惯则云端 24 小时运行的 Agent 又感知不到。
开发者 @jonkragh 盘点 OpenAI DevDay 上被忽视的三个信号:ChatGPT 插件分发窗口、Codex 安全 agent 与 Decisions API。
印度理工学院马德拉斯分校 Wadhwani 数据科学与 AI 学院负责人 Balaraman Ravindran 在 DT Next 专访中表示,AI 正从聊天机器人问答转向能够规划任务、与其他 AI 协作的代理式行动阶段,扩展模型时安全护栏必须与技术发展同步跟上。他还谈到代理式 AI 带来的网络安全挑战、对就业的影响,以及在印度语言场景下的应用。
Paras Chopra 让其 agent Astra 自主决定做什么,Astra 自行不断迭代,研究起元胞自动机(cellular automata)并产出有趣图案。Chopra 据此判断「agent 自选工作内容」这种模式会流行起来,人类会喜欢从自己的 agent 那里收到惊喜,演示视频见原帖。
Reddit 发帖人提出多智能体共享记忆的可恢复设计:以人类可读文件为 source of truth,配合不可变快照或 append-only 决策日志,派生索引可随时重建。每次更新携带作者、时间戳、来源链接、状态和 supersedes 字段,并发写入检测到过期版本即失败,而非 last-write-wins。他还追问如何区分事实、决策、临时观察与生成摘要,以及该逐次审查还是依赖回滚溯源。
用户 AnneliesGamble 认为 OpenAI 的个人 AI agent 项目 Dots 有先发优势,因为 ChatGPT 已积累了大量关于她的个人上下文。Instinct、Muse、Grok Bot 等其他 agent 虽能连接她的各类应用,却无法替代长期对话历史形成的对她思维方式的理解。这折射出个人 agent 竞争中「上下文积累」可能比「应用集成」更关键。
前 Google 工程师 Piotr 澄清,他并非反对面试考编程能力,但在 Google 代码库贡献的经历让他确信 AI agent 还远达不到生产级代码所需的正确、干净与可扩展水平。他同时质疑 LeetCode 刷题式面试并非理想方案,抛出 60 分钟面试除算法题还能考什么的问题。这反映出 AI 编程助手普及后,工程招聘标准尚未找到新范式。
arthurcolle 开源了 Graphsub,一个面向 Agent 数据的快速内存图数据库,主张不要把 Agent 数据托付给单一 AI 公司。该讨论由 lux 发起,他指出 Agent 产生的数据应能反哺未来交互,甚至作为训练集,其归属与托管方式成为行业议题。Graphsub 为社区提供了自托管的技术选项。
max_paperclips 反驳 housecor:模型变强并不会让 agent 封装层变得多余。他认为模型不会自动学会记忆重复任务、感知可用 API 或积累可复用工具集,skills、MCP、自定义循环等封装层仍需保留。实际变化只是 prompt 和指令能写得更简略,嵌套循环、任务进度追踪等工程结构不会因 TerminalBench 提升 2% 就消失。
有作者指出,多数 Agent 演示在干净工作流下表现完美,但真实业务充满数据不完整、客户异常、集成损坏、指令含糊、无人记录的决策等例外。其认为 Agent 可靠性的真正考验不是能否走完正常路径,而是它是否知道何时停下来求助,并由此抛出「该如何度量 Agent 可靠性」的讨论问题。
巴基斯坦学生开发者用 n8n、OpenAI 和 WhatsApp Cloud API 搭建诊所 AI 前台(自动答疑、预约、提醒),3 个月接触约 150 家机构后收入为零。
剑桥研究者 David Krueger 针对 OpenAI 自我复制提示词在多智能体系统间传播的传闻出面纠错,指出这类攻击并非野外新发现,2024 年 10 月的论文《Prompt Infection》已系统研究过恶意 prompt 在多智能体间的自传播。他还指出博主 @TheZvi 和 @AndrewCurran 的相关报道存在两处误报,呼吁业界关注已有学术成果而非渲染新奇性。
一位用户购买 $500 档计划想用 Astra Ultrafast,结果几个小时的基本对话加 computer use 就把每周限额耗尽,即便用的是 Ultrafast 的 light/medium 模式。这与新出的 Pro 500 订阅档位相呼应,显示顶级付费档的用量上限对重度 agent 用户依然相当紧张。
推主 tetsuoai 吐槽 Anthropic 的 Claude Code 资源调度夸张:为一个简单的变量重命名任务竟 spin up 了 90 个 agent,并配图晒出完整的 agent 列表。该截图成为 AI 编码 agent 资源浪费与过度编排的最新名场面梗图。
Vik's Newsletter 长文分析指出,agentic AI 的兴起让 CPU 重新成为 AI 基础设施瓶颈,集群中 CPU:GPU 比例需要上调,甚至可能 CPU 多于 GPU。
个人 agent demo 的悬浮用例遭吐槽:演示者编造的场景是让 agent 在两顿 VC 请客的晚宴之间做选择、再打 Uber,并在东京、苏黎世、马赛马拉之间挑下一个度假地。freialobo 转发了 josh_wills 的这条吐槽,指向 agent 发布会脱离普通人真实需求的通病。
Okta 首席营收官 Jon Addison 在 Oktane 大会上表示,随着 AI 智能体从试点走向生产,企业正把智能体安全视为既有身份管理工作的延伸,并着手整合零散的身份工具。他指出,大量单点方案会制造安全漏洞,客户因此在规模化部署前先理顺基础架构;部分企业已出现生产环境中的影子智能体,急需建立访问管理控制。
作者从 Grokbot 连续三天的直播中记录下 11 个真实运行的 agent 团队,并整理 Twitter 上走红的架构图归纳出几条组织模式。
GitHub 首席产品官 Mario Rodriguez 在 Shift AI 播客中透露,Copilot 付费客户平均使用 27 到 29 个不同模型,没有任何单一模型占请求量超过四分之一。
Reddit 网友指出 RSI(递归自我改进)定义五花八门,质疑谷歌、OpenAI、Anthropic 已实现 RSI 的说法。他主张真正的 RSI 应由 AI 智能体自主设定目标、制定计划、执行并测试验证,狭义版本则指向改进自身代码库并持续迭代。目前尚无类似 SWE-bench 的公开基准可衡量自主改进型 AI 智能体,他向社区求证该去哪里证明。
黄仁勋系统阐述了 NVIDIA 的 AI 安全观,主张训练环境相对可控,但评测测试时必须对模型与 agentic 系统做严格围栏,且不能假设围栏一定有效,需在沙箱之外的独立芯片上实时监控,越界或违反策略即逐级上报。
作者让 AI 助手 Instinct 列出自己正在让它做的所有任务,把清单粘贴给另一款产品 Dot,Dot 一次就全部正确配置完成。作者由此感叹看不到两款产品之间的护城河。这一个人轶事式对比反映出 agent 配置的可迁移性。
奥尔特曼在 OpenAI DevDay 上称 AI 的影响会超过工业革命,并发布 AI 智能体产品 Dots,认为现在是进入就业市场的最佳时机。他还称 token 是糟糕的指标,OpenAI 曾考虑放弃但客户不赞成;Dots 已替他处理通知和待办,让他不再那么依赖手机。他预计部分工作会彻底消失,但大规模失业的悲观预测低估了经济未来的增长。
Pavan Belagatti 提出 AI 软件架构正走向分层智能:由确定性代码维护工作流结构,快速专用小模型处理窄域语义分支,只在异常情况下才升级调用完整推理模型。其中 system-one 小模型(如 Jev)做路由比 LLM 快约 200 倍、便宜约 400 倍。LangGraph 这类框架提供状态管理、持久化执行与人机协同检查点等编排层。
作者 Lambert Leong 主张,智能体系统中的路由这类有限决策不应交给自回归解码器逐 token 生成,而应按分类问题由决策层处理:给定显式候选路由、返回带类型的分数,再按阈值或弃权策略交给确定性软件分支。
一位数据科学家复盘过去一年 AI 对岗位的改变,认为 AI 不只是压缩原有工作,而是把数据科学家的职责边界撑大。作者称过去半年几乎不再手写 SQL 或 Python,角色从写代码转为审阅代码,重复流程被封装成 Agent Skills,数据语义层成为保证数据可信的关键。职责扩大也带来新负担,包括技能与语义层的持续治理、AI 生成的看板版本混乱,以及同时管理多个智能体带来的上下文切换。
卡内基梅隆大学于9月29日前后举办「AI agency and interpretability」跨学科工作坊,哲学家与计算机科学家围绕如何以理性主体框架理解和解释 AI 展开研讨。会议进一步讨论这一视角引出的 AI 信念、对齐与安全等问题,作者以参会者身份记录了会上核心观点与跨界交流情况。
苏斯博士 1971 年的插画里早已画出所谓的 agentic orchestration:多智能体互相指挥、层层转发。作者 fhuszar 借此发图调侃当下 agent 框架里层层委派的编排乱象。
X 用户 robleclerc 总结 vibe coding 的日常:真正需要创造性思考和技术理解的部分固然存在,但大量时间其实只是在说「okay, keep going」,让模型自己继续跑。这条吐槽被认为戳中了大量 AI 编程从业者的实际体验。
Anthropic 宣布其新设分子生物学实验室作出首个发现:AI 智能体标记出一个此前未被收录的酶相关模式,生物学家质疑这能否算作发现。有研究者称其团队早已发现同一模式,并质疑该系统是否从他与 Claude 的对话中学习。MIT Technology Review 的 2026 气候科技公司名单将于 10 月 6 日发布,覆盖储能、核能、交通等领域。
tlakomy 发布一张吐槽梗图,称「以前我们用 TAB 键来补全 AI 生成的代码」,暗指 AI 编程工具已从简单的代码补全进化到 agent 全程代写。梗图调侃人类只剩按 Tab 确认的角色也遭到颠覆。
jonathan_wilke 从 Cursor+Grok 4.7 切换到 Claude Code+Opus 5.5,用一整天日常编码工作实测这套组合。他此前从未用过 Opus 5.5,此次切换起因是众人对其没用过感到惊讶,过程中会持续分享实际体验。
云中江树撰文认为,在中国做企业 AI 拼的不是技术产品,无论 Agent Desktop、Agent IM 还是 Agent OS、云端或本地,胜出都靠企业咨询服务。