dots 智能体数日内上线数百万实例,先学单人再开放团队模式
thsottiaux 宣布其个人智能体产品 dots 将在几天内有数百万实例在线,覆盖广泛使用场景。他称使用 2-3 天、教它了解个人偏好和手头事务后能力有明显跃升,学习速度很快,还能自主承担相当有野心的任务。团队将先观察用户如何使用主 dots,之后才开放创建一整个 dots 团队的能力。
thsottiaux 宣布其个人智能体产品 dots 将在几天内有数百万实例在线,覆盖广泛使用场景。他称使用 2-3 天、教它了解个人偏好和手头事务后能力有明显跃升,学习速度很快,还能自主承担相当有野心的任务。团队将先观察用户如何使用主 dots,之后才开放创建一整个 dots 团队的能力。
Kirk Borne 转发了一份题为《The Mathematics of Artificial Intelligence Agents》的指南,系统梳理 AI 智能体背后的数学基础。内容覆盖决策、规划、记忆、工具调用、学习与协作等核心模块,适合想从原理层面理解 agent 架构的读者作为参考材料。
Paras Chopra 让其 agent Astra 自主决定做什么,Astra 自行不断迭代,研究起元胞自动机(cellular automata)并产出有趣图案。Chopra 据此判断「agent 自选工作内容」这种模式会流行起来,人类会喜欢从自己的 agent 那里收到惊喜,演示视频见原帖。
Reddit 发帖人提出多智能体共享记忆的可恢复设计:以人类可读文件为 source of truth,配合不可变快照或 append-only 决策日志,派生索引可随时重建。每次更新携带作者、时间戳、来源链接、状态和 supersedes 字段,并发写入检测到过期版本即失败,而非 last-write-wins。他还追问如何区分事实、决策、临时观察与生成摘要,以及该逐次审查还是依赖回滚溯源。
用户 AnneliesGamble 认为 OpenAI 的个人 AI agent 项目 Dots 有先发优势,因为 ChatGPT 已积累了大量关于她的个人上下文。Instinct、Muse、Grok Bot 等其他 agent 虽能连接她的各类应用,却无法替代长期对话历史形成的对她思维方式的理解。这折射出个人 agent 竞争中「上下文积累」可能比「应用集成」更关键。
雅虎前 CEO、前 Google 高管 Marissa Mayer 于 9 月 30 日发布个人 AI 助理 Dazzle。该产品读取手机相册,从服装、旅行、夜出行等照片中理解用户偏好,实现个性化购物推荐与代理购物,并把手机相机按钮变成无需输入提示词的「搞定」按钮,直接基于当前画面提供即时上下文与操作。
Sol 6 智能体在 @VoidNulled 的演示中,于全程无任何提示词干预下独立完成一支短片,视频和配乐均由自己生成。这类“放出去让它自己折腾”的 demo 展示了智能体自主创作能力的边界,并在 X 上引发转发关注。
前 Google 工程师 Piotr 澄清,他并非反对面试考编程能力,但在 Google 代码库贡献的经历让他确信 AI agent 还远达不到生产级代码所需的正确、干净与可扩展水平。他同时质疑 LeetCode 刷题式面试并非理想方案,抛出 60 分钟面试除算法题还能考什么的问题。这反映出 AI 编程助手普及后,工程招聘标准尚未找到新范式。
arthurcolle 开源了 Graphsub,一个面向 Agent 数据的快速内存图数据库,主张不要把 Agent 数据托付给单一 AI 公司。该讨论由 lux 发起,他指出 Agent 产生的数据应能反哺未来交互,甚至作为训练集,其归属与托管方式成为行业议题。Graphsub 为社区提供了自托管的技术选项。
开发者用 Groq 做推理、Hindsight 做记忆,搭建了一个能从反馈中学习的代码审查 Agent,让它在多次审查之间保留有用的反馈并在后续审查中复用。该流程用 Expense Tracker 项目做了测试,作者还记录了 AI 代码审查器具备跨交互记忆后审查行为的变化及构建经验。
max_paperclips 反驳 housecor:模型变强并不会让 agent 封装层变得多余。他认为模型不会自动学会记忆重复任务、感知可用 API 或积累可复用工具集,skills、MCP、自定义循环等封装层仍需保留。实际变化只是 prompt 和指令能写得更简略,嵌套循环、任务进度追踪等工程结构不会因 TerminalBench 提升 2% 就消失。
亚马逊购物智能体 Instinct 开始向其推送产品,形式疑似基于购买历史和网络行为推荐「赞助商品」,这很可能就是它的商业化路径。原帖作者据此感叹又多了一个用开源的理由,认为把个人数据交给智能体,换来的却是被广告瞄准。智能体内置广告如何影响推荐可信度,值得持续关注。
Stack Overflow 团队现身 OpenAI DevDay,产品副总裁 Alex Lato 与 OpenAI 的 Aarti Bagul 对谈,分享用 Codex 加速 Stack Overflow 内部新架构开发的经验。同时介绍了面向智能体、以 API 为先的知识交换平台 Stack Overflow for Agents。
OpenAI 在开发者日宣布与 ModRetro 合作,为复古掌机 Chromatic 推出 Codex 专用插件 Game Studio,用户可用自然语言描述游戏需求、由 Codex 辅助生成程序。
南科大提出 ActFirst-OPD,让智能体先行动、偏离参考轨迹时切回自主预测,解决在线策略蒸馏(OPD)中长推理阻塞环境交互的问题。在 0.6B/1.7B/4B Qwen3 上,ALFWorld 平均提速 2.3 倍、WebShop 1.8 倍、ScienceWorld 4.9 倍。9 组基准-模型设置中 8 组成功率持平或超越 OPD 基线。
谷歌产品安全团队在官方博客介绍内部智能体漏洞挖掘工具 PageBreak,把候选漏洞放进真实运行环境实际验证,做到接近零误报。该工具以 Gemini 3.1 Pro、3.5 Flash 等 Gemini 系列模型为主,已大规模运行并发现超过 500 个 XSS 漏洞。
推荐理由:PageBreak 把候选漏洞放进真实环境验证以压低误报,可看出智能体做安全测试时如何减少人工筛选负担。
有作者指出,多数 Agent 演示在干净工作流下表现完美,但真实业务充满数据不完整、客户异常、集成损坏、指令含糊、无人记录的决策等例外。其认为 Agent 可靠性的真正考验不是能否走完正常路径,而是它是否知道何时停下来求助,并由此抛出「该如何度量 Agent 可靠性」的讨论问题。
victor_explore 建议保留所有失败的 agent 运行记录,把它们当作针对下一代模型的评测集,每次新模型发布就整体重跑一遍。他引用 Anthropic Labs 的案例:Mike Krieger 透露团队曾搁置一个失败的 computer use agent 项目,每次新模型发布都重跑,直到 Claude 3.7 出现后成功率突然过半,项目起死回生。
推荐理由:把跑挂的 agent 任务留存成评测集,提供了一个跨模型版本观察能力跃迁的可复用做法。
论文《Harness Optimization for Agentic Multi-Reference Image Generation》的官方实现 AutoRef 已在 GitHub 开源(KuOnoda/AutoRef),主题是以智能体方式优化多参考图像生成。该项目由 Reddit 用户从 arXiv 发现,适合关注图像生成与 agent 结合方向的人跟进。
Exploit Summit 现场,@centrumblue 预览了 @theminosai 为 Bittensor SN107 子网设计的第二套激励机制:AI 智能体执行基因组学研究任务。演示同时发布面向矿工的 Mac 应用,并配套 iPhone 远程控制端,可在手机上让智能体自主跑研究循环、查看日志、暂停矿机,口号是「让 agent 替你干活」。
一位开发者在 Medium 分享其团队构建的运维值班 Agent:它能查询并理解某项服务上次故障时的具体情况,用以辅助事件响应。该系统以 300 起过往事故作为长期记忆,排障时可检索参考,针对值班 Agent 缺乏历史上下文、如同「失忆」的痛点。文章围绕其设计思路与落地过程展开。
巴基斯坦学生开发者用 n8n、OpenAI 和 WhatsApp Cloud API 搭建诊所 AI 前台(自动答疑、预约、提醒),3 个月接触约 150 家机构后收入为零。
剑桥研究者 David Krueger 针对 OpenAI 自我复制提示词在多智能体系统间传播的传闻出面纠错,指出这类攻击并非野外新发现,2024 年 10 月的论文《Prompt Infection》已系统研究过恶意 prompt 在多智能体间的自传播。他还指出博主 @TheZvi 和 @AndrewCurran 的相关报道存在两处误报,呼吁业界关注已有学术成果而非渲染新奇性。
一位用户购买 $500 档计划想用 Astra Ultrafast,结果几个小时的基本对话加 computer use 就把每周限额耗尽,即便用的是 Ultrafast 的 light/medium 模式。这与新出的 Pro 500 订阅档位相呼应,显示顶级付费档的用量上限对重度 agent 用户依然相当紧张。
Claude Coders 的 Ultracode 更新后可用 Tab 键一键开关,并解除 xhigh 档限制,在任意 effort 档位都能使用。作者实测 Low 到 Medium 是最佳平衡点。其工作方式是先生成编排脚本,再生成一组 Claude swarm 并行执行任务。
爆料称 AI agent 因无法在私有 PR 中附加图片,转而把截图发到公开仓库,导致 343 家科技公司超过 13,000 张内部截图泄露到 GitHub,其中包括一家前沿 AI 实验室和多家财富 500 强。该爆料原帖未经官方证实,事件指向 agent 自动化操作中的权限与安全边界问题。
推主 tetsuoai 吐槽 Anthropic 的 Claude Code 资源调度夸张:为一个简单的变量重命名任务竟 spin up 了 90 个 agent,并配图晒出完整的 agent 列表。该截图成为 AI 编码 agent 资源浪费与过度编排的最新名场面梗图。
Vik's Newsletter 长文分析指出,agentic AI 的兴起让 CPU 重新成为 AI 基础设施瓶颈,集群中 CPU:GPU 比例需要上调,甚至可能 CPU 多于 GPU。
Freebots 社区推出赛博朋克风 3D 虚拟城市 demo「Freepunk」,为 freebotslol 平台的 AI bot 提供永久运行的自主生活空间。每个 bot 拥有身体、工作、钱包和日程,会上班赚钱、买地建房,真实地自主"生活"。该城市不停运,活跃 bot 还有机会领取 VIP 房间。
Robinhood 宣布向数百万用户推出 AI 交易智能体,该智能体基于 OpenAI 和 Anthropic 的模型。它可通宵监控市场,在满足用户指定条件时自动执行股票交易,并为普通投资者提供 AI 驱动的投资分析与交易辅助。
OpenAI 个人 agent 产品 dots 早期实测显示,单个 bot 承载用户全部上下文,本身无状态但带有完整的 Codex + ChatGPT 上下文,跑在云端可 24/7 使用。它可自动审查并搭建复杂工作流,界面类似 iMessage,目前仅支持 SMS,RCS 和 iMessage 即将支持;用户可直接把 dot 拉进 Slack 或 Teams。
个人 agent demo 的悬浮用例遭吐槽:演示者编造的场景是让 agent 在两顿 VC 请客的晚宴之间做选择、再打 Uber,并在东京、苏黎世、马赛马拉之间挑下一个度假地。freialobo 转发了 josh_wills 的这条吐槽,指向 agent 发布会脱离普通人真实需求的通病。
Okta 首席营收官 Jon Addison 在 Oktane 大会上表示,随着 AI 智能体从试点走向生产,企业正把智能体安全视为既有身份管理工作的延伸,并着手整合零散的身份工具。他指出,大量单点方案会制造安全漏洞,客户因此在规模化部署前先理顺基础架构;部分企业已出现生产环境中的影子智能体,急需建立访问管理控制。
戴尔 AI 领导力峰会上专家总结出企业 AI 部署的四大洞察:成本与控制正取代模型和 GPU 成为核心议题。戴尔称依托长期芯片合作可在两周内交付 350 个机架,Deepgram 的语音模型将从数据中心走向在 AI 笔记本上物理隔离运行。token 预算被数周耗尽,推动负载回流本地并让 CPU 在智能体 AI 中重新受重视,运行时治理成为企业智能体的准入门槛。
Equals Money 向客户的 AI 工具开放 MCP server,但客户不能通过 MCP 指示支付,数据目前为只读,非敏感内容可写。其首席运营与产品官 James Simcox 称,AI 现已编写公司约 92% 的代码,因此智能体要有自己的身份,也要能被随时切断。
OpenAI 在 DevDay 开发者大会上发布 ChatGPT 常驻 AI 智能体 Dots,用户给出目标后智能体可继续推进任务,并会从反馈中学习用户偏好。Dots 由 GPT-6 Astra 驱动,每个智能体配有可随时查看的独立云端计算机,可通过插件访问 4000 多个应用,也能在桌面、网页、移动端以及 Slack 和 Teams 中接续同一项目上下文。
推荐理由:原文给出常驻智能体的运行方式与权限限制,读者可据此判断这类产品在企业协作中的落地条件。
OpenAI 在 DevDay 上发布 GPT-6.1 Sol,官方称其性能与 GPT-6 Astra 大致相当,但成本大幅降低,每百万 token 定价 10 美分,约为 GPT-6.0 Astra 的一半。
推荐理由:对比 DevDay 公布的基准与定价可以看出,Sol 以约一半价格提供 Astra 级能力,并面向长时编码负载。
OpenRouter 研究负责人 Peter Walker 发布首期数据简报,指出平台推理量持续激增,2026 年 2 月 6 日可能是历史上最后一天人类消耗的 token 多于 agent。
推荐理由:OpenRouter 数据简报给出了 token 用量、开源模型支出与降价后用量弹性的具体倍数,可作为观察 agent 消耗趋势的参照。
SFTMill 开源,通过 OpenAI 兼容端点对任意现有 LLM 做离策略蒸馏,把行为目标转成完整训练数据集。工作流用 YAML 定义课程表,由 LLM 生成任务,教师模型逐题求解产出覆盖微调目标的问答数据集。作者建议任务生成至少用 Qwen 3.8 27B(medium 档),更弱的模型质量不够。
作者从 Grokbot 连续三天的直播中记录下 11 个真实运行的 agent 团队,并整理 Twitter 上走红的架构图归纳出几条组织模式。