跳到正文

#Agent

今日 168 条
今天9月30日周三
  1. AGI Hunt44

    多智能体共享记忆写坏怎么办?Reddit 热议可恢复设计

    Reddit 发帖人提出多智能体共享记忆的可恢复设计:以人类可读文件为 source of truth,配合不可变快照或 append-only 决策日志,派生索引可随时重建。每次更新携带作者、时间戳、来源链接、状态和 supersedes 字段,并发写入检测到过期版本即失败,而非 last-write-wins。他还追问如何区分事实、决策、临时观察与生成摘要,以及该逐次审查还是依赖回滚溯源。

  2. AGI Hunt33

    用户视角:ChatGPT 积累的上下文成个人 Agent 护城河

    用户 AnneliesGamble 认为 OpenAI 的个人 AI agent 项目 Dots 有先发优势,因为 ChatGPT 已积累了大量关于她的个人上下文。Instinct、Muse、Grok Bot 等其他 agent 虽能连接她的各类应用,却无法替代长期对话历史形成的对她思维方式的理解。这折射出个人 agent 竞争中「上下文积累」可能比「应用集成」更关键。

  3. AGI Hunt46

    雅虎前 CEO Marissa Mayer 发布 AI 助手 Dazzle

    雅虎前 CEO、前 Google 高管 Marissa Mayer 于 9 月 30 日发布个人 AI 助理 Dazzle。该产品读取手机相册,从服装、旅行、夜出行等照片中理解用户偏好,实现个性化购物推荐与代理购物,并把手机相机按钮变成无需输入提示词的「搞定」按钮,直接基于当前画面提供即时上下文与操作。

  4. AGI Hunt31

    前 Google 工程师 Piotr:AI agent 还写不出生产级代码,60 分钟面试还能考什么?

    前 Google 工程师 Piotr 澄清,他并非反对面试考编程能力,但在 Google 代码库贡献的经历让他确信 AI agent 还远达不到生产级代码所需的正确、干净与可扩展水平。他同时质疑 LeetCode 刷题式面试并非理想方案,抛出 60 分钟面试除算法题还能考什么的问题。这反映出 AI 编程助手普及后,工程招聘标准尚未找到新范式。

  5. AGI Hunt43

    max_paperclips 反驳 housecor:模型变强不等于可删 agent 封装层

    max_paperclips 反驳 housecor:模型变强并不会让 agent 封装层变得多余。他认为模型不会自动学会记忆重复任务、感知可用 API 或积累可复用工具集,skills、MCP、自定义循环等封装层仍需保留。实际变化只是 prompt 和指令能写得更简略,嵌套循环、任务进度追踪等工程结构不会因 TerminalBench 提升 2% 就消失。

  6. AGI Hunt55

    亚马逊购物智能体 Instinct 开始推赞助商品,变现路径露出真容

    亚马逊购物智能体 Instinct 开始向其推送产品,形式疑似基于购买历史和网络行为推荐「赞助商品」,这很可能就是它的商业化路径。原帖作者据此感叹又多了一个用开源的理由,认为把个人数据交给智能体,换来的却是被广告瞄准。智能体内置广告如何影响推荐可信度,值得持续关注。

  7. AGI Hunt46

    南科大提出 ActFirst-OPD:先行动后思考,多轮智能体蒸馏训练提速最高 4.9 倍

    南科大提出 ActFirst-OPD,让智能体先行动、偏离参考轨迹时切回自主预测,解决在线策略蒸馏(OPD)中长推理阻塞环境交互的问题。在 0.6B/1.7B/4B Qwen3 上,ALFWorld 平均提速 2.3 倍、WebShop 1.8 倍、ScienceWorld 4.9 倍。9 组基准-模型设置中 8 组成功率持平或超越 OPD 基线。

  8. AGI Hunt66

    谷歌发布 PageBreak 智能体漏洞挖掘工具,自动验证实现近零误报

    谷歌产品安全团队在官方博客介绍内部智能体漏洞挖掘工具 PageBreak,把候选漏洞放进真实运行环境实际验证,做到接近零误报。该工具以 Gemini 3.1 Pro、3.5 Flash 等 Gemini 系列模型为主,已大规模运行并发现超过 500 个 XSS 漏洞。

    推荐理由:PageBreak 把候选漏洞放进真实环境验证以压低误报,可看出智能体做安全测试时如何减少人工筛选负担。

  9. AGI Hunt34

    Agent 演示惊艳但一遇例外就露馅:如何度量 Agent 可靠性

    有作者指出,多数 Agent 演示在干净工作流下表现完美,但真实业务充满数据不完整、客户异常、集成损坏、指令含糊、无人记录的决策等例外。其认为 Agent 可靠性的真正考验不是能否走完正常路径,而是它是否知道何时停下来求助,并由此抛出「该如何度量 Agent 可靠性」的讨论问题。

  10. AGI Hunt67

    保留失败的 agent 任务,每次新模型发布时重跑以捕捉能力质变

    victor_explore 建议保留所有失败的 agent 运行记录,把它们当作针对下一代模型的评测集,每次新模型发布就整体重跑一遍。他引用 Anthropic Labs 的案例:Mike Krieger 透露团队曾搁置一个失败的 computer use agent 项目,每次新模型发布都重跑,直到 Claude 3.7 出现后成功率突然过半,项目起死回生。

    推荐理由:把跑挂的 agent 任务留存成评测集,提供了一个跨模型版本观察能力跃迁的可复用做法。

  11. AGI Hunt38

    开发者打造能记住 300 起历史故障的值班运维 Agent

    一位开发者在 Medium 分享其团队构建的运维值班 Agent:它能查询并理解某项服务上次故障时的具体情况,用以辅助事件响应。该系统以 300 起过往事故作为长期记忆,排障时可检索参考,针对值班 Agent 缺乏历史上下文、如同「失忆」的痛点。文章围绕其设计思路与落地过程展开。

  12. AGI Hunt52

    剑桥学者 David Krueger 澄清:恶意 prompt 自传播两年前已有论文

    剑桥研究者 David Krueger 针对 OpenAI 自我复制提示词在多智能体系统间传播的传闻出面纠错,指出这类攻击并非野外新发现,2024 年 10 月的论文《Prompt Infection》已系统研究过恶意 prompt 在多智能体间的自传播。他还指出博主 @TheZvi 和 @AndrewCurran 的相关报道存在两处误报,呼吁业界关注已有学术成果而非渲染新奇性。

  13. AGI Hunt34

    Freebots 打造永久运行的赛博朋克 AI 虚拟城市

    Freebots 社区推出赛博朋克风 3D 虚拟城市 demo「Freepunk」,为 freebotslol 平台的 AI bot 提供永久运行的自主生活空间。每个 bot 拥有身体、工作、钱包和日程,会上班赚钱、买地建房,真实地自主"生活"。该城市不停运,活跃 bot 还有机会领取 VIP 房间。

  14. SiliconANGLE:AI28

    AI 智能体推动企业身份管理清理与整合

    Okta 首席营收官 Jon Addison 在 Oktane 大会上表示,随着 AI 智能体从试点走向生产,企业正把智能体安全视为既有身份管理工作的延伸,并着手整合零散的身份工具。他指出,大量单点方案会制造安全漏洞,客户因此在规模化部署前先理顺基础架构;部分企业已出现生产环境中的影子智能体,急需建立访问管理控制。

  15. SiliconANGLE:AI33

    戴尔 AI 领导力峰会四大洞察:成本与控制重塑企业 AI 部署策略

    戴尔 AI 领导力峰会上专家总结出企业 AI 部署的四大洞察:成本与控制正取代模型和 GPU 成为核心议题。戴尔称依托长期芯片合作可在两周内交付 350 个机架,Deepgram 的语音模型将从数据中心走向在 AI 笔记本上物理隔离运行。token 预算被数周耗尽,推动负载回流本地并让 CPU 在智能体 AI 中重新受重视,运行时治理成为企业智能体的准入门槛。

  16. SiliconANGLE:AI76

    OpenAI 在 ChatGPT 上线常驻 AI 智能体 Dots

    OpenAI 在 DevDay 开发者大会上发布 ChatGPT 常驻 AI 智能体 Dots,用户给出目标后智能体可继续推进任务,并会从反馈中学习用户偏好。Dots 由 GPT-6 Astra 驱动,每个智能体配有可随时查看的独立云端计算机,可通过插件访问 4000 多个应用,也能在桌面、网页、移动端以及 Slack 和 Teams 中接续同一项目上下文。

    推荐理由:原文给出常驻智能体的运行方式与权限限制,读者可据此判断这类产品在企业协作中的落地条件。

  17. AGI Hunt67

    OpenRouter 发布首期数据简报,token 用量爆发、开源模型支出半年涨 10 倍

    OpenRouter 研究负责人 Peter Walker 发布首期数据简报,指出平台推理量持续激增,2026 年 2 月 6 日可能是历史上最后一天人类消耗的 token 多于 agent。

    推荐理由:OpenRouter 数据简报给出了 token 用量、开源模型支出与降价后用量弹性的具体倍数,可作为观察 agent 消耗趋势的参照。