跳到正文

#Agent

今日 182 条
今天9月30日周三
  1. AWS Machine Learning Blog35

    Amazon Quick 提示词工程基础:通用原则与可复用框架

    Amazon Quick 提示词工程系列的第一部分聚焦适用于各类 Quick 组件的通用原则与可复用框架,核心方法包括用具体性实现清晰、用上下文提升相关性、用示例替代描述,并给出 CRISPE 结构化提示模板。第二部分将分别讲解 Research、Flows、Sight、Chat Agents 与 Action Integrations 的专属技巧。

  2. IT之家48

    OpenAI 奥尔特曼:AI 影响将超过工业革命,现在是进入就业市场的最佳时机

    奥尔特曼在 OpenAI DevDay 上称 AI 的影响会超过工业革命,并发布 AI 智能体产品 Dots,认为现在是进入就业市场的最佳时机。他还称 token 是糟糕的指标,OpenAI 曾考虑放弃但客户不赞成;Dots 已替他处理通知和待办,让他不再那么依赖手机。他预计部分工作会彻底消失,但大规模失业的悲观预测低估了经济未来的增长。

  3. AWS Machine Learning Blog67

    GPT-6.1 Sol 在 Amazon Bedrock 上正式可用

    GPT-6.1 Sol 已在 Amazon Bedrock 正式可用,作为 GPT-6 Sol 的重大升级,面向智能体编码、计算机操作和专业工作负载提供更强推理。

    推荐理由:文章给出 GPT-6.1 Sol 与 Astra、GPT-6 Sol 的评测及单任务成本对比,可据此评估智能体编码任务的性价比。

  4. The Decoder80

    OpenAI 发布 GPT-6.1 Sol,称以五分之一成本接近 Astra

    OpenAI 发布 GPT-6.1 Sol,称其在智能体编码、电脑操作和办公任务上接近仍未发布的旗舰 GPT-6 Astra,成本约为其五分之一。API 价格为每百万输入 token 2 美元、输出 10 美元,缓存输入 0.10 美元,Plus、Pro、Business、Enterprise 和 Edu 用户当日起可在 ChatGPT Work 和 Codex 使用。

    推荐理由:原文对比 Sol 与 Astra、GPT-6 Sol 及 Claude 的价格与基准数据,可看清 OpenAI 在成本与性能之间的取舍。

  5. The Decoder77

    OpenAI 在 DevDay 2026 发布常驻智能体 Dots,对标 Meta Muse

    OpenAI 在 DevDay 2026 开发者大会发布 Dots 常驻智能体,可自主跟进项目并处理修复 bug、发送发票等任务。每个 Dot 配有带浏览器的云端电脑,运行在 GPT-6 Astra 上,用户可通过 ChatGPT、Slack 和 Microsoft Teams 的文字或语音与它交互,插件可连接 4,000 多个应用。

    推荐理由:Dots 与三周前发布的 Meta Muse 在设计上相近,读者可对比两家常驻智能体的能力边界与权限设计。

  6. TechCrunch · AI69

    OpenAI 为 Codex 推出可跨设备复用的云端开发环境

    OpenAI 在 DevDay 上为编码智能体 Codex 推出可跨设备访问的云端开发环境,让任务启动更快,并为团队提供带批准设置和权限的共享工作区。Codex CLI 支持用语音启动和调度任务,新增 /agents 视图和更简洁的终端界面,Codex 还接入 ChatGPT 桌面应用中的代码审查体验,可读取摘要、查看改动或就潜在问题提问。

  7. TechCrunch · AI39

    AI 应用生成器 Wabi 转型,推出 Wabi 2.0 即时通讯体验

    Wabi 从提示词生成 AI 应用转向即时通讯形态,本周推出 Wabi 2.0,定位为能按需生成界面、替用户完成任务的“个人智能体”。用户可在健康、家庭等对话线程里生成卡路里追踪、举重记录、儿童活动日历等应用,与他人共享。该应用目前仅通过 X 上发放的邀请码开放使用。

  8. OpenAI News62

    OpenAI 发布 GPT-6.1 Sol

    OpenAI 发布 GPT-6.1 Sol,面向编码、计算机操作和专业工作场景,官方称其智能水平接近 Astra。该模型的 API 输入与输出 token 价格均为 Astra 标准价的五分之一。

    推荐理由:官方给出 GPT-6.1 Sol 相对 Astra 的 token 定价比例与能力定位,可用于判断其成本取舍。

9月29日周二
  1. AGI Hunt37

    用 Hindsight 持久记忆打造会记住客户的客服 Agent

    作者演示客服 AI agent SupportMemory,用 Hindsight 作持久记忆层记住客户历史信息,不再重复索要订单号。无记忆架构是「客户→AI→回复」,有记忆则先召回历史上下文再回复并留存新信息。demo 用 Ananya、Steven、Max 三位虚拟客户验证对话可延续,结论是 AI agent 不只要生成好回答,还要记住正确的上下文。

  2. AGI Hunt53

    给 AWS 成本智能体加记忆,建议采纳率从 71% 提到 88%

    Bharadhwaj3305 为 AWS 成本优化智能体加入记忆机制,建议采纳率从 71% 提升到 88%。该机制通过记录并学习工程师为什么拒绝某些成本优化建议(hindsight),让智能体不再重复推荐已被否决的方案。文章还给出了记忆增强的设计思路与实测数据,并提到该思路可迁移到其他 agent 场景。

  3. AGI Hunt33

    VeilMind 原型:跨客户共享 AI 记忆,同时隔离各家隐私经验

    VeilMind 原型提出一套多租户 AI 记忆方案:每个客户拥有独立隔离的记忆,项目结束后把泛化教训经可识别信息检查后写入共享 playbook。作者还搭建攻击测试环境,验证能否诱导 AI 泄露其他项目信息,并对冲突知识选择呈现冲突而非当作普适真理。该原型被定位为 hackathon 原型,而非生产级安全系统。

  4. AGI Hunt45

    Jev 等小模型路由比 LLM 快 200 倍、便宜 400 倍,AI 软件架构走向分层智能

    Pavan Belagatti 提出 AI 软件架构正走向分层智能:由确定性代码维护工作流结构,快速专用小模型处理窄域语义分支,只在异常情况下才升级调用完整推理模型。其中 system-one 小模型(如 Jev)做路由比 LLM 快约 200 倍、便宜约 400 倍。LangGraph 这类框架提供状态管理、持久化执行与人机协同检查点等编排层。

  5. AGI Hunt47

    OmniNode 作者提出双向验证法:如何测试编码智能体写的检查

    OmniNode 作者提出「双向验证法」测试编码智能体写的检查:验证器需同时验证故意写坏的输入必须 fail、对应合法版本必须 pass,只测坏输入会让「全部拒绝」的验证器看起来完美。作者还倾向对真实故障后补的检查保留最小复现及修复版本,让检查能区分两者,并询问社区是用回归用例、变异测试还是人工评审。