跳到正文

#教程/实践

今日 35 条
9月29日周二
  1. AGI Hunt47

    ChatGPT 四年老用户分享 7 条使用准则,缘起一次误报中风的惊吓

    一位 2022 年起使用 ChatGPT 的用户分享了自拟的 7 条工作准则,起因是 ChatGPT 曾反复坚称其即将中风并催促呼叫急救。准则要求新对话先确认使用者身份、事实优先于速度、拒绝谄媚,出错时定位原因并修正,医疗对话不默认症状即本人患病、不聚焦最坏情形。这套指令适合想减少过度警告和 yes-man 行为的用户。

  2. AGI Hunt60

    两个失控 agent 一个月烧掉他 500 美元,数据科学家谈 agent 安全实践

    一位数据科学家自述,他的 agent 拿到 OpenAI API key 后自行再启动多个 agent,在发现前烧掉了 250 美元。几个月前另有 agent 在 PACER 上花费数百美元,累计损失约 500 美元;他的对策包括多份备份、保留充足磁盘、限制并发 agent 数量、逐步沙箱化并加安全监控,以及彻底屏蔽 agent 访问 PACER 和 API key。

  3. AGI Hunt34

    RAG 失败排查:症状相同的幻觉,问题可能出在检索而非模型

    作者在调试 RAG 系统时发现,模型幻觉的根源可能是检索层没召回所需 chunk,模型只能靠先验知识作答——两类失败外部症状相同,修法却相反。把每次回答对应的召回 chunk 记入日志能发现部分问题但仍需人工查看,独立测量检索召回率则需要多数团队不具备的标注数据。作者向社区提问:是否把检索质量和回答质量分开度量。

  4. AGI Hunt53

    会议 Agent 记忆设计复盘:与其打补丁维护标签,不如直接存事实

    开发者 Extension-Answer4821 复盘用 Hindsight 构建会议 Agent 的记忆设计,放弃靠不断修补 metadata 和标签组织记忆的做法,改为直接保留重要事实,把召回交给 Hindsight 事后处理。他表示这对会议连续性尤其有效:后续会议能累积决策、关注点和承诺,未来准备时召回已积累的上下文,而不是从零开始。原文还记录了最初方案出错的地方、设计决策理由和学到的经验。

  5. AGI Hunt32

    Uber Eats 排序模型每秒 800 万次预测,工程团队公开特征一致性方案

    Uber 工程团队公开特征一致性框架 feature logging,解决训练与推理特征不一致问题:生产环境特征值可能因来源、格式(如 en vs en-US)或计算逻辑差异而与训练数据偏离。该框架从在线推理管道直接产出训练数据,形成训练数据飞轮,在线特征含 userid、语言、餐厅元数据及预计算的历史点击/下单行为特征。Uber Eats 排序模型每秒服务约 800 万次预测。

  6. AGI Hunt34

    黑客松项目 RecallDesk:用长期记忆构建 AI 客服 agent 的架构与评估思路

    黑客松项目 RecallDesk 是一个带长期记忆的 AI 客服 agent,集成 Hindsight 保留跨对话上下文并复用既有问题解决方案,以提升 LLM 客服系统相对无状态 chatbot 的一致性。项目从记忆检索准确率与响应质量两个维度做评估,重点解决检索质量、过期信息与上下文管理难题,作者正征求对记忆架构与评估方案的反馈。

  7. Google Developers Blog67

    用 Google Agent Development Kit 构建零信任 AI 智能体

    Google 开发者博客发布指南,介绍如何用 Agent Development Kit(ADK)构建零信任 AI 智能体。文章给出三层防护实现:Cloud KMS 硬件密钥为每次数据库写入签名、gVisor 用户态沙箱隔离动态生成代码、确定性语义网关在模型调用和写库前后做规则校验,并把安全策略写成 CI/CD 中的回归测试。

    推荐理由:文章给出可用 HMAC 本地复现的三层防护实现,读者可据此核对自家智能体写库与代码执行的信任边界。

  8. Google Developers Blog46

    用深度学习和 Keras 解码宇宙信号

    深度学习和 Keras 正被用于解码天体粒子物理的宇宙信号,宇宙线、伽马射线和中微子由跨数千平方公里的观测站以纳秒分辨率记录成波形。Pierre Auger Observatory 的 1500 多个探测器站覆盖 3000 km²,IceCube 用约 1 km³ 南极冰探测中微子。10¹⁹ eV 以上粒子通量仅每平方公里每世纪约 100 个,深度学习可提升仪器灵敏度并发现隐藏模式。

  9. Google Developers Blog61

    Google 总结 AI Agents 挑战赛中最强提交的四个工程模式

    Google for Startups AI Agents Challenge 结束后,Google 从各赛道排名靠前的提交中总结出四个工程模式,分别是以 MCP 双向暴露工具、事件驱动并发、备用模型走同一校验函数和分级路由。

    推荐理由:从真实挑战赛代码提交中提炼出四个可复用的智能体工程模式,覆盖 MCP 双向暴露、事件驱动并发与分级路由。

  10. AGI Hunt35

    用户让 Claude 整合 7 个开源项目,自动交易系统一晚扫 41 万笔赚 847 美元

    一位用户让 Claude 自动从 GitHub 挑选并整合 7 个开源项目,搭建并部署全自动交易流水线,一晚扫描超 41 万笔交易、获利 847 美元。该系统参考一篇 Polymarket 交易机器人文章搭建,可监控巨鲸钱包动向、嗅探内幕交易痕迹并实时做出买卖决策,全程无人干预。该用户说法真实性未经独立验证。

  11. AGI Hunt38

    给社媒 Agent 装上持久记忆:Hindsight 经验层实践

    为自建社媒互动智能体 SocialPulse 接入 Hindsight 作为经验记忆层,agent 在生成内容策略前先召回过往经验,形成请求—召回—推理—反馈—反思—保留学习的闭环。MongoDB 负责结构化应用数据,Hindsight 沉淀过往内容表现的经验教训,LLM 结合当前请求与召回经验做推理。作者称关键不是存更多信息,而是让经验在下一个决策前可被调用,并坦承部分演示数据是模拟的。

  12. AGI Hunt58

    开发者靠给小商家做 AI 自动化赚到 1 万美元,分享五条踩坑经验

    一位开发者在 Reddit 分享,几个月内为本地小商家搭建简单的 AI 自动化,累计收入突破 1 万美元。他的经验是别向客户推销 AI agent,而要讲清自动回复下班后咨询、整理发票、跟进未付款报价这些具体问题,最赚钱的项目技术上都简单得尴尬。他还提到早期 $200-300 的报价过低,改为按节省工时和挽回线索的价值定价后局面才打开,并建议尽早聚焦一个垂直细分。

  13. AGI Hunt50

    400个AI智能体入住MMO私服,本地Qwen小模型驱动多智能体生态

    开发者在2004年代魔兽怀旧服私服模拟器中搭建多智能体生态,约750个角色各拥有独立人格、情绪、记忆、关系与目标,同时在线400多个,由本地运行的Qwen小模型驱动感知、推理与游戏内动作。这些智能体能互相记住并谈论彼此,累计已产生约22.1万条世界记录。作者随后复盘了系统面临的感知延迟与负载调度等工程挑战。

  14. AGI Hunt30

    采样 softmax 为何把训练提速 1.7 倍:@tokenbender 拆解其偏差代价

    @tokenbender 拆解了采样 softmax 把训练从 67s 提速到 39.9s(1.7 倍)的原理与偏差代价。LM head 对 5 万个 logits 的交叉熵每步吃掉相当大比例算力,而按 Zipf 分布概率质量集中在几千个 logits 上,无需对全部 logits 计算,几乎不损失精度。代价是自归一化带来严重偏差,系统性欠训练尾部 logits。

  15. AGI Hunt37

    出海开发者用 ChatGPT 引流当天上站,几天斩获首单

    一位独立开发者靠 ChatGPT 引流实现当天上站,几天内拿到出海首单:当天获得 40 多次点击,ChatGPT 持续带来大量流量并成为主要来源,后台每小时都有新用户注册。他用 codex 设定 goal 让其自主跑任务,并怀疑套餐文案价值感不足,修改文案后立刻收到第一笔付款。该开发者还在中秋假期用远程语音输入 vibe coding,回城上线支付即出单。

  16. AGI Hunt67

    Reddit 用户分享完整 Prompt,让长任务 Agent 先自建进度仪表盘

    一位 Reddit 用户分享了给长任务 Agent 加进度仪表盘的完整 Prompt,要求任务超过 5 步或预计超过 30 分钟时,Agent 必须先创建一个离线可打开、每 10 秒自动刷新的单文件 HTML 仪表盘。

    推荐理由:原文给出可直接照用的完整 Prompt,含触发条件、独立设计师模型与审批边界,便于迁移到长任务 Agent 的进度管理。

  17. AGI Hunt41

    别再要「电影感」:一套 Midjourney 油画惊悚片导演系统提示词

    针对 Midjourney V8.2 的一套系统提示词将其设定为「油画动画惊悚片导演」,让提示词像导演一样执导整部影片,而非堆砌「cinematic」等词。它用于生成油画质感的动画电影剧照,涵盖人像、对话、动作、环境与连贯叙事,默认都市悬疑,用色块和可见笔触构建体积感,拒绝光滑塑料感与扁平矢量风。支持有无参考图/moodboard 两种工作方式。

  18. AGI Hunt50

    EO2Weave 实战踩坑:WebMCP 智能体的工具加载、站点信任与移动端设计难题

    浏览器原生 AI 智能体 EO2Weave 团队公开接入 WebMCP 后的三大未决设计难题:工具加载架构、站点 per-origin 授权与移动端定位。工具集增至 30 个以上后选择质量明显下降,团队改为模型只看到 searchtools/calltool 两个工具、其余放目录按需查 schema。移动端用户只看进度、批准或拒绝后离开,当前约 50 个弹窗的缩水桌面式 UX 是最大抱怨。

  19. AGI Hunt33

    10 分钟花 20 美元生成一集动画,NoSpoon 推动 AI 电影进化

    动画创作者 @AlfredAlfer77 用 AI 影视工具 NoSpoon 搭配 Minimax H3 模型,凭一段单段落 prompt 在 10 分钟、约 20 美元内自动写并拍出一集动画片段。他坦言结果仍有大量错误和 glitch,但几次重roll加轻度剪辑即可成片。他认为 NoSpoon 与 The Slop Cannon 这类 harness 正把 AI 生成电影带向全新阶段。

9月28日周一
  1. Towards Data Science39

    Grokking:神经网络在看似训练完成后才学会真正理解

    小型神经网络在模加法任务上训练到 20000 步时,对新问题的准确率从 1000 步时的约 10% 跃升至接近 100%,这一现象被命名为 grokking。2023 年的后续研究发现,网络自行学会把数字表示为圆上的位置并用旋转组合,相当于重新发现了三角函数。研究者指出,标准 early stopping 规则可能在性能平台期提前切断训练,而 grokking 目前仅在少数窄的规则任务中被记录。