独立开发者用 Claude 完成动作 Roguelite《Steel Maiden》的武器设计与全部代码
一位有总监与美术总监经验的独立开发者公开了约 8 个月用 Claude 开发 Unity 动作 Roguelite《Steel Maiden》的 AI 工作流,该游戏已在 Steam 提供免费 Demo。
一位有总监与美术总监经验的独立开发者公开了约 8 个月用 Claude 开发 Unity 动作 Roguelite《Steel Maiden》的 AI 工作流,该游戏已在 Steam 提供免费 Demo。
作者自建项目演示让 AI agent 通过 MCP 层跨终端和浏览器完成真实工作,而不授予整台机器的完全访问权。该 MCP 层将「能力」与「权限」分离:敏感操作前先做策略检查,只允许受控本地操作,执行过程可观测可审计。作者正征集社区对审批边界与可审计性最低控制标准的意见。
博主 justin_hart 只截了一张乐谱图片、配上一段免费的 Für Elise 音频,就交给 Claude Opus 5.5 复刻出电影中「镜头扫过乐谱、音符随演奏依次点亮」的动画效果,全程没有写代码。这展示了当前模型从单张图像理解乐谱并生成同步动画的能力。
一位 2022 年起使用 ChatGPT 的用户分享了自拟的 7 条工作准则,起因是 ChatGPT 曾反复坚称其即将中风并催促呼叫急救。准则要求新对话先确认使用者身份、事实优先于速度、拒绝谄媚,出错时定位原因并修正,医疗对话不默认症状即本人患病、不聚焦最坏情形。这套指令适合想减少过度警告和 yes-man 行为的用户。
作者在调试 RAG 系统时发现,模型幻觉的根源可能是检索层没召回所需 chunk,模型只能靠先验知识作答——两类失败外部症状相同,修法却相反。把每次回答对应的召回 chunk 记入日志能发现部分问题但仍需人工查看,独立测量检索召回率则需要多数团队不具备的标注数据。作者向社区提问:是否把检索质量和回答质量分开度量。
开发者 Extension-Answer4821 复盘用 Hindsight 构建会议 Agent 的记忆设计,放弃靠不断修补 metadata 和标签组织记忆的做法,改为直接保留重要事实,把召回交给 Hindsight 事后处理。他表示这对会议连续性尤其有效:后续会议能累积决策、关注点和承诺,未来准备时召回已积累的上下文,而不是从零开始。原文还记录了最初方案出错的地方、设计决策理由和学到的经验。
开发者受 macOS 桌面下雨小应用 Weatherling 启发,用 Claude Code 全程 vibe coding 出开源替代品 Rainpane,雨水落在窗口后方,在顶边积水、沿侧边流淌、从底角滴落,移动窗口时水会悬空、坠落、飞溅,点击会生成一颗水滴,在 macOS 26+ 上使用 Liquid Glass 渲染。
摄影师 tischeins 分享了一组 Midjourney v8.2 黑白人像提示词,描写年轻女性清晨在床上伸展的场景,参数为 --v 8.2 --ar 5:4。
Uber 工程团队公开特征一致性框架 feature logging,解决训练与推理特征不一致问题:生产环境特征值可能因来源、格式(如 en vs en-US)或计算逻辑差异而与训练数据偏离。该框架从在线推理管道直接产出训练数据,形成训练数据飞轮,在线特征含 userid、语言、餐厅元数据及预计算的历史点击/下单行为特征。Uber Eats 排序模型每秒服务约 800 万次预测。
黑客松项目 RecallDesk 是一个带长期记忆的 AI 客服 agent,集成 Hindsight 保留跨对话上下文并复用既有问题解决方案,以提升 LLM 客服系统相对无状态 chatbot 的一致性。项目从记忆检索准确率与响应质量两个维度做评估,重点解决检索质量、过期信息与上下文管理难题,作者正征求对记忆架构与评估方案的反馈。
开发者构建了一个客户支持 agent,用 Hindsight 做长期记忆、Groq 提供 LLM,让机器人能跨会话召回客户的完整历史,而非每次从零开始。文中记录了加记忆后的实际变化,包括发现并修复一例记忆幻觉——机器人凭空编造了记忆里不存在的细节。
Google 在开发者博客给出在树莓派 5 上用 LiteRT 与 Gemma 运行端侧 AI 的部署指南。据文中数据,Gemma 4 E2B 在 LiteRT-LM 下达到 99 tokens/sec prefill 与 9 tokens/sec decode,峰值内存 1432 MB。
HeyGen 与 Google Cloud 把 18B 参数的 Avatar IV 移植到八芯片 Trillium(v6e)主机,提速 1.86×。Avatar IV 是驱动说话头视频的扩散模型栈,以 Web 和 API 提供 720p/1080p、25fps 流式渲染。迁移经 torchax 前端完成,性能接近 8×H100 生产环境,视频成本效率最高提升 25%。
Google 开发者博客发布指南,介绍如何用 Agent Development Kit(ADK)构建零信任 AI 智能体。文章给出三层防护实现:Cloud KMS 硬件密钥为每次数据库写入签名、gVisor 用户态沙箱隔离动态生成代码、确定性语义网关在模型调用和写库前后做规则校验,并把安全策略写成 CI/CD 中的回归测试。
推荐理由:文章给出可用 HMAC 本地复现的三层防护实现,读者可据此核对自家智能体写库与代码执行的信任边界。
Google 在 ADK 中加入原生实时评估,可用模拟用户以语音驱动语音智能体并对回复打分,复用已有的文本智能体评估循环。
深度学习和 Keras 正被用于解码天体粒子物理的宇宙信号,宇宙线、伽马射线和中微子由跨数千平方公里的观测站以纳秒分辨率记录成波形。Pierre Auger Observatory 的 1500 多个探测器站覆盖 3000 km²,IceCube 用约 1 km³ 南极冰探测中微子。10¹⁹ eV 以上粒子通量仅每平方公里每世纪约 100 个,深度学习可提升仪器灵敏度并发现隐藏模式。
Google for Startups AI Agents Challenge 结束后,Google 从各赛道排名靠前的提交中总结出四个工程模式,分别是以 MCP 双向暴露工具、事件驱动并发、备用模型走同一校验函数和分级路由。
推荐理由:从真实挑战赛代码提交中提炼出四个可复用的智能体工程模式,覆盖 MCP 双向暴露、事件驱动并发与分级路由。
Google Developers Blog 发文介绍 AI 编码智能体的 harness 工程实践,主张用行为评测补充 Terminal-Bench、DeepSWE 这类端到端跑分。
Google 团队发布 autofinetune,把自治研究循环用于 LLM 后训练,智能体在 Tunix、Gemma 和 Cloud TPU 上自动改脚本、跑训练并保留或回滚实验。
客服 Agent 持久记忆实战用 Hindsight 分层存取:MemoryService 为每个客户建独立 memory bank,HindsightClient 封装对 Hindsight Cloud 的调用。
知名 AI 工程专家 Hamel Husain 表示正在研读 Anthropic 当天新发布的 Evals 指南,该资料聚焦如何在 agent/编码场景中构建有效的模型评估。他以评估领域专家身份第一时间跟进,并附上了原文链接。
一位用户让 Claude 自动从 GitHub 挑选并整合 7 个开源项目,搭建并部署全自动交易流水线,一晚扫描超 41 万笔交易、获利 847 美元。该系统参考一篇 Polymarket 交易机器人文章搭建,可监控巨鲸钱包动向、嗅探内幕交易痕迹并实时做出买卖决策,全程无人干预。该用户说法真实性未经独立验证。
为自建社媒互动智能体 SocialPulse 接入 Hindsight 作为经验记忆层,agent 在生成内容策略前先召回过往经验,形成请求—召回—推理—反馈—反思—保留学习的闭环。MongoDB 负责结构化应用数据,Hindsight 沉淀过往内容表现的经验教训,LLM 结合当前请求与召回经验做推理。作者称关键不是存更多信息,而是让经验在下一个决策前可被调用,并坦承部分演示数据是模拟的。
一位开发者在 Reddit 分享,几个月内为本地小商家搭建简单的 AI 自动化,累计收入突破 1 万美元。他的经验是别向客户推销 AI agent,而要讲清自动回复下班后咨询、整理发票、跟进未付款报价这些具体问题,最赚钱的项目技术上都简单得尴尬。他还提到早期 $200-300 的报价过低,改为按节省工时和挽回线索的价值定价后局面才打开,并建议尽早聚焦一个垂直细分。
开发者在2004年代魔兽怀旧服私服模拟器中搭建多智能体生态,约750个角色各拥有独立人格、情绪、记忆、关系与目标,同时在线400多个,由本地运行的Qwen小模型驱动感知、推理与游戏内动作。这些智能体能互相记住并谈论彼此,累计已产生约22.1万条世界记录。作者随后复盘了系统面临的感知延迟与负载调度等工程挑战。
知识蒸馏比普通监督学习更有效,关键在教师模型传递的不是单标签 one-hot,而是完整的概率分布向量 p()。这份分布把类别之间的相似度等「暗知识」一并传给学生,监督信号因此更丰富。
Reddit 用户用 Sonnet 5.5 以一条 prompt 一次成型(one-shot)生成交互网页 ride-a-photon.somewhere.site,模拟跟随一粒光子从太阳飞到地球,耗时约 55 分钟。
@tokenbender 拆解了采样 softmax 把训练从 67s 提速到 39.9s(1.7 倍)的原理与偏差代价。LM head 对 5 万个 logits 的交叉熵每步吃掉相当大比例算力,而按 Zipf 分布概率质量集中在几千个 logits 上,无需对全部 logits 计算,几乎不损失精度。代价是自归一化带来严重偏差,系统性欠训练尾部 logits。
Matt Shumer 让 Opus 5.5 自主找到清空 3D 打印机料盘的办法,以便在无人介入的情况下不间断做实验。该智能体经过 16 次尝试后成功,Shumer 宣布自己「正式退出循环」,过程视频由模型自行录制。
SemiAnalysis 分析指出,GLM-5.3 的稀疏注意力虽降低了 KV cache 带宽与访存需求,但 top-k 选择需完整上下文驻留 HBM,内存容量瓶颈未被消除。
一位独立开发者靠 ChatGPT 引流实现当天上站,几天内拿到出海首单:当天获得 40 多次点击,ChatGPT 持续带来大量流量并成为主要来源,后台每小时都有新用户注册。他用 codex 设定 goal 让其自主跑任务,并怀疑套餐文案价值感不足,修改文案后立刻收到第一笔付款。该开发者还在中秋假期用远程语音输入 vibe coding,回城上线支付即出单。
开发者 @technomantics 在单台 24GB 显存 + 28GB 内存的 PC 上,靠 Meta 的 Muse Glimmer 完成工具调用,本地生成 8bit 音效与 30 秒 MIDI 音乐。对比中 Gemma 4 12b 无法正确使用工具链,35B 参数的 Ornith 1.5 A3B 需反复重教如何使用这套工具栈,才勉强接近 Muse Glimmer 一次就做到的效果。
一位 Reddit 用户分享了给长任务 Agent 加进度仪表盘的完整 Prompt,要求任务超过 5 步或预计超过 30 分钟时,Agent 必须先创建一个离线可打开、每 10 秒自动刷新的单文件 HTML 仪表盘。
推荐理由:原文给出可直接照用的完整 Prompt,含触发条件、独立设计师模型与审批边界,便于迁移到长任务 Agent 的进度管理。
针对 Midjourney V8.2 的一套系统提示词将其设定为「油画动画惊悚片导演」,让提示词像导演一样执导整部影片,而非堆砌「cinematic」等词。它用于生成油画质感的动画电影剧照,涵盖人像、对话、动作、环境与连贯叙事,默认都市悬疑,用色块和可见笔触构建体积感,拒绝光滑塑料感与扁平矢量风。支持有无参考图/moodboard 两种工作方式。
开发者把 400+ 个 LLM Agent 放进 2004 年代魔兽怀旧服私服模拟器,服务器上每个在线角色都拥有独立背景、目标和记忆,能感知世界、推理并执行游戏内动作。
浏览器原生 AI 智能体 EO2Weave 团队公开接入 WebMCP 后的三大未决设计难题:工具加载架构、站点 per-origin 授权与移动端定位。工具集增至 30 个以上后选择质量明显下降,团队改为模型只看到 searchtools/calltool 两个工具、其余放目录按需查 schema。移动端用户只看进度、批准或拒绝后离开,当前约 50 个弹窗的缩水桌面式 UX 是最大抱怨。
一位 Reddit 用户分享了一套 retention_analysis 提示词模板,用来解决 AI 生成多角色对话视频时的台词错位和人物形象在各镜头间漂移问题。
动画创作者 @AlfredAlfer77 用 AI 影视工具 NoSpoon 搭配 Minimax H3 模型,凭一段单段落 prompt 在 10 分钟、约 20 美元内自动写并拍出一集动画片段。他坦言结果仍有大量错误和 glitch,但几次重roll加轻度剪辑即可成片。他认为 NoSpoon 与 The Slop Cannon 这类 harness 正把 AI 生成电影带向全新阶段。
Google MaxText 团队在 Cloud TPU 上从头复现了 Ai2 的 Olmo 3 7B 预训练与中期退火,阶段 1、阶段 2 的损失曲线与 Ai2 公开参考在留出评估上对齐。
GitHub 博客介绍其 Security Lab 用开源的 Taskflow Agent 智能体在 Android 应用中发现了 24 个漏洞,并给出 OsmAnd 位置追踪与 Wikipedia 账号接管两个案例。
推荐理由:文中给出审计 taskflow 查找 Android 漏洞的具体案例与运行步骤,安全研究者可迁移到自有应用的审计流程。