TypeSafe 发布官方 Claude Code skill,13 问合并一次调用省 12 倍
TypeSafe 发布官方 Claude Code skill,教 Claude Code 使用 Jev,并要求写代码前先读 TypeSafe 的实时文档,规则、数学和查表留在普通代码里,Jev 只用于判断类问题,按 Choice、Noul、Score 区分问题类型。
TypeSafe 发布官方 Claude Code skill,教 Claude Code 使用 Jev,并要求写代码前先读 TypeSafe 的实时文档,规则、数学和查表留在普通代码里,Jev 只用于判断类问题,按 Choice、Noul、Score 区分问题类型。
CatAstro_Piyush 提出一种 AI agent 训练思路:让 agent 在自己的解释上训练,而非在代码上训练,训练后编码能力反而变强。整个流程没有教师模型、没有验证器、也没有 RL 更新,测试时同样不需要额外上下文。相关做法以长线程形式逐步给出并附实现链接。
作者 iamfakhrealam 实测 KooKo Agent 自动完成论文整理:把 13 页 MPhil 研究论文交给它后,Agent 自行制定计划,产出带真实公式的表格、一页纸摘要和可编辑幻灯片。全程作者只需引导方向,中途合上电脑任务仍在继续运行。该论文主题是乌尔都语和普什图语为何比英语消耗更多 AI token。
KooKo Agent 用户从 Skill Hub 中选用「Turn Data into Charts」这条由真实专家经验构建的 Skill,在相同数据和任务下把图表做到了可用于毕业论文的质量。作者强调,Skill 的本质是可复用的专家经验,而非魔法。
作者称使用 Luna 的「extra high」档完成客户的神经渲染项目,仅消耗 6%-7% 配额,且后台同时运行其他优先级内核任务。这一用量效率数据对关注智能体订阅配额的用户有参考价值。
Playbit 作者 rsms 分享近几周的编码 Agent 工作流,把 Figma 当作软件的 grounding truth,效果胜过传统的计划与设计文档。
开发者 Elliot Glazer 提醒,Codex 20x 档($200/月)订阅如果只剩最后一个月,应先把这一个月用完,再去点“升级到 $500 档”。他暗示升级操作可能不按剩余天数折算、也不保留已付费额度,用户因此可能多花一个月的 $200。对重度 Codex 用户是直接的省钱提醒。
开发者 gandamuml 让 LLM 在 tapes 中记录执行顺序,再在克隆环境按序回放,为 Minecraft 1.21.11 世界生成提供了可复现的确定性验证。Minecraft 1.21.11 的世界生成受 Java 运行时差异影响,同一版本自身每次运行结果都可能不同。该方案在完成确定性验证的同时,保留了正式发布运行的灵活性。
6 个视频、97 格人工标注的横测显示,LLM 漏提取的瓶颈在 ASR 分段切断而非模型能力。本地 CLI + Google One Pro 下 gemini-3.7 与 3.8 均达 91/97 = 93.8%,逐视频分数和错误完全一致,但 3.8 慢 5-6 倍。3.6、3.7-medium、3.7-high 在同一视频都漏掉同样 4 格,DeepSeek V4 Flash 仅 71/97。
开发者 gandamu_ml 展示了 Minecraft 世界生成器克隆的决策点验证法:不必证明生成顺序分布与 Java 原版一致,只需证明在给定相同顺序时两者结果等价。实现上他借助 LLM 自动寻找合适的决策点,使克隆环境的验证回放流程能无缝切换到接下来需要执行的代码。他坦承不确定 LLM 具体做了什么,但认为该方案理论上可行。
作者团队上线的 lead 资质评估 agent 会自信宣布「线索已更新并分配给销售」,而实际工具调用返回错误甚至根本没被调用。更严格的 prompt、自我反思步骤和重试都只略有帮助,因为本质上仍是让模型给自己批改作业。
开发者 @thegreatestsv 分享了一套基于 Grok 的 X 内容自动化工作流,把原本每天约 3 小时的刷帖、攒灵感、写稿流程自动化。
一位 Reddit 发帖人提出跨模型交接长期项目的「小项目包」格式,用于把 ChatGPT 上的项目转交给 Claude。该格式应包含目标、当前状态、已采纳决策及其理由、开放问题、精确的文件或产物、来源链接、约束条件和已完成的检查,并给出一个下一步动作,同时把已验证事实与模型生成的摘要分开,避免接收方把每句话当作同等权威。
用户 wyrdweir 分享了他与 Claude 的玩法:先给模型灌一段 Shia LaBeouf 风格的「Just Do It」励志咆哮,把情绪拉满,再让它去做一些荒唐的事。repligate 转发了这条内容,这类提示词整活在 AI 圈广为流传。
创作者 @mrjonfinger 团队用 LumaLabsAI 在 DreamLabLA 拍出人机即兴合奏短片。同伴 Tony Houart 趁等待视频生成间隙弹吉他,作者架起摄像机即兴合奏,团队随后用 AI 重新生成/演绎这些演奏场景。短片把等待生成的碎片时间变成创作素材,展示 AI 视频工具在音乐表演类内容上的玩法。
开发者用 Groq 做推理、Hindsight 做记忆,搭建了一个能从反馈中学习的代码审查 Agent,让它在多次审查之间保留有用的反馈并在后续审查中复用。该流程用 Expense Tracker 项目做了测试,作者还记录了 AI 代码审查器具备跨交互记忆后审查行为的变化及构建经验。
博主 Amelia 分享了 8 条 Claude 提示词,可从选题构思到最后一页批量生成一整个月的社交媒体轮播图(carousel)设计,称效果堪比 4800 美元的设计工作室外包,且免费。这套 prompt 流程适合内容创作者照搬,用于日常出图。
开发者 RileyRalmuto 让 Claude Opus 自主撰写脚本,并标注每个词的起始时间戳、呼吸停顿与语音表现,再交给 ElevenLabs 合成配音,目标是无需人工干预产出成品配音。
博主 nikola_mr64990 分享 7 条 Claude 提示词,用于优化 LinkedIn 个人主页,宣称效果对标 600 美元/次的个人品牌顾问服务且免费。流程从头图(headline)一路覆盖到精选帖子(featured posts),每条都给出可直接套用的 prompt。
作者分享了一条让 AI 扮演 LinkedIn 资料审查员的 Prompt:更新资料后,让它逐项审查头像、横幅、标题、About 简介、精选帖子和推荐语,每项打 1-10 分。它还会列出仍会让陌生人困惑的地方,指出最关键的单一改进点,并代写两条当天就能发出的推荐语请求。作者认为这条 Prompt 适合做资料优化的最后检查环节。
victor_explore 建议保留所有失败的 agent 运行记录,把它们当作针对下一代模型的评测集,每次新模型发布就整体重跑一遍。他引用 Anthropic Labs 的案例:Mike Krieger 透露团队曾搁置一个失败的 computer use agent 项目,每次新模型发布都重跑,直到 Claude 3.7 出现后成功率突然过半,项目起死回生。
推荐理由:把跑挂的 agent 任务留存成评测集,提供了一个跨模型版本观察能力跃迁的可复用做法。
多伦多大学经济学家 Kevin Bryan 免费开放 2026 版「Progress: How to Get Big Things Done」课程前三讲全部资料,含带课后笔记的幻灯片与课程大纲。
一位开发者在 Medium 分享其团队构建的运维值班 Agent:它能查询并理解某项服务上次故障时的具体情况,用以辅助事件响应。该系统以 300 起过往事故作为长期记忆,排障时可检索参考,针对值班 Agent 缺乏历史上下文、如同「失忆」的痛点。文章围绕其设计思路与落地过程展开。
一位 Reddit 用户分享角色 LoRA 训练踩坑:此前积累的上百万张孤立角色图被证明不适合训练,正确做法是每套只用少量图,并为角色配上不同场景背景。他基于一手经验判断 AI 分不清 Photoshop 合成的阴影,索性全部不加阴影,结果模型把悬浮当成了角色特征,学到「这个人会悬浮、经常离地面 0.5-3 英寸」。
Reddit 用户用 Opus 5.5 Ultraplan 生成约 4.5 万行代码,约 8 小时做出一支完整音乐 MV。歌词由 Astra 写、音乐用 Suno v6,视频基于 three.js 的 frame-at-t 方式逐帧渲染并混合子帧做运动模糊,压缩前成品 1.2GB。
一位开发者为推广其婴儿踢动计数器 app TenKicks,搭建了 reels 自动生成流水线,弃用所有付费视频模型订阅,改在自租的 RunPod GPU 上运行开源 MiniMax H3,无需 credits、无月费,每条 reel 成本约 $0.50。
作者 yawnxyz 展示了一条 AI 全程生成的 7 分钟 SQLite 讲解视频,内容覆盖项目用途、代码高层结构图、一条查询在代码库中的生命周期、核心抽象,以及一次真实执行的 trace(含 join-order 查询规划)。
推主 @TheMoonMidas 给 Codex 找到了最佳用途——替自己应付家里长辈的各种技术支持需求。他表示这件事以前是他的噩梦,现在直接交给 Codex 解决。
TheTuringPost 分享用 AI 助手 Dot 两小时的体验,称感觉像「把大脑卸载出去」,收件箱历史上首次接近清零。Dot 还能根据对用户的了解生成动画头像,作者得到一只猫头鹰,觉得很贴切。
Condé Nast 用 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频发现方案,将每项内容发现任务耗时从 250 分钟降至不到 2 分钟。方案由 AWS GenAIIC 合作开发,采用 TwelveLabs Marengo 嵌入模型,对超过 140,000 个视频的转录、视觉和音频做意图语义搜索,支持图像查询与精确时间戳。
AWS 博客给出一个合同智能平台的参考架构,用部署在 Amazon Bedrock AgentCore 上的抽取智能体与验证智能体把合同 PDF 转为结构化数据,再通过 Amazon Quick 提供嵌入式仪表盘和自然语言查询。
AWS 详解 Amazon Quick 各组件的提示词工程模式与陷阱,覆盖 Quick Research、Quick Flows 和 Quick Sight。Quick Research 应写清目标、受众和范围并筛选来源;Quick Flows 要明确时间、数据源、输出和交付目标,复杂流程用编号步骤;Quick Sight 查询需包含业务问题、指标、维度和可视化偏好。
Amazon Quick 提示词工程系列的第一部分聚焦适用于各类 Quick 组件的通用原则与可复用框架,核心方法包括用具体性实现清晰、用上下文提升相关性、用示例替代描述,并给出 CRISPE 结构化提示模板。第二部分将分别讲解 Research、Flows、Sight、Chat Agents 与 Action Integrations 的专属技巧。
一位 Reddit 用户分享了自己组织 AI skills 的方法,让每个 skill 独立占一个仓库,分为 skill.md、logs/ 和 memory.md 三部分。
博主 yangyi 用 AI 智能体在北京选房,让智能体开浏览器自动抓取链家房产数据并分析,自己全程只需帮忙点验证码。智能体按要求筛选出流动性好、价格合理的三居小区,整理数据并给出推荐小区和具体房源。yangyi 调侃房产销售若用这类智能体自动扒库找房源会很高效。
创作者 tischeins 启动「Single-Word-Prompt」实验,第一期只用单词 Mellifluous 搭配 --ar 5:4 --v 8.2 参数在 Midjourney 出图。该实验展示极简提示词下模型对抽象词汇的视觉诠释能力,适合研究提示词极简与模型理解边界的玩法。
ChronoGuard 是一款时序泄露审计工具,专抓同一数据泄露换列名后反复出现的问题。它通过特征名归一化与字符串、字符级相似度匹配改名泄露列,例如 chargeback 曾以 cbresolutionflag 混入训练集,改名后再次出现,剔除后 ROC-AUC 从 1.0 回落到 0.826。作者强调记忆只提供线索,判断须依赖时间戳证据。
作者演示客服 AI agent SupportMemory,用 Hindsight 作持久记忆层记住客户历史信息,不再重复索要订单号。无记忆架构是「客户→AI→回复」,有记忆则先召回历史上下文再回复并留存新信息。demo 用 Ananya、Steven、Max 三位虚拟客户验证对话可延续,结论是 AI agent 不只要生成好回答,还要记住正确的上下文。
Bharadhwaj3305 为 AWS 成本优化智能体加入记忆机制,建议采纳率从 71% 提升到 88%。该机制通过记录并学习工程师为什么拒绝某些成本优化建议(hindsight),让智能体不再重复推荐已被否决的方案。文章还给出了记忆增强的设计思路与实测数据,并提到该思路可迁移到其他 agent 场景。
作者用 RTX 5090 配合 ComfyUI 在本地实测 MiniMax H3 生成 30 秒长打斗场景,经数十次控制变量渲染给出配置结论。打斗动作建议用 HyperFlow 8 步且不加 LoRA,放大 pass 加 taomate 3-step LoRA 时武器一致性与运动质量最佳,对话或慢节奏仍用 4 步 turbo。