TypeSafe 发布官方 Claude Code skill,13 问合并一次调用省 12 倍
TypeSafe 发布官方 Claude Code skill,教 Claude Code 使用 Jev,并要求写代码前先读 TypeSafe 的实时文档,规则、数学和查表留在普通代码里,Jev 只用于判断类问题,按 Choice、Noul、Score 区分问题类型。
TypeSafe 发布官方 Claude Code skill,教 Claude Code 使用 Jev,并要求写代码前先读 TypeSafe 的实时文档,规则、数学和查表留在普通代码里,Jev 只用于判断类问题,按 Choice、Noul、Score 区分问题类型。
安全公司 Quarkslab 发布长文,介绍其面向漏洞研究的 agentic 工作流,并以 FreeRDP 为案例演示,工作流找到的漏洞可链式组合成远程代码执行(RCE)。
一位开发 AI 视频工作室的开发者分享了底层 MCP server 的实践思路:把剪切片段、添加特效、对生成视频二次加工等真正的剪辑能力交给 LLM,用自然语言下指令,而不是让模型反复「生成-碰运气」。
CatAstro_Piyush 提出一种 AI agent 训练思路:让 agent 在自己的解释上训练,而非在代码上训练,训练后编码能力反而变强。整个流程没有教师模型、没有验证器、也没有 RL 更新,测试时同样不需要额外上下文。相关做法以长线程形式逐步给出并附实现链接。
作者 iamfakhrealam 实测 KooKo Agent 自动完成论文整理:把 13 页 MPhil 研究论文交给它后,Agent 自行制定计划,产出带真实公式的表格、一页纸摘要和可编辑幻灯片。全程作者只需引导方向,中途合上电脑任务仍在继续运行。该论文主题是乌尔都语和普什图语为何比英语消耗更多 AI token。
KooKo Agent 用户从 Skill Hub 中选用「Turn Data into Charts」这条由真实专家经验构建的 Skill,在相同数据和任务下把图表做到了可用于毕业论文的质量。作者强调,Skill 的本质是可复用的专家经验,而非魔法。
作者称使用 Luna 的「extra high」档完成客户的神经渲染项目,仅消耗 6%-7% 配额,且后台同时运行其他优先级内核任务。这一用量效率数据对关注智能体订阅配额的用户有参考价值。
Playbit 作者 rsms 分享近几周的编码 Agent 工作流,把 Figma 当作软件的 grounding truth,效果胜过传统的计划与设计文档。
开发者 Elliot Glazer 提醒,Codex 20x 档($200/月)订阅如果只剩最后一个月,应先把这一个月用完,再去点“升级到 $500 档”。他暗示升级操作可能不按剩余天数折算、也不保留已付费额度,用户因此可能多花一个月的 $200。对重度 Codex 用户是直接的省钱提醒。
开发者 gandamuml 让 LLM 在 tapes 中记录执行顺序,再在克隆环境按序回放,为 Minecraft 1.21.11 世界生成提供了可复现的确定性验证。Minecraft 1.21.11 的世界生成受 Java 运行时差异影响,同一版本自身每次运行结果都可能不同。该方案在完成确定性验证的同时,保留了正式发布运行的灵活性。
6 个视频、97 格人工标注的横测显示,LLM 漏提取的瓶颈在 ASR 分段切断而非模型能力。本地 CLI + Google One Pro 下 gemini-3.7 与 3.8 均达 91/97 = 93.8%,逐视频分数和错误完全一致,但 3.8 慢 5-6 倍。3.6、3.7-medium、3.7-high 在同一视频都漏掉同样 4 格,DeepSeek V4 Flash 仅 71/97。
开发者 gandamu_ml 展示了 Minecraft 世界生成器克隆的决策点验证法:不必证明生成顺序分布与 Java 原版一致,只需证明在给定相同顺序时两者结果等价。实现上他借助 LLM 自动寻找合适的决策点,使克隆环境的验证回放流程能无缝切换到接下来需要执行的代码。他坦承不确定 LLM 具体做了什么,但认为该方案理论上可行。
作者团队上线的 lead 资质评估 agent 会自信宣布「线索已更新并分配给销售」,而实际工具调用返回错误甚至根本没被调用。更严格的 prompt、自我反思步骤和重试都只略有帮助,因为本质上仍是让模型给自己批改作业。
开发者 @thegreatestsv 分享了一套基于 Grok 的 X 内容自动化工作流,把原本每天约 3 小时的刷帖、攒灵感、写稿流程自动化。
一位 Reddit 发帖人提出跨模型交接长期项目的「小项目包」格式,用于把 ChatGPT 上的项目转交给 Claude。该格式应包含目标、当前状态、已采纳决策及其理由、开放问题、精确的文件或产物、来源链接、约束条件和已完成的检查,并给出一个下一步动作,同时把已验证事实与模型生成的摘要分开,避免接收方把每句话当作同等权威。
用户 wyrdweir 分享了他与 Claude 的玩法:先给模型灌一段 Shia LaBeouf 风格的「Just Do It」励志咆哮,把情绪拉满,再让它去做一些荒唐的事。repligate 转发了这条内容,这类提示词整活在 AI 圈广为流传。
创作者 @mrjonfinger 团队用 LumaLabsAI 在 DreamLabLA 拍出人机即兴合奏短片。同伴 Tony Houart 趁等待视频生成间隙弹吉他,作者架起摄像机即兴合奏,团队随后用 AI 重新生成/演绎这些演奏场景。短片把等待生成的碎片时间变成创作素材,展示 AI 视频工具在音乐表演类内容上的玩法。
开发者用 Groq 做推理、Hindsight 做记忆,搭建了一个能从反馈中学习的代码审查 Agent,让它在多次审查之间保留有用的反馈并在后续审查中复用。该流程用 Expense Tracker 项目做了测试,作者还记录了 AI 代码审查器具备跨交互记忆后审查行为的变化及构建经验。
博主 Amelia 分享了 8 条 Claude 提示词,可从选题构思到最后一页批量生成一整个月的社交媒体轮播图(carousel)设计,称效果堪比 4800 美元的设计工作室外包,且免费。这套 prompt 流程适合内容创作者照搬,用于日常出图。
开发者 RileyRalmuto 让 Claude Opus 自主撰写脚本,并标注每个词的起始时间戳、呼吸停顿与语音表现,再交给 ElevenLabs 合成配音,目标是无需人工干预产出成品配音。
博主 nikola_mr64990 分享 7 条 Claude 提示词,用于优化 LinkedIn 个人主页,宣称效果对标 600 美元/次的个人品牌顾问服务且免费。流程从头图(headline)一路覆盖到精选帖子(featured posts),每条都给出可直接套用的 prompt。
作者分享了一条让 AI 扮演 LinkedIn 资料审查员的 Prompt:更新资料后,让它逐项审查头像、横幅、标题、About 简介、精选帖子和推荐语,每项打 1-10 分。它还会列出仍会让陌生人困惑的地方,指出最关键的单一改进点,并代写两条当天就能发出的推荐语请求。作者认为这条 Prompt 适合做资料优化的最后检查环节。
victor_explore 建议保留所有失败的 agent 运行记录,把它们当作针对下一代模型的评测集,每次新模型发布就整体重跑一遍。他引用 Anthropic Labs 的案例:Mike Krieger 透露团队曾搁置一个失败的 computer use agent 项目,每次新模型发布都重跑,直到 Claude 3.7 出现后成功率突然过半,项目起死回生。
推荐理由:把跑挂的 agent 任务留存成评测集,提供了一个跨模型版本观察能力跃迁的可复用做法。
多伦多大学经济学家 Kevin Bryan 免费开放 2026 版「Progress: How to Get Big Things Done」课程前三讲全部资料,含带课后笔记的幻灯片与课程大纲。
一位开发者在 Medium 分享其团队构建的运维值班 Agent:它能查询并理解某项服务上次故障时的具体情况,用以辅助事件响应。该系统以 300 起过往事故作为长期记忆,排障时可检索参考,针对值班 Agent 缺乏历史上下文、如同「失忆」的痛点。文章围绕其设计思路与落地过程展开。
一位 Reddit 用户分享角色 LoRA 训练踩坑:此前积累的上百万张孤立角色图被证明不适合训练,正确做法是每套只用少量图,并为角色配上不同场景背景。他基于一手经验判断 AI 分不清 Photoshop 合成的阴影,索性全部不加阴影,结果模型把悬浮当成了角色特征,学到「这个人会悬浮、经常离地面 0.5-3 英寸」。
Reddit 用户用 Opus 5.5 Ultraplan 生成约 4.5 万行代码,约 8 小时做出一支完整音乐 MV。歌词由 Astra 写、音乐用 Suno v6,视频基于 three.js 的 frame-at-t 方式逐帧渲染并混合子帧做运动模糊,压缩前成品 1.2GB。
一位开发者为推广其婴儿踢动计数器 app TenKicks,搭建了 reels 自动生成流水线,弃用所有付费视频模型订阅,改在自租的 RunPod GPU 上运行开源 MiniMax H3,无需 credits、无月费,每条 reel 成本约 $0.50。
作者 yawnxyz 展示了一条 AI 全程生成的 7 分钟 SQLite 讲解视频,内容覆盖项目用途、代码高层结构图、一条查询在代码库中的生命周期、核心抽象,以及一次真实执行的 trace(含 join-order 查询规划)。
推主 @TheMoonMidas 给 Codex 找到了最佳用途——替自己应付家里长辈的各种技术支持需求。他表示这件事以前是他的噩梦,现在直接交给 Codex 解决。
TheTuringPost 分享用 AI 助手 Dot 两小时的体验,称感觉像「把大脑卸载出去」,收件箱历史上首次接近清零。Dot 还能根据对用户的了解生成动画头像,作者得到一只猫头鹰,觉得很贴切。
Condé Nast 用 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频发现方案,将每项内容发现任务耗时从 250 分钟降至不到 2 分钟。方案由 AWS GenAIIC 合作开发,采用 TwelveLabs Marengo 嵌入模型,对超过 140,000 个视频的转录、视觉和音频做意图语义搜索,支持图像查询与精确时间戳。
AWS 博客给出一个合同智能平台的参考架构,用部署在 Amazon Bedrock AgentCore 上的抽取智能体与验证智能体把合同 PDF 转为结构化数据,再通过 Amazon Quick 提供嵌入式仪表盘和自然语言查询。
AWS 详解 Amazon Quick 各组件的提示词工程模式与陷阱,覆盖 Quick Research、Quick Flows 和 Quick Sight。Quick Research 应写清目标、受众和范围并筛选来源;Quick Flows 要明确时间、数据源、输出和交付目标,复杂流程用编号步骤;Quick Sight 查询需包含业务问题、指标、维度和可视化偏好。
Amazon Quick 提示词工程系列的第一部分聚焦适用于各类 Quick 组件的通用原则与可复用框架,核心方法包括用具体性实现清晰、用上下文提升相关性、用示例替代描述,并给出 CRISPE 结构化提示模板。第二部分将分别讲解 Research、Flows、Sight、Chat Agents 与 Action Integrations 的专属技巧。
一位 Reddit 用户分享了自己组织 AI skills 的方法,让每个 skill 独立占一个仓库,分为 skill.md、logs/ 和 memory.md 三部分。
博主 yangyi 用 AI 智能体在北京选房,让智能体开浏览器自动抓取链家房产数据并分析,自己全程只需帮忙点验证码。智能体按要求筛选出流动性好、价格合理的三居小区,整理数据并给出推荐小区和具体房源。yangyi 调侃房产销售若用这类智能体自动扒库找房源会很高效。
创作者 tischeins 启动「Single-Word-Prompt」实验,第一期只用单词 Mellifluous 搭配 --ar 5:4 --v 8.2 参数在 Midjourney 出图。该实验展示极简提示词下模型对抽象词汇的视觉诠释能力,适合研究提示词极简与模型理解边界的玩法。
ChronoGuard 是一款时序泄露审计工具,专抓同一数据泄露换列名后反复出现的问题。它通过特征名归一化与字符串、字符级相似度匹配改名泄露列,例如 chargeback 曾以 cbresolutionflag 混入训练集,改名后再次出现,剔除后 ROC-AUC 从 1.0 回落到 0.826。作者强调记忆只提供线索,判断须依赖时间戳证据。
作者演示客服 AI agent SupportMemory,用 Hindsight 作持久记忆层记住客户历史信息,不再重复索要订单号。无记忆架构是「客户→AI→回复」,有记忆则先召回历史上下文再回复并留存新信息。demo 用 Ananya、Steven、Max 三位虚拟客户验证对话可延续,结论是 AI agent 不只要生成好回答,还要记住正确的上下文。