作者分享让编码 Agent 通宵自动生成音乐视频的提示词流程
neoneye2 在 reddit 分享了一份用编码 Agent 通宵自动生成音乐视频的完整提示词与流程。素材(音频、人声分离、歌词)放在 assets/ 目录,Agent 先从作者的手绘三角形作品提取艺术风格并构建等距三角形网格,参考另一个音乐视频仓库的结构,动手前主动追问歧义点。最后作者用 /goal 指令让 Agent 在自己睡觉时自主完成并持续提交文件。
neoneye2 在 reddit 分享了一份用编码 Agent 通宵自动生成音乐视频的完整提示词与流程。素材(音频、人声分离、歌词)放在 assets/ 目录,Agent 先从作者的手绘三角形作品提取艺术风格并构建等距三角形网格,参考另一个音乐视频仓库的结构,动手前主动追问歧义点。最后作者用 /goal 指令让 Agent 在自己睡觉时自主完成并持续提交文件。
有人用 Claude 把 Anthropic《Functional Emotions》论文内容写成歌曲,再由 Opus 为这首歌制作 MV,成片被形容为「美得令人屏住呼吸」。这次尝试展示了模型跨文本、音乐、视频的完整创作链路。
快手可灵正式发布 Kling 4.0 大版本更新,10 月正式上线,高性价比的 Kling 4.0 Flash 已于 9 月 28 日开放小范围体验。新版本支持 10-bit HDR、30 秒长镜头与最多 15 项参考素材,主打真实、可控、专业。早期体验创作者已用它制作完整音乐视频,唇形同步成为最大亮点,可通过黑帧渲染音轨与静帧合成实现口型对齐。
开发者 @yihuiindie 为产品 CellMotion 制作了一支 Manus 风格宣传片并在 X 上分享,同时回应了 @opc8838 此前的互动。短片带有明显的 AI 生成视频质感,展示了独立开发者用 AI 工具快速产出产品宣传物料的玩法。
博主 FinanceYF5 用一条挑衅式提示词实测 Opus 5.5(开启 Max effort),要求生成一段充满动感的 15 秒动态图形视频。随后他用相同提示词在 Grok 4.7 Fast(xhigh effort)上重跑,形成两家模型动态图形生成能力的直接对比。
博主 FinanceYF5 用同一条提示词对比 Opus 5.5 的 Max effort 与 Grok 4.7 Fast 的 xhigh effort 生成动态图形视频:提示词要求制作一段 15 秒的动感动态图形视频,展示其作为顶级动态设计师的实力。两条视频可对照看两家模型在动态图形生成上的风格与质量差异。
Claude Opus 5.5 发布后,一条提示词直出音乐 MV 的玩法在 X 上走红。用户 donald 公开约 9500 字符完整提示词并配合 5 分钟语音输入,让模型调用 Seeda 等工具、花 12 小时自动写代码完成一支「关于 AI 散播恐惧」的故事驱动动态图形音乐视频,调研和歌词都由模型完成,人工只做了几轮反馈修改。
推荐理由:从中可见一条提示词直出整支 MV 的耗时与成本,也能看到创作者对 AI 生成音乐视频能力边界的评价。
Spellbrush 研究员 KBlueleaf 宣布,其视频生成研究 TT-VidT 被 NeurIPS 接收。该方法在视频预训练中采用时序解耦(temporal-decoupled)思路,从视频中显式提取真实的运动信息,且只需小规模训练即可达到高质量生成效果。合作方包括 NVIDIA 与 Spellbrush。
LudovicCreator 公开了用 Seedance 2.5 生成 20 秒街拍风格伪纪实视频的完整提示词,画面是一只巨型胖猫像通勤者一样骑小型电动踏板车,红灯停车还会路怒。
一位有总监与美术总监经验的独立开发者公开了约 8 个月用 Claude 开发 Unity 动作 Roguelite《Steel Maiden》的 AI 工作流,该游戏已在 Steam 提供免费 Demo。
博主 FinanceYF5 分享一段号称 100% 由 AI 生成的视频,只用一条提示词、全程无剪辑,真实感已难分辨真假,展示 Kling 4.0 在视频生成上的写实能力。类似演示此前由 @minchoi 首发并引发关注。
Kling 4.0 仅凭一条提示词、全程无剪辑生成 100% 由 AI 生成的视频,其真实感被认为已难分辨真假。该演示来自 @minchoi,由博主 FinanceYF5 转引,为同一演示的转发版本。
博主用 Claude Opus 5.5 制作了一支 p(doom) 风格音乐视频,把中国大模型过去几年的发展历程剪成从追赶到贴近前沿的路线。整支视频灵感来自推特上近期爆火的同类作品,以娱乐化方式回顾这段演进轨迹。
HeyGen 与 Google Cloud 把 18B 参数的 Avatar IV 移植到八芯片 Trillium(v6e)主机,提速 1.86×。Avatar IV 是驱动说话头视频的扩散模型栈,以 Web 和 API 提供 720p/1080p、25fps 流式渲染。迁移经 torchax 前端完成,性能接近 8×H100 生产环境,视频成本效率最高提升 25%。
Reddit 上一条 AI 生成视频模拟了《哈利·波特》中的家养小精灵多比获得自由之身后加入 K-pop 男团的形象与场景。该视频属娱乐性质,未包含实质技术信息。
MexHat 是一个面向墨西哥西班牙语视频的仇恨言论检测数据集,包含约 1k 个视频片段,设有三分类(无负面内容、攻击性内容、仇恨言论内容)与含三个仇恨言论子类别的细粒度标注两项评测任务。它针对非英语多模态资源稀缺的问题,旨在捕捉墨西哥西班牙语语境下的语言与文化线索。数据集统计与基线结果均显示该任务本身仍具挑战。
TRACE 是面向流式视频理解的条件感知评测基准与框架,把证据何时有效、视觉历史如何维护、响应如何触发显式纳入评估。它基于 517 段视频的 1,240 条记录,在 8 种配置下评测了 8 个公开模型或系统。近乎相同的 QA 准确率可能掩盖完成度、答案有效性与生成负载差异,主动性能可拆为响应质量、响应延迟、误报与漏检目标窗口。
一位 Reddit 用户分享了一套 retention_analysis 提示词模板,用来解决 AI 生成多角色对话视频时的台词错位和人物形象在各镜头间漂移问题。
一位用户在 Reddit 求助:在 4080 Super + 32GB 内存上尝试的图生视频(I2V)方案全部失败,生成一个 4 秒片段要数小时,或直接 OOM 跑不完。帖子正寻求可行的本地视频生成配置建议。
动画创作者 @AlfredAlfer77 用 AI 影视工具 NoSpoon 搭配 Minimax H3 模型,凭一段单段落 prompt 在 10 分钟、约 20 美元内自动写并拍出一集动画片段。他坦言结果仍有大量错误和 glitch,但几次重roll加轻度剪辑即可成片。他认为 NoSpoon 与 The Slop Cannon 这类 harness 正把 AI 生成电影带向全新阶段。
Google Research 提出 AI video co-director,一个构建在 Gemini 和 Veo 之上的统一多智能体编排框架,用于自动化生成跨镜头连贯的分钟级长视频。
AWS 在官方博客给出基于 Strands Agents SDK 的对话式视频智能方案,由大模型在运行时决定调用 Amazon Bedrock、Amazon Rekognition 还是 Amazon Transcribe,不再为每类问题预建处理流水线。
Google Beam 扩展至美国、加拿大、英国、法国、德国和日本六个国家,并由 18 家渠道合作伙伴支持部署。Google 与 Industrious 合作推出首个 Beam 扩展网络,10 月起可在美国部分 Industrious 地点预约体验。八周内部研究显示,使用 Beam 的 Google 团队连接感提升 50%、后续会议需求下降 21%。
invideo 借助 GPT‑6 Astra 规划剪辑,把色彩校正与调色效率提升至原来的 3 倍。模型让剪辑规划更精准,还使 invideo 在一天内产出 50 个自定义特效。
@therealcornpop 在 TikTok 表示,用 AI 撰写 TikTok 和 YouTube 脚本会一眼被识破。除了 "it's not X, it's Y"、三段式、堆叠标点且破碎断奏式的写法这些 AI 腔调外,关键问题在于内容缺少明确的个人声音,也看不出作者对所谈话题有观点。
Higgsfield AI 借助 GPT-6 Astra,在一天内上线新的视频功能,让小型企业制作视频广告更简单。该公司也因此能更快把新的创意工具推向市场。
Hugging Face 用 Gradio Workflow 把 AUTOMATIC1111(stable-diffusion-webui)的多数功能重建为一个工作流画布 Workflow1111,由 11 条媒体流水线和 73 个节点组成。
推荐理由:读者可以看到把 AUTOMATIC1111 式图像流程拆成节点图后,输出如何自动变成 REST 与 MCP 接口。
在纪录片短片《Love, Rendered》中,Google DeepMind 与 Darren Aronofsky 的 Primordial Soup 合作,用 AI 逐帧重现 Burt 与 Ethelle Shatz 结婚 70 余年却未留下影像的相遇记忆。
Google 汇总 8 月 AI 更新,涵盖 Gemini 3.7 Flash、Gemini 3.5 Transcribe、Pixel 11 系列以及 Gemini app 月活突破 10 亿。
Google DeepMind 面向 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 推出智能体视频理解功能,将视频分析的 token 消耗降低最多 88%、成本降低最多 66%,准确率提升最多 7%。
推荐理由:原文给出 token 消耗、成本与准确率的对比数据,可用于判断长视频分析的成本结构变化。
Google DeepMind 发布 Gemini Omni 1.1 Flash,为开发者带来场景扩展、首尾帧插值、360p 快速草稿和最高 4K 放大等生成式视频能力,已通过 Gemini API 在 Google AI Studio 上线。
推荐理由:相较于此前只参考最后一秒,Omni 1.1 把场景扩展的前序上下文提高到 10 秒,便于评估长视频工作流的可行性。
NVIDIA 发布 Cosmos-H-Dreams,一款面向手术机器人的实时、动作条件生成式模拟器,把 Cosmos-H-Surgical-Simulator 蒸馏为因果少步学生模型。
Google DeepMind 与 A24 宣布达成首个研究型合作,双方将建立长期研发协作,让 A24 及其电影人把 Google DeepMind 的技术创新直接嵌入创作流程,帮助艺术家开发新工作流与技术。Google 同时宣布对 A24 进行投资。该合作初期聚焦于连接前沿技术与下一代娱乐,具体目标、技术产出和创意里程碑将随时间演进。
Google DeepMind 推出图像模型 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)与视频生成及对话式编辑模型 Gemini Omni Flash(gemini-omni-flash-preview)。
推荐理由:两款模型同步开放开发者接口并公布延迟与价格数据,便于比较图像与视频生成方案的成本取舍。
Google DeepMind 发布 Gemini Omni 系列首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本输入生成视频,并用自然语言多轮对话编辑视频。
推荐理由:原文给出了新模型的多模态输入与对话式视频编辑能力,读者可据此判断它在现有视频生成工作流中的位置。