Claude Opus 5.5 三条提示词做出动态设计,动画工作室停招相关岗位
Claude Opus 5.5 仅用 3 次提示词便生成一段被认为达到可用水平的动态设计视频,该视频近日引发热议。有动画工作室和设计从业者因此表示团队不再招聘动态设计师,财经自媒体 FinanceYF5 转发视频时也直言「不再招动态设计师了」。AI 生成能力对动态设计岗位的冲击由此引发行业讨论。
Claude Opus 5.5 仅用 3 次提示词便生成一段被认为达到可用水平的动态设计视频,该视频近日引发热议。有动画工作室和设计从业者因此表示团队不再招聘动态设计师,财经自媒体 FinanceYF5 转发视频时也直言「不再招动态设计师了」。AI 生成能力对动态设计岗位的冲击由此引发行业讨论。
哲学家 Anders Sandberg 评价一条 AI 讽刺视频时称,它更像有趣的嘲讽而非扎实的论证,并认为下一个挑战是做出能在三分钟娱乐性里承载扎实论证的视频。他自嘲已用 Suno 给自己的论文写过歌,看来下一步也得去做视频了。
一位开发 AI 视频工作室的开发者分享了底层 MCP server 的实践思路:把剪切片段、添加特效、对生成视频二次加工等真正的剪辑能力交给 LLM,用自然语言下指令,而不是让模型反复「生成-碰运气」。
Lib TV AI 短片黑客松 48 小时创作作品展演在小红书科技园举行,现场观众认为相当一部分参赛作品的情节画面已分不清是 AI 生成还是实拍,逼近实拍质感。主要短板在声音,尤其情感表达不足,而配音可大幅提升作品完成度。
ComfyUI v0.38.0 发布,新增 Ming Image 0.1 6B 文生图模型、MiniMax-H3 Fun ControlNet Union 2.0 与基于 Wan 2.1 和 VACE 的 ID-V2V 身份保持视频转视频支持。
推荐理由:版本清单列出新增模型节点与量化、HDR 支持,可据此判断现有 ComfyUI 工作流是否要调整。
独立开发者 Acrobatic-Example315 为 H3 工作流发布小工具 IAMCCS Prompter H3,可用自然语言描述意图,由 Ollama 或其他 LLM 转译为结构化的 H3 提示词。
X 大 V GeFei 的匿名 AI 视频项目「AI Video Maker By GeFei」被 TrustMRR 收录并验证收入:MRR 179 美元/月、近 30 天收入 899 美元、6 个活跃订阅。
Niantic Spatial 的 asimahmed 用 astra 工具在伦敦 Leake Street Arches 实拍场景的高保真高斯泼溅中,仅用几个小时制作了一段短片。该演示把真实空间重建为可编辑、可生成的数字资产,创作者可直接在重建场景中拍摄合成影像。这是 Niantic Spatial“让物理世界对机器可计算”方向的一次直观展示。
Dolphin AI 以邀请码方式开启 Early Access,推出主打多镜头一致性的 agentic 视频制作工作室,覆盖长视频、广告、短剧、社交 Reels 等场景。写一次场景即可生成最多 10 个镜头,角色面孔、光线、街景等跨镜头保持一致。测试阶段已用该工具制作超 4.5 万条视频,据称广告 CTR/CTI 有提升。
WorldLine 是动作驱动的视觉模拟器,用 1 万多小时无动作标注机器人视频学操作动力学,在 RoboTwin 与 AgiBot 上以 74% 平均准确率预测轨迹成败。
MemEvo 提出一个 LLM 驱动的自动研究框架,将流式视频记忆设计转化为对可执行记忆程序的搜索,并产出免训练、有界内存机制。它用轻量 DSL 表达表示、准入、保留、整合、预算和检索等原语,在运行时以确定性评估流程验证候选,底层视觉语言模型全程冻结。在 StreamingBench 和 OVO-Bench 上,该方法展现出强流式视频理解性能,并显著提升上下文与推理效率。
FastVR 是一个基于一步扩散模型的流式视频修复框架,可在单张 H20 GPU 上以 11 FPS 处理 1080p 视频。它结合轻量 VAE 与分块因果注意力降低推理成本,并用速度一致性正则化和连续轨迹学习提升修复质量。实验显示 FastVR 比所评估的扩散基线更高效,并在合成与真实世界 benchmark 上达到 SOTA。
ReWorld-Track 面向语言引导多摄像头跟踪提出递归事件世界模型,将关联不确定性带入未来预测,用来推断下一摄像头与到达时间。该模型在 CityFlowV2 取得 65.19 HOTA、MTMMC 取得 45.36 HOTA。在 MTMMC 上其结构化后验更新较同规模通用更新器高 0.50 HOTA,下一摄像头准确率从 86.03% 升至 87.41%。
提出 FlexBench 基准与 GM-DPO 分级偏好优化方法,用于改善 VLM 肢体动作描述的细粒度准确性。在三个 VLM backbone 上,GM-DPO 的 GPA 分数较 DPO 提升 2.02-3.40 分,Qwen3-8B 上加权幻觉率降低 21.3%。FlexBench 含 3,105 个镜头、18,161 条评测查询,方法同时保持长文本输出并改善镜头结构。
2x2x2 Rubik's Cube 受控基准测试显示,视频生成模型的隐藏状态推理能力并不随规模单向提升:70M 参数模型在约 0.1 PF-days 下对动作后帧可见贴纸配置预测正确率 44.6%,而 1B 模型仅 0.3%,后者需训练到 3.14 PF-days 才达到 83.7%。
VidScribe 是统一视频文本基准,覆盖 T2V、R2V、I2V、V2V 四种生成范式,含 803 个人工核验样本与 11 项共享指标。对 11 个商业与开源系统的评测显示,内容识别与笔画级字形正确性解耦,I2V 最能稳定保持文本,V2V 原位编辑是主要瓶颈。退化集中在少数文本结构与时序因素,而非恶劣成像条件。
CoRe 用协同演化奖励框架缓解视频扩散模型的 latent reward hacking:生成器数百步更新后即脱离奖励模型训练分布,奖励虚高而画面与运动质量下滑。CoRe 持续在生成器当前样本上重拟合奖励模型,并以真实视频偏好锚定。在 Wan2.1-T2V-1.3B 上,其生成质量优于预训练模型和既有对齐方法。
基于 62 段受控真实自由落体录像、124 个片段的评测显示,视频世界模型在事件结果被隐去时未必能预测接下来会发生什么。Runway 与 Veo 生成释放和后续撞击事件的比率超过 93%,但常明显滞后;Cosmos-Predict-2.5 与 MAGI-1 则多保持事件前状态,几乎产不出可测结果。在可测下落中,时间上合理不等于运动物理一致;15 人人类研究显示人类预测总体上更贴近真实未来。
Reimagine Video Dynamics(RVD)框架从视觉上下文中解耦出紧凑、可编辑的动态 token,并通过自监督重建学习该 token。其语言引导的动态 token 编辑器可将源动态转换为目标动态,训练使用可扩展的反事实视频对管线和两阶段策略。实验显示 RVD 支持视频动态编辑、免训练 retiming 和外观受控重渲染。
RA-CFGCache 是面向扩散模型的 CFG 风险对齐免训练缓存框架,用引导风险组合与传播感知重缩放控制条件与无条件两个分支的缓存误差。它在 FLUX.1-dev、Wan2.1-T2V-1.3B 和 CogVideoX-2B 上改善了效率与保真度的权衡,兼容 TeaCache、DiCache、MagCache 类代理估算器,延迟几乎不变,代码已公开。
PACC 用可学习压缩器把历史帧聚合为紧凑 memory tokens,通过 on-policy 蒸馏训练:冻结的视频生成器在压缩记忆下当学生、在完整历史下当教师,仅更新压缩器。在 MBench 上它超过最强基线,Causal-rCM 高 6.63 分、Causal Forcing 高 3.19 分;用 MovieGen 提示词在 VBench-Long 上可生成分钟级长视频,质量与基线相当。
自监督框架 SABLE(Sparse-view Animal Behavior Latent Embeddings)以几何归纳偏置和多视角 Transformer,从极稀疏视角重建 3D 动物行为并学习显式 3D 潜结构。
PreviewDiff 是一种无需训练的测试时搜索方法,把扩散采样从标量搜索变为对中间潜变量的多模态 critic 引导搜索。它在选定的去噪检查点解码部分预览,由多模态 judge 打分并给出自然语言反馈,据此对语义提示词编辑和局部重新加噪的潜变量分支做评分与选择性续跑。
Sol 6 智能体在 @VoidNulled 的演示中,于全程无任何提示词干预下独立完成一支短片,视频和配乐均由自己生成。这类“放出去让它自己折腾”的 demo 展示了智能体自主创作能力的边界,并在 X 上引发转发关注。
创作者 @mrjonfinger 团队用 LumaLabsAI 在 DreamLabLA 拍出人机即兴合奏短片。同伴 Tony Houart 趁等待视频生成间隙弹吉他,作者架起摄像机即兴合奏,团队随后用 AI 重新生成/演绎这些演奏场景。短片把等待生成的碎片时间变成创作素材,展示 AI 视频工具在音乐表演类内容上的玩法。
Reddit 用户 himeonisama 用 AI 制作了科幻短片《Erebus-9: The Hiveborn Archives》,帖子附带了视频链接。该片带有完整的世界观设定,属于个人 AI 视频创作展示,可供关注 AI 视频生成工作流与创作水准的读者参考。
开发者 GeFei 公布其 AI 视频生成站经 TrustMRR 用 Stripe API 验证的收入数据:近 30 天收入 $829、MRR $90、3 个付费订阅。该产品是面向内容创作、娱乐与社媒市场的 B2C AI 视频制作工具。TrustMRR 是通过 Stripe API key 验证初创公司收入的公开数据库。
开发者 GeFei 的 AI 视频站首日进账 221 美元,17 笔订单的付费用户全部来自 ChatGPT 渠道。首日 600 独立访客、1400 页面访问、255 注册用户,收入经 TrustMRR 通过 Stripe 数据验证。ChatGPT 渠道 282 个访客注册率 61%、付费率 6.4%,目前累计总收入 829 美元、MRR 90 美元。
视频博主 EHuanglu 用 Claude Opus 5.5 生成了一段想象《戴珍珠耳环的少女》被创作那一刻的视频,画面被认为真实而动人,获得包括 justin_hart 在内的多人转发称赞。
Reddit 用户用 Opus 5.5 Ultraplan 生成约 4.5 万行代码,约 8 小时做出一支完整音乐 MV。歌词由 Astra 写、音乐用 Suno v6,视频基于 three.js 的 frame-at-t 方式逐帧渲染并混合子帧做运动模糊,压缩前成品 1.2GB。
一位开发者为推广其婴儿踢动计数器 app TenKicks,搭建了 reels 自动生成流水线,弃用所有付费视频模型订阅,改在自租的 RunPod GPU 上运行开源 MiniMax H3,无需 credits、无月费,每条 reel 成本约 $0.50。
Lightricks 在 Hugging Face 开源了针对 LTX 2.5(22b)的两款 LoRA,分别面向视频放大与老素材修复。Refine 用于把 HD 画面推到 8K,在贴近原始内容的前提下补出 8K 应有的细节;Restore 可把 540p 片段升到 4K,增强色彩并带来干净锐利的现代数码摄影机质感。
作者用 RTX 5090 配合 ComfyUI 在本地实测 MiniMax H3 生成 30 秒长打斗场景,经数十次控制变量渲染给出配置结论。打斗动作建议用 HyperFlow 8 步且不加 LoRA,放大 pass 加 taomate 3-step LoRA 时武器一致性与运动质量最佳,对话或慢节奏仍用 4 步 turbo。
Reddit 用户 dreww93 分享了一段 AI 生成的手指滑板「世界杯」视频,配文「真希望有这比赛」,视频中动作与场景高度逼真,评论区反响热烈。该视频展示了 AI 生成视频在小众趣味题材上的表现力。
经济学家 Paul Samuelson 1979 年在《Journal of Banking & Finance》发文反对投资中使用凯利准则,为讽刺该准则,全文故意只用单音节英文单词写作,唯一允许的例外是最后一个词「syllable」。推特用户 Ronald Lagnado 近日发现文中其实还藏着另一个多音节单词,并向读者发起挑战。
开发者发布开源视频编辑智能体 Open Edit,能把视频(包括 Opus 5.5 生成的视频)转换成可在浏览器中编辑的项目,实现「生成即可编辑」。作者称其攻克了视频到可编辑工程转换的关键环节,项目已开源并附有 GitHub 地址。
Reddit 上一段照片级写实视频引发热议,一名年轻美国男子在视频中自称「帅到不可能是机器人」,网友在评论区争论他是否为 AI 生成的数字人。视频逼真到肉眼难辨,再次展示当前视频生成与数字人技术的以假乱真程度。
charis_ai 用 AI 生成一段浣熊败光家财、最后流落到垃圾桶后的搞笑视频,却发现剧情意外成了 AI 创作者本人处境的纪录片式隐喻,引发共鸣。同批 AI 资讯还包括 Claude Opus 一发命中复刻红白机经典游戏 Excitebike 等。
Reddit 用户 arctvofficial 用 Seedance 2 生成中式玄幻短片《全球觉醒:我能召唤华夏诸神》,展示了中国神话召唤题材的 AI 视频创作效果。同批资讯中,还有人用 Seedance 2.5 以单条提示词生成霍比特人村庄版自拍 vlog。
开发者 tlakomy 仅用一次生成,就让 Opus 5.5 通过 Runway MCP 直接产出一支名为《Words into Worlds》的音乐视频,他表示对效果非常震撼。这套组合由模型负责编排与创作指令、Runway 负责视频生成,用户无需手动剪辑即可得到成片,展示了 coding agent 通过 MCP 协议驱动媒体生成工具的潜力。