跳到正文

#视频

今日 31 条
今天9月30日周三
  1. AGI Hunt40

    Claude Opus 5.5 三条提示词做出动态设计,动画工作室停招相关岗位

    Claude Opus 5.5 仅用 3 次提示词便生成一段被认为达到可用水平的动态设计视频,该视频近日引发热议。有动画工作室和设计从业者因此表示团队不再招聘动态设计师,财经自媒体 FinanceYF5 转发视频时也直言「不再招动态设计师了」。AI 生成能力对动态设计岗位的冲击由此引发行业讨论。

  2. AGI Hunt38

    Niantic Spatial 演示:用高保真高斯泼溅几小时做出实景短片

    Niantic Spatial 的 asimahmed 用 astra 工具在伦敦 Leake Street Arches 实拍场景的高保真高斯泼溅中,仅用几个小时制作了一段短片。该演示把真实空间重建为可编辑、可生成的数字资产,创作者可直接在重建场景中拍摄合成影像。这是 Niantic Spatial“让物理世界对机器可计算”方向的一次直观展示。

  3. AGI Hunt48

    Dolphin AI 发布:主打多镜头一致性的 agentic 视频制作工作室

    Dolphin AI 以邀请码方式开启 Early Access,推出主打多镜头一致性的 agentic 视频制作工作室,覆盖长视频、广告、短剧、社交 Reels 等场景。写一次场景即可生成最多 10 个镜头,角色面孔、光线、街景等跨镜头保持一致。测试阶段已用该工具制作超 4.5 万条视频,据称广告 CTR/CTI 有提升。

  4. arXiv cs.AI42

    MemEvo:自动发现流式视频记忆机制

    MemEvo 提出一个 LLM 驱动的自动研究框架,将流式视频记忆设计转化为对可执行记忆程序的搜索,并产出免训练、有界内存机制。它用轻量 DSL 表达表示、准入、保留、整合、预算和检索等原语,在运行时以确定性评估流程验证候选,底层视觉语言模型全程冻结。在 StreamingBench 和 OVO-Bench 上,该方法展现出强流式视频理解性能,并显著提升上下文与推理效率。

  5. arXiv cs.CV35

    FastVR:基于一步扩散的高效流式视频修复

    FastVR 是一个基于一步扩散模型的流式视频修复框架,可在单张 H20 GPU 上以 11 FPS 处理 1080p 视频。它结合轻量 VAE 与分块因果注意力降低推理成本,并用速度一致性正则化和连续轨迹学习提升修复质量。实验显示 FastVR 比所评估的扩散基线更高效,并在合成与真实世界 benchmark 上达到 SOTA。

  6. arXiv cs.CV32

    ReWorld-Track:面向语言引导多摄像头跟踪的递归事件世界模型

    ReWorld-Track 面向语言引导多摄像头跟踪提出递归事件世界模型,将关联不确定性带入未来预测,用来推断下一摄像头与到达时间。该模型在 CityFlowV2 取得 65.19 HOTA、MTMMC 取得 45.36 HOTA。在 MTMMC 上其结构化后验更新较同规模通用更新器高 0.50 HOTA,下一摄像头准确率从 86.03% 升至 87.41%。

  7. arXiv cs.CV36

    超越二元偏好:GM-DPO 与 FlexBench 用于肢体动作描述的分级偏好优化

    提出 FlexBench 基准与 GM-DPO 分级偏好优化方法,用于改善 VLM 肢体动作描述的细粒度准确性。在三个 VLM backbone 上,GM-DPO 的 GPA 分数较 DPO 提升 2.02-3.40 分,Qwen3-8B 上加权幻觉率降低 21.3%。FlexBench 含 3,105 个镜头、18,161 条评测查询,方法同时保持长文本输出并改善镜头结构。

  8. arXiv cs.CV43

    VidScribe:统一视频生成中视觉文本渲染与原位编辑的基准评测

    VidScribe 是统一视频文本基准,覆盖 T2V、R2V、I2V、V2V 四种生成范式,含 803 个人工核验样本与 11 项共享指标。对 11 个商业与开源系统的评测显示,内容识别与笔画级字形正确性解耦,I2V 最能稳定保持文本,V2V 原位编辑是主要瓶颈。退化集中在少数文本结构与时序因素,而非恶劣成像条件。

  9. arXiv cs.AI33

    CoRe:协同演化奖励模型,缓解视频扩散模型的隐空间奖励黑客问题

    CoRe 用协同演化奖励框架缓解视频扩散模型的 latent reward hacking:生成器数百步更新后即脱离奖励模型训练分布,奖励虚高而画面与运动质量下滑。CoRe 持续在生成器当前样本上重拟合奖励模型,并以真实视频偏好锚定。在 Wan2.1-T2V-1.3B 上,其生成质量优于预训练模型和既有对齐方法。

  10. arXiv cs.CV38

    事件边界处的预见:评估视频世界模型的物理预测能力

    基于 62 段受控真实自由落体录像、124 个片段的评测显示,视频世界模型在事件结果被隐去时未必能预测接下来会发生什么。Runway 与 Veo 生成释放和后续撞击事件的比率超过 93%,但常明显滞后;Cosmos-Predict-2.5 与 MAGI-1 则多保持事件前状态,几乎产不出可测结果。在可测下落中,时间上合理不等于运动物理一致;15 人人类研究显示人类预测总体上更贴近真实未来。

  11. arXiv cs.CV34

    Reimagine Video Dynamics(RVD):解耦可编辑动态 token 的视频动态编辑框架

    Reimagine Video Dynamics(RVD)框架从视觉上下文中解耦出紧凑、可编辑的动态 token,并通过自监督重建学习该 token。其语言引导的动态 token 编辑器可将源动态转换为目标动态,训练使用可扩展的反事实视频对管线和两阶段策略。实验显示 RVD 支持视频动态编辑、免训练 retiming 和外观受控重渲染。

  12. arXiv cs.CV40

    RA-CFGCache:从分支级判据到 Classifier-Free Guidance 下的引导风险控制

    RA-CFGCache 是面向扩散模型的 CFG 风险对齐免训练缓存框架,用引导风险组合与传播感知重缩放控制条件与无条件两个分支的缓存误差。它在 FLUX.1-dev、Wan2.1-T2V-1.3B 和 CogVideoX-2B 上改善了效率与保真度的权衡,兼容 TeaCache、DiCache、MagCache 类代理估算器,延迟几乎不变,代码已公开。

  13. arXiv cs.CV36

    PACC:通过 on-policy 蒸馏学习紧凑记忆,用于长视频生成

    PACC 用可学习压缩器把历史帧聚合为紧凑 memory tokens,通过 on-policy 蒸馏训练:冻结的视频生成器在压缩记忆下当学生、在完整历史下当教师,仅更新压缩器。在 MBench 上它超过最强基线,Causal-rCM 高 6.63 分、Causal Forcing 高 3.19 分;用 MovieGen 提示词在 VBench-Long 上可生成分钟级长视频,质量与基线相当。

  14. AGI Hunt25

    等生成间隙弹吉他,AI 视频团队用 LumaLabsAI 在 DreamLabLA 拍出人机即兴合奏短片

    创作者 @mrjonfinger 团队用 LumaLabsAI 在 DreamLabLA 拍出人机即兴合奏短片。同伴 Tony Houart 趁等待视频生成间隙弹吉他,作者架起摄像机即兴合奏,团队随后用 AI 重新生成/演绎这些演奏场景。短片把等待生成的碎片时间变成创作素材,展示 AI 视频工具在音乐表演类内容上的玩法。

9月29日周二
  1. AGI Hunt39

    一句 prompt 生成音乐 MV:Opus 5.5 + Runway MCP 一次成型

    开发者 tlakomy 仅用一次生成,就让 Opus 5.5 通过 Runway MCP 直接产出一支名为《Words into Worlds》的音乐视频,他表示对效果非常震撼。这套组合由模型负责编排与创作指令、Runway 负责视频生成,用户无需手动剪辑即可得到成片,展示了 coding agent 通过 MCP 协议驱动媒体生成工具的潜力。