音视频联合与跨模态生成及编辑:统一形式化与设计分类法综述
一篇音视频生成与编辑综述提出统一形式化框架,把联合生成、跨模态生成与联合编辑定义为同一音视频对分布上的三类问题,并沿五个设计维度建立方法分类。作者称这是首个系统梳理联合音视频编辑的综述,将其映射为 9 个编辑类别、覆盖 28 种编辑类型,同时整理了各场景的方法、数据集与指标。文章最后给出其认为最关键的开放问题。
一篇音视频生成与编辑综述提出统一形式化框架,把联合生成、跨模态生成与联合编辑定义为同一音视频对分布上的三类问题,并沿五个设计维度建立方法分类。作者称这是首个系统梳理联合音视频编辑的综述,将其映射为 9 个编辑类别、覆盖 28 种编辑类型,同时整理了各场景的方法、数据集与指标。文章最后给出其认为最关键的开放问题。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,把近实时视频生成与语音结合,为实时对话模型加入能听、能看、能说的可视化形象,现已在 Gemini Enterprise 提供。
Google 与设计师 Jane Wade、Sergio Hudson 合作,用 Google Flow 为纽约时装周定制了 Styling Suite 和 Runway Visualization 两款工具。
OpenRouter 发布视频生成 API 代码指南,介绍通过 POST /api/v1/videos 提交任务、轮询状态并下载 MP4 的完整流程。同一套端点、鉴权和轮询逻辑适用于 Seedance 2.0、Veo 3.1 和 Wan 2.7,切换模型只需修改 model 字段。