跳转到主要内容
Beehive
导航
Home 前沿动态 最后修订:2026.07.30 · 8 min

Google Veo 3.1:视频生成开始考虑声音了

Google DeepMind 于 2025 年 10 月 16 日发布 Veo 3.1,主打原生音画同步与角色一致性。本文梳理其公开能力与行业位置。

前沿动态

2025 年 10 月 16 日,Google DeepMind 发布 Veo 3.1。

这不是 AI 视频生成赛道的早期产品。到 2025 年底,OpenAI Sora 已经走过两年,Seedance 2.0 在多镜头叙事上做了很深的工作,Wan2.7-VideoLongCat 也在国产阵营里各走各的路。Veo 3.1 进入的不是蓝海,而是红海。

它的定位

Veo 3.1 的核心方向不是"更长",而是"更完整"。它重点做了两件事:音画原生同步角色跨镜头一致性

视频生成领域长期有一个痛点:模型输出的视频大多没有声音。创作者生成画面后,还要用 Suno V5.5 等音频工具单独做配乐或音效,再手动对齐。Veo 3.1 的解法是把音频生成放进同一个推理过程里,让环境音、动作音效和画面一起出来。

另一个重点是一致性。AI 视频最容易翻车的是角色在连续镜头里变形——同一个人,第五秒和第十五秒看起来不像同一个人。Veo 3.1 强调在模型层面维护跨镜头的角色表征,减少这种漂移。

Google 还提到一个仍在内测的能力:2026 年 Q1 将开放 1080P@60fps 的实时渲染。注意,是内测,不是已交付。"实时"在当前算力成本下,短期内更可能面向企业级 API 用户,而不是普通创作者。

公开能力梳理

目前可以确认的几个事实:

  • 原生音画同步,声音随画面动作生成
  • 角色与场景跨镜头一致性
  • 1080P@60fps 实时渲染内测(2026 Q1)
  • 绑定 Google Vertex AI 与 Gemini 生态
  • 主要面向 API 和企业级场景

这些能力里,音画同步是最有差异化的。过去视频模型和音频模型是分开的,创作者要手动拼起来;Veo 3.1 把它们合成一步。这个改变不一定让质量更高,但确实减少了后期工作量。

行业位置

国际第一梯队目前形成四方格局:

  • Veo 3.1:音画原生同步、Google 生态
  • Sora 2:OpenAI,写实与物理模拟
  • Runway Gen-4.5:创作者可控编辑
  • Pika 2.0:风格化、消费级创作

四家已经有明显分化,不再是同质化竞争。选型变成"谁更匹配你的场景",而不是"谁分数更高"。

国产阵营里,Seedance 2.0 也在做音画联合生成,并且强调多语种口型同步。Veo 3.1 的出现意味着"音画同步"这个点正在从差异化能力变成基础能力。国产模型下一轮的身位,可能要在口型工业化、多镜头叙事、中文语境理解这些更细的维度上找。

需要保持谨慎的地方

Veo 3.1 的公开信息里有几个地方值得审慎看待。

实时渲染仍是承诺。 1080P@60fps 实时渲染听起来很有吸引力,但它目前处于内测阶段,覆盖范围、成本、可用性都不明确。把它当作已交付能力来讨论会误导判断。

生态绑定较深。 Veo 3.1 深度集成在 Google Cloud、Vertex AI、Gemini 生态里。对已经在这套体系里的团队是便利,但对多云架构或想私有化部署的团队是门槛。

"电影感"是审美判断。 Google 在宣传中用了"电影级画质"这样的描述,但这类说法很难用单一指标衡量。行业需要更客观的视听一致性基准,比如音画对齐误差、角色 ID 保持率、镜头切换平滑度,而不是只看 demo 视频。

写在最后

Veo 3.1 最重要的信号是:视频生成的竞争开始从"画面"扩展到"视听一体"

当所有头部模型都能生成清晰画面时,"有没有对得上的声音"就成了新的分水岭。这个变化对国产模型既是压力也是机会:压力在于独家卖点被追平,机会在于倒逼大家往更细分的方向深耕。

视频生成的终点不是某一项参数最高,而是讲述完整故事的能力。Veo 3.1 补上了"声音"这一块拼图——这也说明,真正难的从来不是单帧画好,而是让画面、声音、镜头切换彼此对齐。

Beehive · 蜂巢

ORIGINAL

采用 CC BY 4.0 许可协议 · 转载请注明出处

前沿动态
文章链接已复制到剪贴板