Google Veo 3.1 实测记录,我把什么时候该用它想清楚了

一份 Google Veo 3.1 第一手使用记录,覆盖提示词结构、镜头语言、时长和积分成本、原生音频选择,以及哪些项目值得用 Veo。

Published: 2026-07-13 - By imgmov Team

我第一次认真测 Veo 3.1,不是为了写参数表,而是想弄清一个问题。它到底适合什么项目?答案很清楚。它适合已经想清楚的画面,不适合用来替你做决定。

Veo 3.1 的画面质感、光影层次和镜头语言都很强,但积分也不便宜。所以我不再拿它当第一个草稿工具。我先确认构图,再让它去做高质量呈现。这个顺序让它的能力真正用在对的地方。

我先看的几件事实

在 imgmov 的模型列表里,Veo 3.1 支持 text-to-video 和 image-to-video。它有 16:9、9:16、1:1 三种比例,默认是 9:16。定价按时长走,4 秒 80 积分,6 秒 125 积分,8 秒 165 积分。

这些数字不是 trivia。它们直接决定了我的测试方式。如果我还不知道画面里该发生什么,我不会先花 80 积分。我会先用免费 Agnes 模型或低积分图片模型确认构图,然后再交给 Veo。

我的提示词结构

我最后固定下来的是这五段。

主体、动作、镜头、环境、风格和时间。

举个例子。

A paper boat crosses a rain puddle, low camera close to the water, city street after rain, soft sunlight breaks through clouds, shallow depth of field

这里不要写 beautiful cinematic video 这种空词。Veo 能理解具体的镜头和光线。low camera 告诉它视角,after rain 告诉它地面材质,sunlight breaks through clouds 告诉它光源变化。这些具体词比堆形容词有用。

image-to-video 的用法

如果主体必须保持一致,我会用图片作为参考。产品、人物、宠物、老照片都属于这一类。我会写清楚哪些东西不能变,比如发型、表情、产品颜色、标签位置。

Veo 很擅长让一个静态画面呼吸起来,但它不应该被允许重新设计主体。我一般会加 keep the subject unchanged,然后把变化限制在光线、轻微动作和镜头上。

时长不是越长越好

4 秒适合一个瞬间。6 秒适合一个动作完成。8 秒适合轻微的场景展开。如果故事需要多个镜头,我会分开生成,而不是把所有剧情塞进一个 prompt。

我犯过的错误就是让一个 8 秒 clip 同时完成场景转换、人物反应和产品露出。结果每一件事都只做到一半。分开生成后,剪辑反而更稳。

原生音频要不要开

如果声音本身就是创意的一部分,值得测。比如环境声、脚步、水声,或者镜头和声音有明确配合。但如果我还在验证画面,我会先不开音频。

音频会让判断变复杂。你可能会因为声音不错而原谅画面问题,或者因为声音不对而重新生成一个本来可以用的画面。所以我通常先锁定视觉,再考虑声音。

我遇到过的问题

第一个问题是镜头太复杂。我说了推近、环绕、跟随,结果主体稳定性下降。后来我改成只留一个镜头动作。第二个问题是手和文字。手部细节要逐帧看,文字最好放在剪辑层。第三个问题是把 cinematic 当成万能词。换成 shallow depth of fieldgolden hour backlighthandheld camera 后,画面反而更准。

我现在的判断标准

如果项目只是社媒草稿,我不会用 Veo 3.1。如果要给客户看高质量概念片、品牌短片、关键广告镜头,或者需要把一张已经确认的图片变成有电影感的动态画面,它值得。

我的省钱流程是这样。先写一句话 brief。再用免费模型测构图。然后用 Seedream 或 Nano-Banana 确认关键帧。最后才用 Veo 生成 4 秒或 6 秒正式版。4 秒能说清,就不用 8 秒。

适合谁用

适合广告创意、品牌内容、短剧情、视觉概念验证,以及已经知道想要什么的创作者。不太适合完全没想清楚就随便抽卡的场景,也不适合把所有早期试错都交给高级模型。

Veo 3.1 的价值不是「能生成视频」,而是能把一个已经成立的画面推到更高完成度。你要先给它一个成立的想法。

相关阅读

想试 Veo 3.1?打开 imgmov 视频生成 →

Back to blog | Pricing | Start creating