文生视频实操记录,我怎么把一句话变成能用的镜头

一份第一手文生视频教程,覆盖一句话 brief、五段式提示词、镜头语言、比例选择、模型升级顺序和常见失败修正。

Published: 2026-07-18 - By imgmov Team

我以前用文生视频像抽奖。输入一个想法,点生成,然后希望出现电影感。问题是,希望不是工作流。后来我把过程拆开,才明白文生视频适合的是你已经想清楚的画面,不是帮你决定要讲什么。

现在我的顺序很固定。先写一句话 brief,再定时长,再拆动作,最后才生成。这个方法不保证每次满分,但至少每次失败都知道该改哪里。

一句话 brief 是起点

我会先用中文或英文写一句很朴素的话。比如 纸船穿过雨后水坑,阳光从云里出来。这里有主体、动作和环境变化。如果这一句都写不出来,说明想法还没准备好。

接着决定时长。3 到 5 秒适合一个动作,6 到 8 秒可以容纳轻微展开。更长的故事不要塞进一个 prompt,我会拆成几个镜头再剪。

五段式提示词

我用这个结构。

主体,动作,镜头,环境,风格或时间。

例如。

A paper boat crosses a rain puddle, low camera close to the water, city street after rain, soft sunlight breaks through clouds, shallow depth of field

这句里有具体镜头 low camera,有环境 after rain,有光源变化,有浅景深。它比 beautiful cinematic shot 更可执行。

一个 clip 只做一个动作

这是我反复踩坑后的硬规则。一个 5 秒视频很难同时完成人物进场、发现物品、反应、离开。它通常只能做好一件事。

所以我把故事拆成镜头。第一个镜头拍环境,第二个镜头拍动作,第三个镜头拍反应。剪辑里看是完整场景,但每个 prompt 只负责一件事。

镜头语言要具体

我不再只写 cinematic。我会写 static cameraslow push-inslow panlow tracking shothandheld camera。这些词各自对应不同的观看感受。

静镜头让主体承担注意力。缓慢推近增加亲密感。跟拍适合运动。轻微手持适合社媒真实感。我还会写什么不能动,比如 static backgroundcamera holds while steam moves

光线、地点和材质要写清

high quality 不是信息。overcast morninggolden hour backlightwet stonelinen curtaindust in sunbeam 才是信息。模型对具体材质和光线的理解比抽象形容词好很多。

我现在的做法是把每条提示词里的形容词砍掉一半,然后换成具体场景词。画面通常会更容易控制。

先便宜测,再升级

我不会一上来就用高级模型。先用免费 Agnes Video V2 或低成本模型测构图。这一步只回答一个问题,画面想法是否成立。构图对了,再升级。

需要表达力强,我会看 Seedance 2.5。需要稳定商业镜头,我会用 Kling v3 Omni。需要更高电影感,才用 Veo 3.1。模型不是越贵越好,而是要匹配风险。

比例按投放位置定

9:16 给 TikTok、Reels、Shorts。16:9 给网站 hero 或 YouTube。1:1 给 feed 或市场页。最好在生成时就选对比例,不要指望后期裁切解决所有构图。

竖屏我会把主体放中间,动作放在中下部,给字幕留空间。横屏可以让环境多一点呼吸。这个决定很小,但能省掉很多重做。

我的失败检查顺序

输出不对时,我按这个顺序查。动作是不是超过一个。主体描述是不是太模糊。有没有让模型生成文字。镜头是不是太复杂。时长是不是不够。提示词里有没有互相矛盾的指令,比如既说 static 又说 dynamic camera。

然后只改一个变量再生成。主体漂移就加强描述,或者换 image-to-video。运动混乱就减少动作。画面空就加一个具体环境细节。

什么时候该换图生视频

文生视频适合发明场景、氛围镜头、视觉概念。但如果你要真实产品、特定人物、宠物或老照片,就不要只靠文字。图片是身份锚点,文生视频是自由想象。两者不要混用。

产品视频我会先做一张确认过的静帧,再用 image-to-video 加动作。老照片也会先修复,再用温和动作让它动起来。

可复用模板

氛围镜头。

[Subject] [single action], [camera], [place and time], [material detail], [mood]

人物时刻。

A person with [short visual description] [one subtle action], [camera], [light], natural skin texture, [mood]

产品类物体。

[Object] remains centered and unchanged while [one subtle motion], [camera], [environment], commercial lighting

这些模板不是咒语。它们逼你填入决定,而不是把判断丢给模型。

我现在的流程

写一句 brief。选时长。把故事拆成一动作镜头。写具体镜头和光。便宜模型测构图。构图成立再升级。看第一秒、主体、背景。保存赢家提示词。

这样文生视频才从玩具变成工具。

相关阅读

想试文生视频?打开 imgmov AI 视频 →

Back to blog | Pricing | Start creating