我最早做 AI 社媒视频的方式很蠢。生成一条,看一眼,觉得不够好,再换提示词。看起来很努力,其实每次都在换变量,根本不知道问题出在钩子、构图还是动作。
后来我把它改成一条流水线。先定平台,再定第一秒,再写一个动作,最后才生成。这个流程不神秘,但能让我少浪费很多积分。
先决定平台,再写提示词
TikTok、Reels、Shorts 都偏竖屏,但节奏略有差别。TikTok 和 Reels 更吃第一秒,Shorts 可以稍微多留一点说明空间。所以我会先写清楚这条视频要投到哪里。
9:16 不要靠后期裁切。我一开始就选竖屏比例,把主体放中间,把动作放在画面中下部,给字幕留出安全区。16:9 的横屏素材硬裁成竖屏,经常不是主体被切,就是字幕很尴尬。
第一秒比结尾重要
我现在的习惯是先写第一帧。观众不会等你铺垫完。第一秒必须让人知道发生了什么。
我会从三种钩子里选一个。视觉意外、问题场景、结果前置。比如湿滑路面上落下一只鞋,水花溅起,这个画面第一秒就能懂。又或者先展示整理好的桌面,再倒放回混乱状态,这也是结果前置。
一个动作就够
AI 视频最怕剧本太大。5 秒里塞进人物进场、发现产品、惊讶、转场,几乎一定会乱。我现在只让一个 clip 完成一个动作。
举个例子。
A red sneaker lands on wet pavement, water splashes around the sole, slow-motion push-in, urban evening light, vibrant commercial style
这条提示词只有一件事,鞋落地,水花溅起。镜头是缓慢推近,环境是夜晚城市,风格通过具体光线表达。它比 cinematic viral video 有用得多。
我怎么选模型
先用免费 Agnes Video V2 测构图。它不需要完美,只要告诉我第一帧和动作是否成立。构图过关后,再用更强的模型。
需要图片先确认视觉,我会用 Seedream 5.0 Lite 或 Nano-Banana 2。需要表达力强的运动,我会试 Seedance 2.5。需要更稳的商业镜头,我会用 Kling v3 Omni。需要更高电影感,才考虑 Veo 3.1。
这个阶梯的重点是省钱。不要用高级模型去发现「构图错了」这种便宜问题。
一次只改一个变量
每条钩子我至少做两个变体。一个近景,一个稍远。一个静音看画面,一个配字幕。一个慢速推近,一个轻微手持感。我不会同时改主体、场景、镜头和色调。
这样测试才有意义。如果四个东西都变了,就算数据好,你也不知道是哪个动作起作用。
避免「一眼 AI」
我不再只写 cinematic。我会写光源、地点、材质和镜头。比如 soft window light、wet asphalt、matte ceramic、slight handheld camera。这些具体词会让画面更像真实拍摄。
同时我会检查几类 AI 破绽。手指、文字、商标、液体、布料。如果有手,我会逐帧看。如果有文字,我基本都放到剪辑层。如果液体飘得太奇怪,我会降低动作幅度。
静音也要看得懂
很多观众刷到视频时没开声音。所以我会把承诺放在字幕里,把视觉证据交给模型,音乐后配。不要指望语音把故事讲完。
字幕不要压住关键动作。我会把它放在安全区,避免被平台 UI 挡住。生成的视频本身负责让人停下来,文字负责说明为什么值得继续看。
我的测试循环
一次做三条,不要做一条。A 是视觉意外,B 是问题钩子,C 是结果前置。长度控制在 4 到 8 秒。然后比较前三秒留存,而不只是总播放量。
如果大家立刻划走,是钩子失败。如果留下来但不互动,可能是信息或行动点不清楚。这样归因,下一次才有改进。
我会重复的清单
先选 9:16。写第一帧。一个动作一个镜头。免费模型测构图。关键帧确认后再升级。一次只改一个变量。字幕后加。检查手指、文字、液体。保存表现最好的提示词。
AI 视频做社媒,不是量产噪音。是让你能更快测试不同想法。
相关阅读
想做下一条短视频?试试 imgmov AI 视频 →