我不是从流量理论开始,而是从一个坏习惯开始。我总是生成一条漂亮 clip,看一眼,觉得不对,然后换提示词。问题不在模型,而在我没有钩子、没有平台决定,也没有比较版本的方法。后来我把它改成社媒生产日志。
现在我可以从一个想法到几条 9:16 测试视频,不会把积分浪费在随机美感上。
先定平台,再写 prompt
我第一件事是写下视频投到哪里。TikTok 和 Reels 更吃第一秒。Shorts 可以稍微多给一点说明。网站 hero 可以慢一点,但那不是社媒视频。
9:16 从一开始就按竖屏构图。主体居中,动作放在中段,字幕留安全区。16:9 硬裁成竖屏,通常不是主体丢失,就是文字尴尬。
第一秒先写出来
我会先写第一帧,再写完整 prompt。观众不会等你铺垫。我的钩子分三类。视觉意外、问题场景、结果前置。
然后只写一个动作。不是三个,不是转场。一个不需要声音也能懂的动作。
A red sneaker lands on wet pavement, water splashes around the sole, slow-motion push-in, urban evening light, vibrant commercial style
这条能跑,因为第一帧能识别,动作简单。想讲故事,就做两段再剪。
我的模型阶梯
先用免费 Agnes Video V2 检查构图。构图有希望,再用 Seedream 5.0 Lite 或 Nano-Banana 2 确认关键帧。运动要有能量,用 Seedance 2.5。镜头要稳,用 Kling v3 Omni。高完成度电影感,才用 Veo 3.1。
这个阶梯改变我的成本。我不再用贵模型发现「取景错了」。
做变体,不是复制
每条钩子至少两个版本。一个近景,一个稍远。一个改光,一个改运动速度。不要同时改主体、场景、镜头、色调。否则数据再好也不知道为什么。
社媒里,最有效的变化往往最简单。轻微推近通常比疯狂环绕更自然。
避免「一眼 AI」
我不再单独写 cinematic。我会写光源、地点、材质、镜头。比如 soft window light、wet asphalt、slight handheld camera。真实小瑕疵反而有帮助。
然后逐帧检查手指、文字、logo、液体、布料。有人手就看手指。有文字就放剪辑层。液体奇怪就降低运动。
静音可懂
很多观众没开声音。所以画面动作要自解释。字幕放承诺,模型放视觉证据,音乐后配。
字幕不要压关键动作,也不要贴边。如果需要对白,先锁定视觉,再考虑原生音频或配音。
我的测试循环
一次做三条。A 是视觉意外,B 是问题钩子,C 是结果前置。长度 4 到 8 秒。比较前三秒,不只看总播放。立刻划走是钩子失败。停留但不互动,可能是信息或 CTA 问题。
这才是 AI 视频对社媒的价值。不是更多噪音,而是更快测试不同想法。
我会重复的清单
先 9:16。写第一帧。一个动作。免费模型测构图。关键帧确认后再升级。一次改一个变量。字幕后加。检查手指和文字。保存赢家 prompt。
这样社媒团队才能从一条幸运 clip 变成一套系统。
相关阅读
想做下一条短视频?试试 imgmov AI 视频 →