我先说这次让我停下的问题。我以前写视频预算表,总习惯把一个模型当成一个固定价。可打开 imgmov 当前配置一看,Kling 这里不是那么回事。现在能选到的是 Kling v3 Omni,价格按秒走,无声是每秒 39 积分,开原生音频是每秒 49 积分。
这行数字一出来,我的旧表格就废了。五秒无声短片是 195 积分,五秒带音频是 245 积分。音频也不是结账时加一点点,而是每秒多 10 积分。
所以这篇文章不讲玄学,只讲我现在会怎么做。Kling v3 Omni 很适合短而完整的瞬间,但没想清楚的故事板扔给它,只会把混乱变得更贵。
我先核对型号和价格
在 imgmov 的模型列表 里,Kling 对应的当前型号是 Kling v3 Omni。它支持文字生成视频,也支持图片生成视频。可以用参考图,也可以设置尾帧。比例有 16:9、9:16、1:1,默认是 9:16。
| 项目 | 我会确认什么 |
|---|---|
| 型号 | Kling v3 Omni |
| 生成方式 | 文生视频、图生视频 |
| 参考图 | 支持 |
| 尾帧 | 支持 |
| 原生音频 | 支持,可选 |
| 画面比例 | 16:9、9:16、1:1 |
| 默认比例 | 9:16 |
| 无声价格 | 每秒 39 积分 |
| 音频价格 | 每秒 49 积分 |
这些数字枯燥,但能防止我用旧印象做决定。
我的第一步是先定时长
Kling v3 Omni 更适合做短片段。我一般围绕 5 秒或 10 秒来规划。三镜头场景硬塞进 5 秒,问题不在模型,而在提示词已经变形了。
我的粗糙标准是这样。一个主体、一个动作、一个镜头想法和一个场景,放进 5 秒。要有情绪转折、场景切换或者明显的 before-and-after,就考虑 10 秒。再复杂就拆成多条短片,后面在剪辑器里接起来。
按秒计价在这里反而是好事。它逼我先问,第 2 秒到底发生了什么?如果我自己说不出来,模型更说不出来。
第二步,先决定要不要音频
音频是预算变化最大的地方。Kling v3 Omni 能生成同步音效和环境声,适合一条短视频直接完整发出。但我现在不会默认开音频。
无声是每秒 39 积分,有声是每秒 49 积分。10 秒音频短片要 490 积分,无声版本是 390 积分。多出来的 100 积分,只有声音本身参与叙事时才值得花。
厨房里的低频环境声、雨水落在包装上的声音、杯子轻碰桌面的声音,能让画面立刻落地。可如果后面剪辑加一版音乐就能解决,我就先不开音频。别让「想要完整」变成「没有想清楚也要付钱」。
第三步,选最强的输入方式
如果画面不依赖具体商品,我直接用文字生成视频。如果商品、材质、人物、房间或者构图必须保持一致,我就用图片生成视频。做商品短视频时,参考图通常是更好的起点,因为我不希望杯柄换了边、颜色变了、包装形状飘了。
imgmov 也有专门的 图生视频 页面。当核心需求就是让一张图动起来时,我会按这个路径走,而不是指望视频提示词从零发明一个商品身份。
第四步,比例要在写提示词前定好
抖音、小红书、TikTok、Reels、Shorts,我用 9:16。YouTube、网页头部、课件画面,我用 16:9。只有位置真是方形,我才用 1:1。
生成后裁切不是无害操作。它可能切掉主体的运动路径,破坏构图,或者让边缘动作消失。既然这三种比例都支持,我宁愿先想清楚它最终在哪里播。
| 投放位置 | 比例 |
|---|---|
| 抖音、小红书、TikTok、Reels、Shorts | 9:16 |
| YouTube、网页头部、课件画面 | 16:9 |
| 信息流方块位 | 1:1 |
第五步,写运动,不要写海报
我以前最容易在这里犯错。提示词写得很漂亮,结果写的是一张静帧海报。视频需要时间变化。现在提交前我会问,从第 1 秒到第 5 秒,画面里到底发生了什么?
我会把提示词压成四层。
- 主体,只保留真正影响识别的细节。
- 运动,说明什么在动、动得多快。
- 镜头,推进、拉远、横移、环绕,还是锁定。
- 光线和情绪,写短一点。
商品风格可以像这样。
One ceramic mug on wet slate, steam drifting slowly, camera pushes in about ten percent, shallow depth of field, soft window light, quiet morning mood
想做循环时,我会让尾帧接近起始构图。
One glass bottle on pale linen, slow rotating reflection, camera locked, light moves gently across the label, seamless loop toward the starting composition
开音频时,声音也要克制。
Soft kitchen ambience, low quiet hum, gentle contact sound as the cup is placed down, no music, no voice
我不会让它一口气完成一串精确动作,也不会指望它排版长文案。复杂文案、包装文字和界面文字,放到后续设计或剪辑里处理。
尾帧什么时候值得用
尾帧不是装饰。做无缝循环时,我会让结束位置回到起始构图。做转场时,我会让尾帧给下一条短片留一个自然入口。做商品展示时,我会想,观众暂停时看到的那一帧,能不能单独代表这条视频?不过不是每条都要尾帧,如果我要的是松弛的自然运动,我就不用。
生成前我会做这轮检查
按下生成前,我会过一遍这几项。
- 型号确认是 Kling v3 Omni,不是旧笔记里的固定价 Kling v3。
- 时长按 5 秒或 10 秒规划,提示词能装进这个时间跨度。
- 音频是主动决定,不是顺手打开,因为每秒 39 和 49 是两条预算路线。
- 比例匹配真实投放平台,不是生成后再碰运气裁切。
- 图生视频时,商品或身份需要一致就给参考图。
- 提示词写的是时间和运动,不是只写一张海报。
- 尾帧有明确作用才设置。
- 积分预算在生成前写下来。
最后一条最朴素,也最容易救我。
我会这样算积分
下面这些是按当前每秒价格直接算出来的,不是测试成绩。
| 短片计划 | 时长 | 音频 | 积分 |
|---|---|---|---|
| 视觉概念验证 | 5 秒 | 无 | 195 |
| 短社交完整瞬间 | 5 秒 | 有 | 245 |
| 较长的视觉叙事段 | 10 秒 | 无 | 390 |
| 较长的有声完整场景 | 10 秒 | 有 | 490 |
如果想先压低风险,我会用 imgmov 的 Agnes 访客试用模型。它每天最多三次预览,有水印,1K,一次一个结果,也不适合商用交付。它解决的是这个视觉想法值不值得继续花积分。
确认想法后,我再看 价格页,决定最终用 Agnes Video V2、Kling v3 Omni,还是其他高级视频模型。对商品图变短视频这件事,Kling v3 Omni 的价值在于把锁定的商品瞬间推进到更完整的观看体验。
什么时候我会先停一下
我不会把 Kling v3 Omni 当成剪辑的替代品。它产出的是一个高质量短片段,不是完整课程或广告片。需要多个镜头时,我会一条一条生成,保持风格一致,再在剪辑器里组织节奏。
遇到多主体复杂调度,我也会先拆动作。一个片段只负责一个想法,比把所有戏压进 5 秒更可靠。如果需要精确的屏幕文字、包装可读性或者严格品牌版式,先把视觉运动做好,再让设计层接管该精确的部分。
Kling v3 Omni 最好的使用方式,是带着一个窄的瞬间和算清的预算进去。这时它像生产工具。要是带着一个还没拆完的故事板进去,它只会更快告诉你,问题不在模型。