【会员文章】复刻爆款视频教程+提示词

引子
现在对于视频生成很简单的视频,你表述一段话,AI就可以生成相应的视频,但是AI还不能完全说100%生成我们需要的视频。甚至个性和更好的视频。下面的教程就是带着小白怎么复刻爆款视频,或者给你一个反推的教程,来完成高质量的视频产出,把全部的提示词包括里面。

一、AI 视频模型与平台介绍

1. 常见模型与基础概念

模型是"生成能力"的提供方,比如:Seedance 2.5、 Minimax H3

平台是"使用模型的地方",比如:小云雀、即梦、flova

1.1 文生图、文生视频、图生视频三者的区别是什么呢?

生成方式
输入
输出
典型用途
上手难度
文生图
一段文字描述
单张图片
定妆照、分镜图、海报素材
文生视频
文字描述(可含镜头与运镜)
一段视频
从零构思剧情、场景演示
图生视频
一张或多张参考图 + 提示词
一段视频
让已确定的角色、场景动起来,一致性最好

1.2 文生视频和图生视频该怎么选择呢?

只有画面想法,用文生视频;已经有想保留的画面,用图生视频。

文生视频
图生视频
适合什么时候
从零探索场景、风格和镜头
已确定人物、产品或场景的外观
你提供什么
用文字描述画面和变化
参考图+希望发生的动作
主要优势
创作空间大,适合快速试想法
起始画面更可控,便于延续视觉风格
主要难点
人物长相、服装、产品细节可能偏离预期
动作幅度大时仍可能变形,参考图也会限制构图

比如:

想做“一只猫在月球上开咖啡馆”,还没想好猫和店铺长什么样 → 文生视频,先探索效果。
已有角色定妆照,希望她转头、微笑、走路 → 图生视频,更容易保持角色外观。
已有保温杯产品图,希望镜头绕杯身移动 → 图生视频,但 Logo、文字和结构仍需检查。
只需要一段雨夜街景、云海或科幻城市素材,没有必须一致的主体 → 文生视频。

做连续剧情时,也可以组合使用:先生成并选定角色和分镜图片,再用图生视频让各个镜头动起来。

2. 主流视频模型怎么选?大概需要花多少钱?

现在视频模型有很多,大家可以根据自己手里的预算,还有想要制作的视频类型进行选择。
如果你做一些产品的广告,MiniMax H3 的性价比是最高的。

如果你要做一些比较复杂或者是质感很高的短片,大部分人还是会选择Seedance 2.5模型。

下面这 7 款模型,可以作为入门时的候选。表里的场景是选择方向,不代表某种视频只能用某款模型。

模型
什么情况下可以先试它
可灵 2.5 Turbo
已经有一张人物图或产品图,想做动作、运镜,先生成几个镜头看看效果。
MiniMax H3
做产品展示、广告,手上有图片、视频等参考素材,希望模型结合这些素材生成画面。
Wan 3.0
想生成一段相对完整的介绍或故事。它支持最长 30 秒输出,也支持根据文档等资料生成视频。
可灵 3.0 系列
做带人物对白、多镜头切换的短剧情。选择时注意具体版本,以及是否开启声音。
Seedance 2.5
画面里有多个人物、多个场景,或者需要参考动作视频、白模视频来控制内容;也适合需要继续修改已有片段的任务。
Veo 3.1
想把画面、对白和环境声一起生成,例如街头对话、生活场景、带声音的故事片段。
Gen-4.5
想尝试广告镜头、氛围画面和不同的运镜效果,尤其是已经在使用 Runway 做视频的人。

价格怎么看?先分清你在哪里买。

同一个模型,在官方网页、聚合平台和 API 上的价格可能不同。网页端通常收会员费、扣积分;API 是通过接口调用模型,按实际用量收费。如果你用的是 LibTV、TapNow 等聚合平台,就看这个平台生成前显示的积分,不能直接套用下面的 API 价格。

下面以累计生成约 30 秒视频素材为例,帮助你建立预算概念。金额是生成费用,不是完成一条视频的全部费用。

模型与使用渠道
约 30 秒素材的费用
需要知道的条件
MiniMax H3/阿里云百炼 API
768P 约
15 元
;2K 约
24 元
只算输出的基础费用。上传参考视频也会计费;每次输入图片超过 5 张,超出部分另收费。
Wan 3.0/阿里云百炼北京区 API
480P 约
9 元
;720P 约
18 元
;1080P 约
36 元
按成功生成的视频秒数收费,这里使用的是官方原价。
可灵 2.5 Turbo/国际站
按发布时的 1080P 计费标准,30 秒合计
150 积分
发布时为每 5 秒 25 积分。人民币成本取决于你购买积分的价格,当前扣分以生成页面为准。
可灵 3.0 系列/国际站
根据版本、分辨率和声音设置,在生成页面查看扣分
不适合统一写成“30 秒多少钱”。原生声音、不同生成模式等都会影响费用。
Seedance 2.5/火山引擎 API
按调用规格与计费量计算,以控制台报价为准
不同渠道的价格不能混用;生成前先查看当前规格的报价。
Veo 3.1/Google Flow
免费用户每天有 50 积分
。非 Ultra 用户生成 4 条 8 秒视频:Lite
40 积分
、Fast
80 积分
、Quality
400 积分
实际生成的是 32 秒,再剪成 30 秒。免费积分未用完不结转,高峰期可能暂时无法生成视频。
Gen-4.5/Runway
API 约
3.60 美元
;Standard 月付会员按积分用满折算,约
8.64 美元
会员实际支付的是每月 15 美元,含 625 积分;30 秒消耗 360 积分。API 和网页会员是两套计费方式。

以上价格核对于 2026 年 9 月 22 日,具体以购买和生成页面为准。

如果暂时不想付费,可以先试 Google Flow。 不开通付费会员,也能获得每天 50 积分。如果全部用来生成 Veo 3.1 视频,可以这样算:

模式
每条消耗
50 免费积分能生成多少
Lite
10 积分
5 条,每条可选 4、6 或 8 秒
Fast
20 积分
2 条,剩余 10 积分
Quality
100 积分
当天免费额度不够生成 1 条

这些积分适合拿来练习提示词、试试画面效果。当天没用完的积分不会累积到第二天,高峰期也可能需要等待。注意扣费按生成的视频条数计算,一次操作如果生成两条,就会扣两条的积分。

还有一笔钱,很容易在刚开始时漏算:重做的费用。

比如,某个镜头生成一次花 6 元,你做了三次才选到满意的版本,这个镜头实际就花了 18 元。参考图、配音、剪辑等费用,还要另外考虑。

所以,刚开始不用急着买年费,也不用一次生成整条片子。先做一个短镜头,看看效果、等候时间和实际扣费。确认能用,再继续往下做,预算会更好掌握。

3. 聚合平台对比

这些平台都有不同的优势,大家可以根据功能做出自己的判断。

不过,用 AI 生成视频的逻辑都是通用的,只要你会用一个平台,后面的平台也就都会用了。

大家可以根据自己的喜好来选择:

• 如果喜欢画布,就选画布类的平台
• 如果更喜欢对话驱动,可以选对话驱动类的平台
• 另外也有一些平台既带对话又带画布

平台
平台类型
核心特色
适合人群
LibTV
聚合平台
多模型整合,提供无限画布、剧本生成、角色造型、智能剪辑和 Agent;支持 Blender 白模视频接入。
AI 短片、漫剧、产品广告创作者;需要统一管理角色、分镜与素材的人。
TapNow
聚合平台
通过画布连接文字、图片、视频和音频,搭建可复用的创作流程;支持克隆社区共享画布。
设计师、广告创意、电商视觉团队;喜欢自己搭流程、复用工作流的人。
Flova
聚合平台
对话驱动的成片 Agent,结合分镜、素材管理和剪辑时间线;支持手动调整与 Skills 复用。
有故事或成片需求,希望通过对话推进制作的个人创作者、短片和 MV 制作者。
Higgsfield
聚合平台(兼有自有创作技术)
集成多个视频模型,强调运镜预设、动作参考和 Cinema Studio 等镜头设计工具。
产品广告、时尚视觉、音乐短片创作者;重视运镜和视觉效果的人。
可灵 AI/Kling
模型厂商官方平台(快手)
提供文生视频、图生视频、动作参考与角色控制;可让参考角色跟随视频中的动作表演。
人物表演、舞蹈、角色短片创作者;对人物动作有明确要求的人。
即梦 AI
模型厂商官方平台(字节跳动)
中文创作,整合图像与视频生成;支持首尾帧控制,以及局部重绘、扩图等画布功能。
中文创作新手、自媒体运营、内容设计师;希望先生成图片再制作视频的人。
海螺 AI/Hailuo
模型厂商官方平台(MiniMax)
MiniMax 视频模型的官方入口;支持多种参考素材、原生声音视频生成及编辑,具体取决于所选模型。
希望直接使用 MiniMax 模型的创作者;产品展示、广告和创意视频制作者。
Google Flow
模型厂商官方平台(Google)
围绕 Google 模型整合图像、视频与声音创作,提供参考素材生成、视频延长、编辑和场景组织。
叙事短片、场景镜头、带声音视频素材的创作者。
Runway
模型厂商官方平台(Runway)
结合生成、编辑、表演相关工具和自定义工作流,支持角色、分镜、广告等多步骤制作。
有剪辑、设计或影视基础的创作者;需要将 AI 接入现有制作流程的团队。

按平台主要定位分类;官方平台也可能接入第三方模型,聚合平台也可能拥有自有模型或技术。适合人群是根据功能作出的判断。

二、视频生成步骤与工作流

选好工具以后,我们先弄清楚两件事:一条图生视频是怎么做出来的,以及怎么用提示词把自己的想法说清楚。

这一章先把流程和写法讲明白。等到了第三章,大家再跟着具体案例上手,就会更容易理解每一步在做什么。

第一部分:图生视频的完整制作流程

做一条有多个镜头的视频,可以先按这个顺序来:

写故事 → 定角色和场景 → 列分镜表 → 生成分镜图 → 图生视频 → 剪辑配声。

先看每一步要做什么,以及做完以后手里应该有什么。

步骤
具体做什么
这一步的产出物
进入下一步前,看什么
第一步:写故事
想清楚谁在什么地方,发生了什么,最后怎样结束。同时确定大致时长、画幅和风格。
一段简短故事,以及“30 秒、16:9、写实风格”这样的基本设定。
故事能不能用画面表达?动作和场景会不会太多?
第二步:定角色和场景
写清主角的长相、发型、服装,以及场景的时间、地点、光线;生成或准备相应参考图。
选定的角色参考图、场景参考图,以及需要固定的外观说明。
人物是否符合预期?服装、环境、风格是否已经确定?
第三步:列分镜表
把故事拆成几个镜头,写清几秒到几秒拍什么、人物做什么、镜头怎样移动。
一张带镜头编号、时间、画面、动作和声音的分镜表。
时长能否对上?前后动作是否连贯?
第四步:生成分镜图
参考选好的角色和场景,为每个镜头生成对应的画面,确定人物位置、姿势和拍摄距离。
一组按镜头编号排列的分镜图;这套流程里,每张图用作对应片段的首帧。
是否还是同一个人?场景、光线、人物朝向能否接上?
第五步:图生视频
输入每个镜头的首帧图,描述接下来发生的动作和运镜,分别生成视频。
若干段可供剪辑的视频素材。
动作是否完成?人物、手部和物体有没有明显变形?
第六步:剪辑配声
按分镜顺序拼接片段,调整时长,配上旁白、环境声、音效或音乐,检查后导出。
一条有完整开头和结尾、画面与声音配合好的视频,例如一条 30 秒 MP4。
故事是否看得懂?衔接是否自然?声音和总时长是否合适?

这是一套方便新手理解和修改的做法。每一步先选定满意的结果,再往下走;后面发现问题,也可以回到对应步骤修改。

其中有几个名字容易混淆,我们放在一起看:

名称
可以怎样理解
角色参考图
角色的“定妆照”,告诉模型这个人长什么样、穿什么衣服。
场景参考图
故事发生的环境,帮助统一地点、光线和色调。
分镜表
文字版拍摄安排,告诉我们什么时候拍什么。
分镜图
把某个镜头画出来,展示人物位置、姿势和构图,也可以只是草图。
首帧
视频开始的第一张画面。分镜图做得足够完整、适合作为动作起点时,就可以拿来当首帧。

比如,一张浅灰背景的女孩全身照,可以用来固定角色外观;但要拍“女孩站在江边”,还需要生成她出现在江边的那张镜头画面。

用一个小故事,把流程串起来

《即梦 Seedance 2.5 使用手册》的长视频部分,有“古装女子江边告别”的 29 秒一镜到底示例。我们借用这个题材,改编成一个 30 秒、4 个镜头的教学示例《江边告别》。

先写一句完整故事:

清晨,一位穿素白古装的年轻女子站在江边,望着远处渐渐离开的小船。她轻轻抬手告别,随后放下手,安静地留在岸边。

接着固定角色和场景:女子始终是同一张脸、黑色长发、素白交领衣裙;场景始终是有薄雾的清晨江岸。先准备好人物与江岸参考图,再列出分镜表:

镜头
成片时间
起始画面/分镜图
这段视频里发生什么
01
0–6 秒,6 秒
远景,女子站在画面左侧,面向右侧江面,小船在右侧远处。
小船缓缓远离,女子安静望着它,镜头固定,交代人物和环境。
02
6–14 秒,8 秒
女子的侧面中景,双手自然垂下,朝向与上一镜相同。
她慢慢抬起右手,在肩部附近轻轻挥动一次,镜头固定。
03
14–22 秒,8 秒
女子脸部近景,视线朝画面右侧,延续望向小船的方向。
她的目光停留在远处,嘴角浮现轻微笑意,发丝被风吹动。
04
22–30 秒,8 秒
回到侧面中远景,女子右手仍抬在肩部附近,小船已经更远。
她缓缓放下右手,继续望向江面,镜头慢慢后退,留出安静的结尾。

 

有了这张表,就知道接下来要准备 4 张分镜图、4 段视频素材。例如镜头 02 的图片先画“手还没有抬起”的状态,再让视频表现抬手的过程。不要在一张图里同时画出抬手前和抬手后。

最后把片段按顺序剪在一起,加上连续的江水声和轻微风声,就能形成一条完整短片。音乐和旁白按表达需要添加,不是每条视频都必须有。生成素材的时长可以留一点剪辑余量,最终以剪辑后的 30 秒为准。

这个例子展示的是逐镜头制作。

第二部分:人物、分镜和视频提示词怎么写

知道流程以后,提示词就有了具体用途:生角色图时,要交代外观;写分镜时,要安排画面和动作;生成视频时,还要告诉模型这些动作按什么顺序发生。

可以整理成四个部分:

素材用途(有参考素材时)+一句话概述+具体情节+全局要求。

部分
要回答的问题
例子
素材用途
上传的每个素材分别用来参考什么?
图片1参考人物外观,图片2参考江岸环境。没有素材时可以省略。
一句话概述
谁在什么地方做什么,是什么风格?
一位古装女子在清晨江边向远去的小船告别,写实电影风格。
具体情节
先发生什么,后发生什么,镜头怎么拍?
0–6 秒拍江岸远景;6–14 秒切中景,女子抬手挥别。
全局要求
整段视频哪些东西要保持一致?需要什么声音?
人物长相和衣服不变,保留江水声,无对白、字幕和背景音乐。

下面分别看三个常用写法。

1. 人物提示词:把“好看”写成具体特征

只写“一个漂亮女孩”,模型可以有很多种理解。想让人物接近你的想法,就要把最重要的外观说清楚。

真人人物得写法会从年龄、皮肤、面部特征、眼神、发型、服装、体型和气质几个方面描述。新手可以先按下面这张表整理:

维度
写什么
《江边告别》的教学设定
年龄与整体形象
大致年龄、人物类型
约 22 岁的年轻东亚女性
皮肤与面部特征
肤色、皮肤质感、容易辨认的五官
自然肤色,保留细微皮肤纹理,鹅蛋脸,细长眼睛,柔和下颌线
眼神与表情
看向哪里、什么表情
目光平静,神情略带不舍
发型
长短、颜色、梳理方式
黑色长发,半束发,额前少量碎发
服装与材质
颜色、款式、材质
素白交领长裙,柔软布料,没有繁复刺绣
体态与气质
身形、姿态、整体感觉
身形纤细,站姿自然,气质温婉

把它整理成角色参考图提示词,就是:

写实人物摄影,一位约 22 岁的年轻东亚女性,自然肤色,保留细微皮肤纹理。鹅蛋脸,细长眼睛,下颌线柔和,神情平静。黑色长发半束起,额前有少量碎发。身穿素白交领长裙,布料柔软,没有繁复刺绣。身形纤细,自然站立,双手垂在身体两侧。全身完整入镜,浅灰色简洁背景,光线柔和,脸部和服装清晰,无文字。

描述不必越长越好。先固定几项最重要的特征,选好参考图以后,后面的镜头持续引用它。不要每个镜头重新设计一次发型和服装。

 

2. 分镜提示词:把故事变成拍摄安排

分镜要说清楚“拍哪里”和“发生什么”。可以用一个简单结构来写:

时间段+景别与构图+主体动作/表情+镜头运动+声音。

这里的景别,就是拍摄范围:远景能看见更多环境,中景能看清人物动作,近景更适合表现脸部表情。运镜就是摄像机怎样移动,例如固定不动、缓慢推进、向后拉远。

同样是“她依依不舍地告别”,改成下面这样,画面就具体了:

6–14 秒,侧面中景。女子在画面左侧,望向右侧远去的小船。她缓慢抬起右手,在肩部附近轻轻挥动一次,表情克制。镜头固定,微风吹动发丝和袖口,背景保留轻微江水声。

如果想让 AI 先帮你列分镜表,可以这样提问:

 

请将下面的《江边告别》故事拆成 4 个镜头,总时长 30 秒。表格包含镜头编号、开始与结束时间、景别、起始画面、人物动作、运镜和声音。保持人物、服装、场景与视线方向一致,每个镜头安排一个主要动作。起始画面必须能用单张静态图片表现,检查各段时间连续,合计 30 秒。故事:清晨,古装女子站在江边,望着远去的小船,抬手告别,最后放下手,留在岸边。

**列好分镜以后,生图和生视频的提示词还要分开。**生图描述这一刻的画面,生视频描述接下来怎样变化。以镜头 02 为例:

 

用途
提示词示例
生成分镜图
人物外观参考图片1,江岸环境参考图片2。16:9 横屏,写实电影风格,清晨薄雾,女子站在画面左侧,侧身面向右侧江面,双手自然垂下。中景,完整保留头部、上半身和双手,右侧留出视线空间。单张画面,无文字。
让分镜图动起来
以上传图片为首帧,女子缓慢抬起右手,在肩部附近轻轻挥动一次,随后保持片刻。目光始终望向画面右侧。镜头固定,发丝和袖口随微风轻动,保持人物外观与场景一致,不切镜。

引用图片时,编号要和实际上传的素材对应,并按工具提供的方式选中素材。单独生成某一段视频时,时间从该段的 0 秒算起;分镜表里的 6–14 秒,是它在最终成片中的位置。

3. 30 秒长视频提示词:先统一设定,再按时间展开

30 秒里如果要发生几件事,就需要安排节奏。先交代参考素材和全局设定,再用时间段展开剧情。我们可以整理成下面这个模板:

层次
写什么
全局设定
总时长、画幅、题材风格、人物外观、场景、时间和光线。
参考素材(可选)
哪张图对应人物,哪张图对应场景,视频或音频分别参考什么。
时间轴分镜
从 0 秒到结束,逐段写出画面、动作、表情、运镜,以及需要的对白或声音。
全局补充
始终保持什么,哪些元素不需要,结尾怎样结束。

本内容需要登录后查看

最后

希望这篇教程,能帮第一次接触 AI 视频的你,从 0 到 1 做出自己的第一个 AIGC 视频。

你可以先让自己的数字人跳一段喜欢的舞蹈,也可以试着写下脑海中的画面,或者参考优秀创作者的提示词结构,让 AI 帮你改写成自己的故事。选一个感兴趣的小玩法,动手生成一次,再看看哪里需要调整。第一条视频不必完美,每一次尝试和修改,都会让你更清楚怎样把想法变成画面。

上一篇 用 AI 做热点长视频:单条 108 万播放喂饭教程