导读
完全没接触过这块,从头顺着读,术语第一次出现的地方我都解释了。
想自己动手搭一条全本地的数字人,看前2 章。
如何搭建数字人营销视频,看第 3 到第 6 章。
拉到最后看视频提示词学习库
1.数字人五要素
做这件事最容易犯的错,是去找一个一体化工具,指望它从选题到成片一把梭。用一阵子之后一定会出岔子。
一条数字人口播视频只有五个位置:
1、形象:角色卡。
2、声音:音色、语气。
3、口型:让嘴的动作和声音对上。
4、内容:讲什么选题,逐字稿怎么写。
5、环境:这个人在哪儿。画面里的背景,和耳朵里的空间感。
五个位置互相独立,每个都可以单独替换。
另外声音和口型有两种实现路线:如果声音来自 TTS,你必须再过一遍口型模型;如果声音来自音画同出的视频模型比如豆包,口型是模型自己带的,不需要再对。
飞书选题库 ──► 豆包写脚本 ──► 飞书主播库挑参考图
│
▼
Seedance 音画同出
(画面、声音、口型、环境一次生成)
│
▼
成片
▼
发布数据回填飞书选题库
第 2 章我会完整讲一条全本地的链路,自己拍素材、Qwen TTS 配音、MuseTalk 对口型。我先测试了本地,也是理解这五个位置最好的方式。但真做营销视频的时候,中间这三步被 Seedance 一步替掉了,第 5 章讲这个替换是怎么发生的,以及什么情况下我用本地的链路。
2. 形象和声音
2.1 形象:自己拍一段,或者找朋友拍
数字人的形象可以直接来自你本人。不需要绿幕和专业设备,拿手机正面拍一段 30 秒左右的素材就够了,找朋友或者同事帮你拍也行。
至于这一段该怎么拍才对,看完 2.3 和 2.4 你就明白了。
2.2 配音:VoiceBox 里跑 Qwen TTS
TTS 是 Text To Speech 的缩写,一句话解释:把文字念成人声。你把逐字稿丢进去,它吐一条音频出来。
我用的是 VoiceBox,本地跑,免费,集成了一批开源语音模型,其中中文效果最好的是 Qwen。它有一个能力对做账号的人特别重要,叫声音复刻:你录几句话给它,几十秒的素材就够,它之后就能用你的音色念任何稿子。也就是说,数字人的脸是你,声音也是你。
它还自带 Whisper,用来听着最终音频倒推每句话的真实时间戳,也就是字幕。这里有条结论第一篇里我踩过:时间戳必须从最终音频倒推,不能按稿子字数去估,估出来的越往后差距越大。
2.3 口型:MuseTalk
这是我这三个星期主要在折腾的东西。
现在你手上有两样不相干的东西:一段你自己拍的人脸视频,和一条 TTS 念出来的音频。视频里那个人的嘴,动的是拍摄当时说的话,跟这条音频对不上。口型模型的工作,就是把视频里那个人的嘴部逐帧重画一遍,让嘴的动作和你给的这条音频对上。
我用的是 MuseTalk,开源、免费、本地跑,我跑的是 1.5 版本。输入是人脸视频加音频,输出是一条口型对上的视频。
到这一步,一条全本地、零成本、可批量的链路就通了:脸是我自己的,声音也是我自己的,稿子不用传给任何第三方。如果你只做自己一个账号,量也不大,看到这里就已经够用了。
前三个位置到这里就齐了。你有了一个数字人,但还没有一条营销视频。
2.4 能否做营销视频?
拿上面的视频做营销视频,问题会很多:
1、只有人没有物
2、口型模型对于姿势,构图会有要求
3、没有环境因素,没有环境音
4、最重要的是,拍什么才能爆?
几个问题,我用的是同一个解法解决:飞书里的豆包。
选它的理由很实在,它一头连着飞书,一头连着 Seedance。
这条产线的两端分别是数据和生成。选题要采集下来写进多维表格,主播库的参考图要存进飞书,出片要调 Seedance,发出去之后成绩还要回填。
这几件事如果散在不同工具里,你每天大量的时间会花在导出、上传、复制粘贴上,而且一定会漏。豆包把它们收进了同一个对话框:打开飞书就能用,不用装插件,它有一个模式叫办公任务,你一句话下达目标,它自己规划步骤,自己去调云端浏览器、飞书文档、多维表格和 Seedance,把整件事跑完,再把能直接用的结果交给你。
下面三章,就是从数字人走到营销视频的三步。
3.营销视频- A.找选题
进入豆包后,点输入框下方的工作任务,选择工作任务模式。抖音搜索、视频数据采集、内容分析,以及飞书多维表格的创建和写入,都可以直接交给它。
你不需要提前建表,也不需要自己配置字段。我发的提示词:
请帮我完成一次抖音对标视频采集任务。
搜索最近 24 小时内与【产品介绍】相关的视频,筛选点赞量最高的 10 条。
采集以下信息:
标题、链接、创作者、发布时间、点赞数、评论数、内容类型、爆款原因、
声音风格、镜头形式、可复用的钩子句式。
完成后创建一张飞书多维表格,命名为数字人选题库,
自动配置字段并写入结果,按点赞数从高到低排序。
它会自己打开浏览器、翻页、提取数据,最后把表建好。跑完之后再让它建一个定时任务,每天上午 9 点自动采一轮,写入前检查链接去重。
到这一步,那个不产生积累的循环就断了:爆款不再沉进收藏夹,而是进了一张会持续变长的表。
声音风格、镜头形式、可复用的钩子句式,这个是 prompt 里的关键,采集的时候多问一句,写脚本的时候就少猜一次。

4.营销视频- B. 三千佳丽主播库
4.1 定妆
生成数字人不能每次都从零开始,那样每条视频里的人都不一样,账号没有人设。
正确的顺序是先做一张参考卡片,把这个人定下来:脸型、发型、气质、光线方向、镜头焦段。这张卡片就是这个人的身份证,后面所有生成都以它为准。
这也是为什么做数字人一般都用带参考图的生成方式,而不是纯文字描述。

4.2 主播库
定妆卡有了,接下来就可以在同一张脸的基础上,批量换妆容、换服装、换场景,生成一组参考图。这一组图就是主播库。
我的主播库长这样:同一个脸型,不同的妆容浓淡,不同的着装风格,不同的背景环境。下一次要拍一条视频,不用再拿手机拍,从主播库里挑一张对得上产品调性的,让豆包基于这张参考图生成。
让换衣服、换场景、换风格,变成一次挑选。

4.3 为什么这个库要放在飞书里
先解释一下飞书多维表格是什么,没用过的人可以理解成:一张长得像 Excel、但每个格子能直接放图片和附件的在线数据库,还能一键切换成看板视图和数据图表。
主播库要放在这里,它是一个要被反复筛选和调用的资产表。我建的字段:

5. 营销视频- C.音画同出:Seedance 一步替掉前面大半条链路
第 2 章是分段做的:拍素材、TTS 出声音、MuseTalk 对口型,三步接起来。
还有另一类模型,是把声音和画面一起生成出来的,业内叫音画同出。你给它一段描述和一张参考图,它直接吐一条带声音的视频。我现在用的就是这条,模型是 Seedance,在飞书里的豆包直接调。
它能直接替换几乎所有的流程:

2.4 里那几个问题,大部分是被这一步一次性解掉的:画面里可以有产品而不只是人,姿势和构图不再受口型模型那些限制,环境那一格也终于有东西填了。
5.1 环境音是怎么来的
介绍产品不能干巴巴地念,灵感我一直是让豆包去抖音里找。调研的时候扒到一个词:ASMR,沉浸式声音。
我拿了几张参考图,按沉浸式声音的路子试着生成了几条,出来的东西里带着一整层环境音效:翻纸、脚步、杯子放下、室内那种说不清但确实存在的空气感。
这些声音用 TTS 拿不到,去素材库找也很难和画面对上时间点。第五个位置到这里填满了,而且填它的不是语音模型,是一个视频模型。
5.2 Trade off 效果和可控
它的发挥空间太大,你很难让它一字不差地念完你的稿子。营销视频里产品名、价格、活动截止时间,念错一个字这条就废了。
所以第 2 章那条本地方式我没有删,两个方式是这么分工的:
要氛围、要环境、画面里要有产品:Seedance 音画同出,一步到位。
逐字必须准确,或者稿子不方便传出去:回本地那条,牺牲效果换可控。
大部分营销视频我走前一条。
补充一句选型上的实话:中间我还试了 MiniMax H3。它是跑在本地的模型,出来的东西不差,胜在零成本和可控,但完成度到不了云端那一档。而在飞书里让豆包调研完直接用 Seedance 出片,整段是一次性生成的,明显更完整。本地模型的价值在可控,出效果这一段还是得靠云端。
6.营销视频工作流
单看每一张表都只是个数据库,下面是串联流程:
选题库 ──► 豆包出脚本 ──► 主播库挑参考图
│
▼
Seedance 出片
▼
发布 ──► 数据回填两张表
(完播率写回主播库,
实际表现写回选题库)
哪一类选题你做得动,哪一个形象的完播率更高,哪种声音风格在你的品类里更吃香。数据采集后,后面就能做得更好。
而且因为它在飞书里,可以公司内共享。运营挑选题、设计看主播库、老板看数据看板,同一份数据,各看各的视图。这是我最后把两张表都放进多维表格而不是留在本地的根本原因。

这张表这么看:本地链路负责可控,Seedance 负责效果,飞书负责积累,豆包负责把它们连成一条线。
总结
回头看,这篇文章可以学习到:
第一,五个位置要拆开,而且要认清它们分两段:形象、声音、口型让你有一个数字人,内容和环境才让它成为一条营销视频。绝大多数人的力气花在前三个上,卡住他们的是后两个。
第二,效果和可控是一对取舍,别指望同时拿满。音画同出给你环境、情绪和完成度,代价是交出逐字控制权;本地链路反过来。想清楚这一条视频要哪一头,比调参数重要。
第三,一条视频做完就结束了,一张表做完才刚开始。定妆卡沉淀成主播库,收藏夹沉淀成选题库,这两件事的收益是复利的。





