用录音保留原来的表达
上传录音,让视频使用其中的发音、停顿和重音。清晰的单人讲话,比混有大声背景音乐或多人同时说话的音轨更适合作为输入。
用一张人物照片,配合文字台词或录音,制作数字人口播。Freepik AI 将肖像与语音结合,生成对口型视频,用于开场介绍、内容讲解和角色台词,无需重新拍摄真人出镜片段。
录音已经满意,就直接上传;文案还需要推敲,可以先从文字生成语音。
上传录音,让视频使用其中的发音、停顿和重音。清晰的单人讲话,比混有大声背景音乐或多人同时说话的音轨更适合作为输入。
在“生成语音”中输入台词并选择声音。制作数字人视频前,先听一遍配音。拗口或读错的句子应在这一步调整,动画不会替你改善发音。
肖像决定说话者的外观。脸部要清楚,构图也要给说话和表情变化留出空间。
选择面部光线较均匀、五官清晰的图片。手挡住嘴、脸太小或侧面角度过大,都会减少可用于说话动画的信息。
直接面向观众的介绍,适合头肩构图,并在头部周围留一点空间。插画角色也应突出五官,不要让说话者的脸只占远景里很小一块。
台词或录音提供说话内容,动画提示词描述可见表演。设置好后,选择 720p 或 1080p 输出。
可以描述专注讲解、轻轻点头或热情打招呼等表情和小动作。简单的表演方向,比额外安排一连串大幅动作更容易与说话协调。
看口型是否跟上音频、表情是否合适,以及开头结尾是否完整。词句读错就改语音;脸部动作不自然,则重新检查肖像或表演描述。
Freepik AI 数字人口播适合由一个人物或角色清楚地传达一段信息。
先简短问候,再说明观众接下来会学到什么。具体操作用其他画面展示,让数字人在成片里负责介绍和串联,而不是承担所有内容。
让插画导览员介绍展品,或让角色解释游戏规则。台词按说话习惯写,开门见山,每段集中讲一个容易记住的要点。
先判断驱动画面的主要内容,是台词、构思的动作,还是已经录好的表演。
已经明确人物要说什么时,用数字人口播。音频提供说话节奏,图片确定人物形象,适合讲解和角色表达。
走路、转身或动作场景可以从视频生成器开始。要模仿某段舞蹈或手势,则使用角色图片与表演片段做动作控制。
准备好台词、录音和肖像,让画面更适合表达内容。
在 Freepik AI 数字人工作区上传肖像,选择“生成语音”,输入台词并挑选声音。生成后先试听,再补充简短的动画描述并制作视频。实际说话内容和节奏来自语音音轨。
可以。选择“上传音频”,用自己的录音代替生成语音。先裁掉不需要的空白,并保证说话者声音清楚。视频会跟随这段音轨,因此应先选好发音、语速和停顿都满意的版本。
上传音频方式支持最长五分钟的录音,同时需符合上传框的文件大小限制。文字生成语音有单独的字数限制。较长的讲解可以拆成几段,复用同一张肖像生成,再在编辑软件中拼接。
不会。真正要说的话应写入语音台词框,或通过录音提供。动画提示词用于表情、姿态和小动作等画面要求。分开填写后,出现问题时也更容易判断该改文字、录音还是表演描述。
可以使用五官明确的插画肖像。让眼睛和嘴部清楚可见,并采用适合讲话的构图。过于抽象或五官很小的造型更难作为起点,生成后要检查口型与面部运动。
可以准备目标语言的录音,或用合适的声音生成语音。视频生成前先核对发音,特别是人名和不常见词。不同语言版本需要各自的台词或音频,上传录音并不会自动翻译。
支持。Freepik AI 提供 720p 和 1080p 输出。根据最终展示位置选择分辨率,使用清晰肖像,并按观众实际观看的尺寸检查脸部效果。
带上一张肖像和想说的内容,用 Freepik AI 开始制作。
生成口播视频