第二步:用AI生成画面
第二步:用AI生成画面
适用人群:有了脚本但不会拍、不会画的小白 阅读时长:12分钟 你将学会:3种AI生成视频画面的方法,从最简单到质量最高
一、三种生成画面的方法,选一个
| 方法 | 难度 | 耗时 | 画面质量 | 适合场景 |
|---|---|---|---|---|
| A. 数字人口播 | 极低 | 5分钟 | 一般 | 知识科普、产品介绍 |
| B. 图文成片 | 低 | 10分钟 | 中等 | 故事、科普、书单 |
| C. AI逐帧生成 | 中 | 30-60分钟 | 高 | 创意短片、高质量内容 |
新手建议:从A或B开始,熟练后再尝试C。
二、方法A:数字人口播(最简单)
什么是数字人?
就是一个虚拟人物,你输入文字,它就用你的(或预设的)声音和表情把内容说出来,像真人在播报一样。
操作步骤(以剪映为例)
- 打开剪映 → 点击"开始创作"
- 点击"文本" → 输入你的脚本旁白
- 选中文本 → 点击"文本朗读"
- 选择一个数字人形象(剪映里有多个免费形象)
- 选择声音(有多种音色可选,也可以用自己的声音克隆)
- 点击生成 → 等待几秒,数字人视频就出来了
- 调整:可以换背景、加贴纸、加字幕
工具推荐
- 剪映数字人:免费、操作简单、国内直接用
- HeyGen:数字人质量更高,但需要科学上网且付费
- D-ID:可以用一张照片生成数字人
优缺点
- ✅ 优点:最快、最简单,不用管画面匹配
- ❌ 缺点:画面单一,都是一个人在说话,容易看腻
三、方法B:图文成片(最省事)
什么是图文成片?
把一篇文章或一段脚本粘贴进去,AI自动匹配画面、配音、字幕,一键生成视频。
操作步骤(以剪映为例)
- 打开剪映 → 点击"图文成片"
- 粘贴你的脚本(或输入一篇文章链接)
- 选择视频比例(9:16竖屏 / 16:9横屏)
- 选择配音音色
- 点击"生成视频" → 等待1-2分钟
- 进入编辑界面微调:
- 替换不合适的画面(点击画面→替换→搜索素材或上传)
- 调整字幕样式
- 加背景音乐
- 裁剪多余片段
- 导出
让画面更匹配的技巧
- 脚本里每句话描述一个具体画面,不要太抽象
- 比如不要写"健康饮食很重要",要写"一盘色彩丰富的沙拉,有生菜、番茄、鸡胸肉"
- 可以在脚本里直接标注画面:
【画面:办公室里一个人在加班,桌上放着外卖】
优缺点
- ✅ 优点:几乎一键生成,省时间
- ❌ 缺点:画面匹配度不稳定,经常需要手动替换
四、方法C:AI逐帧生成(质量最高)
流程
脚本 → 拆分镜头 → 每个镜头用AI生成图片/视频 → 导入剪映剪辑
第1步:拆分镜头
让AI帮你把脚本拆成镜头表:
把下面的脚本拆成镜头表,每个镜头3-5秒。
输出格式:镜号 | 画面描述(用于AI画图的提示词) | 旁白 | 时长
[粘贴你的脚本]
第2步:用AI生成图片
工具:即梦AI、文心一格、通义万相
提示词怎么写? 一个好的图片提示词包含4部分:
[主体] + [动作/状态] + [环境/背景] + [风格/画质]
举例:
- 差:
一个人在吃饭 - 好:
一个年轻上班族在办公桌前吃沙拉,阳光从窗户照进来,温暖色调,电影质感,高清细节
技巧:
- 风格词要统一(比如所有图都加"电影质感,暖色调,高清"),这样视频风格一致
- 可以先生成一张满意的,然后用"以图生图"保持风格统一
第3步:用AI让图片动起来(图生视频)
工具:可灵AI、即梦AI、Runway
操作:
- 上传你生成的图片
- 输入运动描述(比如"镜头缓慢推进""人物微微转头""树叶随风飘动")
- 选择时长(通常3-5秒)
- 生成视频片段
运动描述模板:
镜头缓慢[推进/拉远/平移],[主体动作],[环境动态],画面稳定,电影质感
第4步:也可以直接文生视频
如果不想先生成图片,可以直接用文字生成视频片段:
工具:可灵AI、即梦AI、Sora
提示词模板:
[场景描述],[镜头运动],[光线氛围],[风格],时长5秒
举例:
一个年轻女孩在雨中的街道上奔跑,霓虹灯倒映在湿漉漉的地面上,镜头从侧面跟随拍摄,夜晚城市氛围,电影质感,赛博朋克风格,时长5秒
优缺点
- ✅ 优点:画面精美、风格可控、创意空间大
- ❌ 缺点:步骤多、耗时、需要反复调整
五、画面生成的5个实用技巧
1. 风格统一最重要
同一支视频里的所有画面,风格词要保持一致。否则看起来像拼凑的。
2. 别追求完美
AI生成的画面偶尔会有bug(比如多一根手指、脸变形)。短视频节奏快,观众不一定注意得到。太纠结细节会累死。
3. 善用素材库
剪映、即梦都有大量免费素材。有些画面直接用素材比AI生成更靠谱(比如城市风景、自然景观)。
4. 镜头不要太复杂
新手先用简单的镜头运动(缓慢推进、固定镜头),太复杂的运镜AI容易出bug。
5. 多生成几次
AI生成有随机性。同一个提示词生成3-4次,挑最好的那张。
下一步
画面有了,接下来:怎么给视频配音和加字幕? → 第三步:用AI配音和加字幕