多模态生成:让 AI 帮你画图、做视频
AI 不只能写文字,还能生成图片、制作视频、设计海报。文字描述就能出图出视频,不用找设计师,自己几分钟搞定。
一句话总结:AI 不只能写文字,还能生成图片、制作视频、设计海报。文字描述就能出图出视频,不用找设计师,自己几分钟搞定。

13.1 什么是多模态?
"多模态"听起来很技术,其实很简单:
- 单模态:只能处理一种信息形式(比如只能处理文字)
- 多模态:能处理多种信息形式(文字、图片、视频、音频等)
豆包工作的多模态生成能力,就是让 AI 不仅能"写",还能"画"和"演"。
大白话解释
| 能力 | 你做什么 | AI 做什么 |
|---|---|---|
| 文字生成 | 用文字描述需求 | AI 写出文字(文章、方案、邮件) |
| 图片生成 | 用文字描述画面 | AI 画出图片(海报、插图、封面) |
| 视频生成 | 用文字描述场景 | AI 制作视频(短片、动画、演示) |
| 图文混合 | 给文字+图片要求 | AI 生成图文并茂的内容 |
🎨 一句话总结:以前你要做一张图,得找设计师、排期、改稿、等三天。现在你用文字描述一下,AI 几分钟就给你出图。

13.2 图片生成:文字描述就能出图
怎么用?
图片生成的使用非常简单:
- 切换到图片生成技能(或在对话中说"帮我画一张图")
- 用文字描述你想要的画面
- 点击生成,等待几十秒
- 得到图片,可以要求调整或重新生成
怎么写图片描述?
图片生成的效果,80% 取决于你的描述写得好不好。一个好的图片描述包含以下要素:
🎯 主体 + 🎨 风格 + 🌈 色彩 + 🖼️ 构图 + ✨ 细节
要素说明:
| 要素 | 说明 | 例子 |
|---|---|---|
| 主体 | 画里有什么 | "一个职场女性在电脑前工作" |
| 风格 | 什么画风 | "扁平化插画风格""3D渲染""水彩画""赛博朋克" |
| 色彩 | 色调和配色 | "蓝色主色调,明亮清新""暖色调,温馨感" |
| 构图 | 画面布局 | "居中构图""特写镜头""广角全景" |
| 细节 | 额外要求 | "高清,4K,专业摄影质感,柔和光线" |
好描述 vs 差描述
| 差的描述 | 好的描述 |
|---|---|
| "帮我画个海报" | "一张课程招生海报,主体是一个年轻人在电脑前学习,背景是科技感的数据可视化图案,扁平化插画风格,蓝色主色调,上方留白用于放标题,高清4K" |
| "画个商务场景" | "商务会议场景,3个人围坐在会议桌前讨论,桌上有笔记本电脑和咖啡,现代简约办公室,自然光从窗户照入,专业摄影风格,暖色调" |
| "做个头像" | "一个卡通风格的职场女性头像,短发戴眼镜,微笑表情,蓝色背景,简约扁平化设计,适合做社交头像" |
💡 技巧:描述越具体,出图效果越符合预期。不要怕写得多,写得详细 AI 才知道你要什么。
图片生成的典型用途
| 用途 | 例子 |
|---|---|
| 公众号/文章配图 | 为文章生成主题插图 |
| 海报设计 | 活动海报、课程海报、招聘海报 |
| PPT配图 | 为PPT页面生成装饰图或概念图 |
| 社交媒体内容 | 朋友圈配图、小红书封面、抖音封面 |
| 产品概念图 | 快速生成产品原型的视觉概念 |
| 头像/图标 | 个人头像、APP图标、网站favicon |
| 表情包 | 生成有趣的表情包或梗图 |
图片生成的注意事项
- 生成需要时间:通常一张图需要10-60秒,耐心等待
- 可以多次生成:不满意就重新生成,每次结果会略有不同
- 可以局部调整:有些工具支持"只改某一部分",比如"把背景换成绿色"
- 注意版权:AI 生成的图片版权归属可能有争议,商用前了解清楚
- 不要生成违规内容:遵守法律法规和平台规则,不生成违法、侵权、低俗内容

13.3 视频生成:从脚本到成片
视频生成是比图片生成更强大的能力。AI 可以根据文字描述,直接生成一段视频。
视频生成的方式
方式一:文字生成视频
你用文字描述一个场景,AI 直接生成视频。
例子: "一个现代办公室场景,阳光从窗户照进来,一个职场女性在电脑前专注工作,镜头缓慢推进,温暖的色调,电影质感"
AI 会生成一段5-10秒的视频片段。
方式二:图片生成视频
你提供一张图片,AI 让图片"动起来"。
例子: - 上传一张产品海报,AI 生成一个产品展示动画 - 上传一张人物照片,AI 生成一个说话的头像视频 - 上传一张风景照,AI 生成一个镜头移动的风景视频
方式三:脚本生成完整视频
你提供一个视频脚本(包含分镜、台词、画面描述),AI 自动生成完整视频。
例子:
视频主题:大圣AI办公实战课宣传片
时长:30秒
分镜1(0-5秒):一个职场人疲惫地面对堆积如山的文件,叹气
分镜2(5-10秒):他打开豆包工作,输入指令,AI 开始工作
分镜3(10-20秒):快速蒙太奇——AI 写文档、做表格、生成PPT、画图
分镜4(20-25秒):职场人轻松喝咖啡,工作全部完成
分镜5(25-30秒):课程logo和slogan"8周速成,AI办公达人"
AI 根据这个脚本生成完整的30秒宣传片。
视频生成的典型用途
| 用途 | 例子 |
|---|---|
| 产品宣传视频 | 快速制作产品介绍短片 |
| 社交媒体短视频 | 抖音、视频号、小红书短视频 |
| 课程宣传片 | 在线课程的招生宣传视频 |
| 演示动画 | 产品功能演示、流程说明动画 |
| 会议开场视频 | 年会、发布会的开场短片 |
| 教育培训视频 | 知识点讲解动画、教学视频 |
视频生成的注意事项
- 时长有限:目前 AI 视频生成通常是短视频(5-30秒),长视频需要拼接
- 质量在进步:AI 视频质量日新月异,但还达不到专业影视级别的水准
- 生成时间长:一段视频可能需要几分钟到十几分钟生成
- 消耗额度多:视频生成比图片和文字消耗更多额度,省着用
- 适合"够用就行"的场景:内部演示、社交媒体、快速原型,对质量要求不高的场景

13.4 实战案例:为AI培训教案做视觉物料
我们用「AI培训教案」来演示一套完整的多模态生成流程。
任务:为大圣AI办公实战课制作一套视觉物料
需要的物料: 1. 课程封面图(用于网站和公众号) 2. 招生海报(用于朋友圈和社群传播) 3. 30秒宣传片(用于视频号和抖音)
步骤一:生成课程封面图
图片描述:
一张在线教育课程封面图,主体是一个现代职场人坐在电脑前,屏幕上显示AI对话界面,周围漂浮着文档、表格、图表等办公元素,扁平化插画风格,蓝色和紫色渐变主色调,科技感但不冰冷,上方留白用于放课程标题,高清4K,专业设计质感
生成后调整: - "整体色调再亮一些" - "人物换成女性" - "办公元素再丰富一些,加个PPT图标"
步骤二:生成招生海报
图片描述:
一张课程招生海报,竖版比例,上方是大标题区域(留白),中间是一个职场人轻松微笑的插画,周围环绕着"效率提升300%""8周速成""零基础友好"等文字标签,下方是报名二维码区域(留白),扁平化插画风格,橙色和蓝色撞色设计,活力感,适合朋友圈传播,高清
生成后:用图片编辑工具(或让 AI 帮忙)加上具体的文字内容和二维码。
步骤三:生成30秒宣传片
视频脚本:
主题:大圣AI办公实战课宣传片
风格:轻松幽默,快节奏
音乐:轻快活泼的电子音乐
分镜1(0-3秒):
画面:一个职场人面对堆积如山的文件,抓头发,表情崩溃
字幕:每天被工作淹没?
旁白:你是不是每天都被重复的工作压得喘不过气?
分镜2(3-6秒):
画面:他打开豆包工作,眼睛一亮
字幕:直到遇到了它
旁白:直到你遇到了豆包工作。
分镜3(6-15秒):
画面:快速蒙太奇——AI写文档、做表格、生成PPT、画图、发邮件,每个画面1-2秒
字幕:写文档 / 做表格 / 生成PPT / 画图 / 发邮件
旁白:写文档、做表格、生成PPT、画图、发邮件,AI全包了。
分镜4(15-20秒):
画面:职场人轻松喝咖啡,电脑屏幕显示"全部完成"
字幕:效率提升300%
旁白:效率提升300%,准时下班不是梦。
分镜5(20-27秒):
画面:课程界面展示,8周课程大纲快速闪过
字幕:8周速成 / 零基础友好 / 岗位定制
旁白:8周速成,零基础友好,财务、HR、销售、项目管理、售前,五大岗位定制内容。
分镜6(27-30秒):
画面:课程logo和报名二维码
字幕:大圣AI办公实战课,立即报名
旁白:大圣AI办公实战课,立即报名,开启你的AI办公之旅!
AI 根据脚本生成视频,然后你可以: - 调整画面风格 - 更换背景音乐 - 添加字幕和特效 - 导出为不同格式
最终成果
一套完整的视觉物料: - 🖼️ 课程封面图(1张) - 📱 招生海报(1张) - 🎬 30秒宣传片(1个)
总耗时:不到1小时。 以前找设计师做这套,至少要一周,花费几千块。

13.5 多模态生成的进阶技巧
技巧一:参考图引导
如果你有一张喜欢的图片,可以作为"参考图"上传,让 AI 模仿它的风格和构图。
用法: 1. 上传参考图 2. 说"参考这张图的风格,生成一张[你的需求]" 3. AI 会模仿参考图的画风、色调、构图
效果:比纯文字描述更精准,因为 AI 能"看到"你想要的风格。
技巧二:分步生成
复杂的图片/视频不要一次生成,分步来:
- 先生成主体(比如人物)
- 再生成背景
- 最后合成和调整
或者: 1. 先生成草图/概念图 2. 确认方向后再生成高清图 3. 最后做细节调整
技巧三:批量生成+挑选
不要指望一次就生成完美的。每次生成3-5张,从中挑最好的,然后基于最好的那张做调整。
流程: 1. 生成4张不同版本 2. 挑选最满意的1张 3. 基于这张做细节调整("颜色再亮一点""人物再靠左一点") 4. 最终确认
技巧四:文字叠加用专业工具
AI 生成的图片上如果有文字,经常会出现"乱码"或"错别字"。建议: - AI 生成图片时留白,不要让 AI 在图上写字 - 生成后用 PPT、Canva、Photoshop 等工具手动加文字 - 这样文字准确、排版可控

13.6 常见问题
Q:AI 生成的图片可以商用吗?
A:这取决于平台的用户协议和当地法律法规。一般来说,平台会授予用户一定的使用权,但具体权利范围需要看协议。商用前建议仔细阅读用户协议,必要时咨询法律专业人士。
Q:生成的图片模糊怎么办?
A:可以在描述中加"高清、4K、高分辨率、细节丰富"等关键词。如果还是模糊,可以用图片放大工具(有些平台内置了高清放大功能)处理。
Q:可以生成特定人物的图片吗?
A:不建议生成真实人物(尤其是公众人物)的图片,可能涉及肖像权问题。可以生成"虚构的职场人物",不要指定真实姓名。
Q:视频生成的声音是AI配音吗?
A:有些平台支持 AI 配音,你可以选择不同的音色(男声、女声、童声、各种方言)。有些平台只生成画面,需要你自己配音和加音乐。
Q:生成的图片/视频存在哪里?
A:通常保存在豆包工作的项目中,可以随时查看和下载。也可以设置自动保存到本地或云存储。

13.7 本章小结
- 多模态生成让 AI 不仅能写文字,还能生成图片和视频
- 图片生成:用文字描述画面(主体+风格+色彩+构图+细节),AI 几分钟出图
- 视频生成:三种方式——文字生成视频、图片生成视频、脚本生成完整视频
- 典型用途:海报、封面、配图、宣传片、短视频、演示动画
- 实战案例:为AI培训教案生成封面图+海报+30秒宣传片,1小时搞定
- 进阶技巧:参考图引导、分步生成、批量生成挑选、文字手动叠加
- 注意事项:版权问题、生成时间、额度消耗、不要生成违规内容

13.8 下一章预告
多模态生成让你的内容"颜值在线",接下来我们要学习一个每天都用得上的能力——文档/表格/PPT与精准编辑。AI 不只能从零生成,还能帮你精准修改已有文件。
❓ 什么是多模态生成:让 AI 帮你画图、做视频?
AI 不只能写文字,还能生成图片、制作视频、设计海报。文字描述就能出图出视频,不用找设计师,自己几分钟搞定。
❓ 什么是多模态?
"多模态"听起来很技术,其实很简单:
❓ 如何理解图片生成:文字描述就能出图?
图片生成的使用非常简单:
❓ 如何理解视频生成:从脚本到成片?
视频生成是比图片生成更强大的能力。AI 可以根据文字描述,直接生成一段视频。