非官方社区教程 · 内容整理自公开资料 · 豆包工作为字节跳动产品,本站与官方无关
豆包工作教程
首页/ 核心功能/多模态生成:让 AI 帮你画图、做视频

多模态生成:让 AI 帮你画图、做视频

AI 不只能写文字,还能生成图片、制作视频、设计海报。文字描述就能出图出视频,不用找设计师,自己几分钟搞定。

一句话总结:AI 不只能写文字,还能生成图片、制作视频、设计海报。文字描述就能出图出视频,不用找设计师,自己几分钟搞定。

图片生成结果

13.1 什么是多模态?

"多模态"听起来很技术,其实很简单:

  • 单模态:只能处理一种信息形式(比如只能处理文字)
  • 多模态:能处理多种信息形式(文字、图片、视频、音频等)

豆包工作的多模态生成能力,就是让 AI 不仅能"写",还能"画"和"演"。

大白话解释

能力 你做什么 AI 做什么
文字生成 用文字描述需求 AI 写出文字(文章、方案、邮件)
图片生成 用文字描述画面 AI 画出图片(海报、插图、封面)
视频生成 用文字描述场景 AI 制作视频(短片、动画、演示)
图文混合 给文字+图片要求 AI 生成图文并茂的内容

🎨 一句话总结:以前你要做一张图,得找设计师、排期、改稿、等三天。现在你用文字描述一下,AI 几分钟就给你出图。

图片生成结果

13.2 图片生成:文字描述就能出图

怎么用?

图片生成的使用非常简单:

  1. 切换到图片生成技能(或在对话中说"帮我画一张图")
  2. 用文字描述你想要的画面
  3. 点击生成,等待几十秒
  4. 得到图片,可以要求调整或重新生成

怎么写图片描述?

图片生成的效果,80% 取决于你的描述写得好不好。一个好的图片描述包含以下要素:

🎯 主体 + 🎨 风格 + 🌈 色彩 + 🖼️ 构图 + ✨ 细节

要素说明

要素 说明 例子
主体 画里有什么 "一个职场女性在电脑前工作"
风格 什么画风 "扁平化插画风格""3D渲染""水彩画""赛博朋克"
色彩 色调和配色 "蓝色主色调,明亮清新""暖色调,温馨感"
构图 画面布局 "居中构图""特写镜头""广角全景"
细节 额外要求 "高清,4K,专业摄影质感,柔和光线"

好描述 vs 差描述

差的描述 好的描述
"帮我画个海报" "一张课程招生海报,主体是一个年轻人在电脑前学习,背景是科技感的数据可视化图案,扁平化插画风格,蓝色主色调,上方留白用于放标题,高清4K"
"画个商务场景" "商务会议场景,3个人围坐在会议桌前讨论,桌上有笔记本电脑和咖啡,现代简约办公室,自然光从窗户照入,专业摄影风格,暖色调"
"做个头像" "一个卡通风格的职场女性头像,短发戴眼镜,微笑表情,蓝色背景,简约扁平化设计,适合做社交头像"

💡 技巧:描述越具体,出图效果越符合预期。不要怕写得多,写得详细 AI 才知道你要什么。

图片生成的典型用途

用途 例子
公众号/文章配图 为文章生成主题插图
海报设计 活动海报、课程海报、招聘海报
PPT配图 为PPT页面生成装饰图或概念图
社交媒体内容 朋友圈配图、小红书封面、抖音封面
产品概念图 快速生成产品原型的视觉概念
头像/图标 个人头像、APP图标、网站favicon
表情包 生成有趣的表情包或梗图

图片生成的注意事项

  1. 生成需要时间:通常一张图需要10-60秒,耐心等待
  2. 可以多次生成:不满意就重新生成,每次结果会略有不同
  3. 可以局部调整:有些工具支持"只改某一部分",比如"把背景换成绿色"
  4. 注意版权:AI 生成的图片版权归属可能有争议,商用前了解清楚
  5. 不要生成违规内容:遵守法律法规和平台规则,不生成违法、侵权、低俗内容

图片生成结果

13.3 视频生成:从脚本到成片

视频生成是比图片生成更强大的能力。AI 可以根据文字描述,直接生成一段视频。

视频生成的方式

方式一:文字生成视频

你用文字描述一个场景,AI 直接生成视频。

例子: "一个现代办公室场景,阳光从窗户照进来,一个职场女性在电脑前专注工作,镜头缓慢推进,温暖的色调,电影质感"

AI 会生成一段5-10秒的视频片段。

方式二:图片生成视频

你提供一张图片,AI 让图片"动起来"。

例子: - 上传一张产品海报,AI 生成一个产品展示动画 - 上传一张人物照片,AI 生成一个说话的头像视频 - 上传一张风景照,AI 生成一个镜头移动的风景视频

方式三:脚本生成完整视频

你提供一个视频脚本(包含分镜、台词、画面描述),AI 自动生成完整视频。

例子

视频主题:大圣AI办公实战课宣传片
时长:30秒
分镜1(0-5秒):一个职场人疲惫地面对堆积如山的文件,叹气
分镜2(5-10秒):他打开豆包工作,输入指令,AI 开始工作
分镜3(10-20秒):快速蒙太奇——AI 写文档、做表格、生成PPT、画图
分镜4(20-25秒):职场人轻松喝咖啡,工作全部完成
分镜5(25-30秒):课程logo和slogan"8周速成,AI办公达人"

AI 根据这个脚本生成完整的30秒宣传片。

视频生成的典型用途

用途 例子
产品宣传视频 快速制作产品介绍短片
社交媒体短视频 抖音、视频号、小红书短视频
课程宣传片 在线课程的招生宣传视频
演示动画 产品功能演示、流程说明动画
会议开场视频 年会、发布会的开场短片
教育培训视频 知识点讲解动画、教学视频

视频生成的注意事项

  1. 时长有限:目前 AI 视频生成通常是短视频(5-30秒),长视频需要拼接
  2. 质量在进步:AI 视频质量日新月异,但还达不到专业影视级别的水准
  3. 生成时间长:一段视频可能需要几分钟到十几分钟生成
  4. 消耗额度多:视频生成比图片和文字消耗更多额度,省着用
  5. 适合"够用就行"的场景:内部演示、社交媒体、快速原型,对质量要求不高的场景

图片生成结果

13.4 实战案例:为AI培训教案做视觉物料

我们用「AI培训教案」来演示一套完整的多模态生成流程。

任务:为大圣AI办公实战课制作一套视觉物料

需要的物料: 1. 课程封面图(用于网站和公众号) 2. 招生海报(用于朋友圈和社群传播) 3. 30秒宣传片(用于视频号和抖音)

步骤一:生成课程封面图

图片描述

一张在线教育课程封面图,主体是一个现代职场人坐在电脑前,屏幕上显示AI对话界面,周围漂浮着文档、表格、图表等办公元素,扁平化插画风格,蓝色和紫色渐变主色调,科技感但不冰冷,上方留白用于放课程标题,高清4K,专业设计质感

生成后调整: - "整体色调再亮一些" - "人物换成女性" - "办公元素再丰富一些,加个PPT图标"

步骤二:生成招生海报

图片描述

一张课程招生海报,竖版比例,上方是大标题区域(留白),中间是一个职场人轻松微笑的插画,周围环绕着"效率提升300%""8周速成""零基础友好"等文字标签,下方是报名二维码区域(留白),扁平化插画风格,橙色和蓝色撞色设计,活力感,适合朋友圈传播,高清

生成后:用图片编辑工具(或让 AI 帮忙)加上具体的文字内容和二维码。

步骤三:生成30秒宣传片

视频脚本

主题:大圣AI办公实战课宣传片
风格:轻松幽默,快节奏
音乐:轻快活泼的电子音乐

分镜1(0-3秒):
画面:一个职场人面对堆积如山的文件,抓头发,表情崩溃
字幕:每天被工作淹没?
旁白:你是不是每天都被重复的工作压得喘不过气?

分镜2(3-6秒):
画面:他打开豆包工作,眼睛一亮
字幕:直到遇到了它
旁白:直到你遇到了豆包工作。

分镜3(6-15秒):
画面:快速蒙太奇——AI写文档、做表格、生成PPT、画图、发邮件,每个画面1-2秒
字幕:写文档 / 做表格 / 生成PPT / 画图 / 发邮件
旁白:写文档、做表格、生成PPT、画图、发邮件,AI全包了。

分镜4(15-20秒):
画面:职场人轻松喝咖啡,电脑屏幕显示"全部完成"
字幕:效率提升300%
旁白:效率提升300%,准时下班不是梦。

分镜5(20-27秒):
画面:课程界面展示,8周课程大纲快速闪过
字幕:8周速成 / 零基础友好 / 岗位定制
旁白:8周速成,零基础友好,财务、HR、销售、项目管理、售前,五大岗位定制内容。

分镜6(27-30秒):
画面:课程logo和报名二维码
字幕:大圣AI办公实战课,立即报名
旁白:大圣AI办公实战课,立即报名,开启你的AI办公之旅!

AI 根据脚本生成视频,然后你可以: - 调整画面风格 - 更换背景音乐 - 添加字幕和特效 - 导出为不同格式

最终成果

一套完整的视觉物料: - 🖼️ 课程封面图(1张) - 📱 招生海报(1张) - 🎬 30秒宣传片(1个)

总耗时:不到1小时。 以前找设计师做这套,至少要一周,花费几千块。

图片生成结果

13.5 多模态生成的进阶技巧

技巧一:参考图引导

如果你有一张喜欢的图片,可以作为"参考图"上传,让 AI 模仿它的风格和构图。

用法: 1. 上传参考图 2. 说"参考这张图的风格,生成一张[你的需求]" 3. AI 会模仿参考图的画风、色调、构图

效果:比纯文字描述更精准,因为 AI 能"看到"你想要的风格。

技巧二:分步生成

复杂的图片/视频不要一次生成,分步来:

  1. 先生成主体(比如人物)
  2. 再生成背景
  3. 最后合成和调整

或者: 1. 先生成草图/概念图 2. 确认方向后再生成高清图 3. 最后做细节调整

技巧三:批量生成+挑选

不要指望一次就生成完美的。每次生成3-5张,从中挑最好的,然后基于最好的那张做调整。

流程: 1. 生成4张不同版本 2. 挑选最满意的1张 3. 基于这张做细节调整("颜色再亮一点""人物再靠左一点") 4. 最终确认

技巧四:文字叠加用专业工具

AI 生成的图片上如果有文字,经常会出现"乱码"或"错别字"。建议: - AI 生成图片时留白,不要让 AI 在图上写字 - 生成后用 PPT、Canva、Photoshop 等工具手动加文字 - 这样文字准确、排版可控

图片生成结果

13.6 常见问题

Q:AI 生成的图片可以商用吗?

A:这取决于平台的用户协议和当地法律法规。一般来说,平台会授予用户一定的使用权,但具体权利范围需要看协议。商用前建议仔细阅读用户协议,必要时咨询法律专业人士。

Q:生成的图片模糊怎么办?

A:可以在描述中加"高清、4K、高分辨率、细节丰富"等关键词。如果还是模糊,可以用图片放大工具(有些平台内置了高清放大功能)处理。

Q:可以生成特定人物的图片吗?

A:不建议生成真实人物(尤其是公众人物)的图片,可能涉及肖像权问题。可以生成"虚构的职场人物",不要指定真实姓名。

Q:视频生成的声音是AI配音吗?

A:有些平台支持 AI 配音,你可以选择不同的音色(男声、女声、童声、各种方言)。有些平台只生成画面,需要你自己配音和加音乐。

Q:生成的图片/视频存在哪里?

A:通常保存在豆包工作的项目中,可以随时查看和下载。也可以设置自动保存到本地或云存储。

图片生成结果

13.7 本章小结

  • 多模态生成让 AI 不仅能写文字,还能生成图片和视频
  • 图片生成:用文字描述画面(主体+风格+色彩+构图+细节),AI 几分钟出图
  • 视频生成:三种方式——文字生成视频、图片生成视频、脚本生成完整视频
  • 典型用途:海报、封面、配图、宣传片、短视频、演示动画
  • 实战案例:为AI培训教案生成封面图+海报+30秒宣传片,1小时搞定
  • 进阶技巧:参考图引导、分步生成、批量生成挑选、文字手动叠加
  • 注意事项:版权问题、生成时间、额度消耗、不要生成违规内容

图片生成结果

13.8 下一章预告

多模态生成让你的内容"颜值在线",接下来我们要学习一个每天都用得上的能力——文档/表格/PPT与精准编辑。AI 不只能从零生成,还能帮你精准修改已有文件。

👉 第14章:文档/表格/PPT与精准编辑 →

来源:豆包工作实战指南(MIT) · 原文路径 guide/core-features/multimodal.md
整理:疯狂的豇豆 · 本站为非官方二次整理,查看完整来源清单
🤖 GEO 问答 · 生成式引擎优化

❓ 什么是多模态生成:让 AI 帮你画图、做视频?

AI 不只能写文字,还能生成图片、制作视频、设计海报。文字描述就能出图出视频,不用找设计师,自己几分钟搞定。

❓ 什么是多模态?

"多模态"听起来很技术,其实很简单:

❓ 如何理解图片生成:文字描述就能出图?

图片生成的使用非常简单:

❓ 如何理解视频生成:从脚本到成片?

视频生成是比图片生成更强大的能力。AI 可以根据文字描述,直接生成一段视频。