← 返回文档
项目文档 ·

第四章:多模态内容生成

学习使用 AI 生成图片、音频与视频,并组合成完整内容工作流。

4.1 什么是多模态

一句话解释

多模态就是"多种感官形式"——文字是一种模态,图片、音频、视频也是。AI 现在能同时理解和生成这些不同形式的内容。

为什么多模态重要

  1. 表达更丰富:有些东西用图片比文字更直观

  2. 传播更有效:社交媒体上,图文视频的互动率远高于纯文字

  3. 创作更高效:AI 能帮你快速生成各种素材


4.2 AI 图像生成

主流模型

不同模型对应的提示词写作技巧有所差异

模型特点适合场景
image2OpenAI 出品,与 ChatGPT 集成截止撰稿日最强生图模型
Nano banana谷歌出品,图片编辑能力强AI 修图改图
Seedream字节出品、豆包集成国产平替

图像 Prompt 的写法

基本结构[主体] + [场景] + [风格]

示例

一位女大学生在图书馆学习,日系动漫风格,温暖的阳光从窗户洒进来, 桌上摆满了书和咖啡,采用特写镜头,温馨治愈的氛围 画面不追求太多细节,但是要求高清

图片 Prompt 的 5 个技巧

  1. 具体描述:不要说"一个女孩",要说"一位扎着马尾、穿着白色T恤的亚洲女孩"

  2. 指定风格:明确告诉 AI 你想要什么画风

  3. 控制构图:使用"特写"、"全景"、"俯视"等词汇

  4. 设置氛围:用"温暖"、"神秘"、"活力"等词汇

  5. 参考作品:可以说"类似宫崎骏的风格"

或许你并不需要从零开始

- 使用别人测试过的提示词

  • 一个10k star的提示词模版库

Awesome GPT Image 2 提示词模板库

  • 表情包生成示例:

图片主体:企鹅女孩,面部特征,上半身或全身。 情绪:各种夸张的表情和动作,包括:开心、大笑、惊讶、发火、大哭,思考,躺平,疲惫、嘲笑等。 风格:手绘插画风格, 画质:精致的细节,高清,4k。 图片布局:九宫格,每个格子一个头像,对应一种情绪,不显示网格线,白色背景。旁边加点小点缀。原比例。

下载一些风格skill

  • 一个生成文章和配文插图的小黑配图skill:

Ian 小黑配图 Skill

  • 一个把主题、句子、物件、情绪、文章构想、照片或内容简报,转化为一张安静、极简的 ZINE 风格编辑海报的skill

GC Minimal Zine Poster Skill

风格 Skill 的视觉桥梁示意图风格 Skill 的参考信息流示意图

添加参考图片

添加图片可以用来 反推提示词 ,也可以用来直接在图片上进行修改

一张写实风格的照片,场景是一个工作室电脑桌。桌面上放着1/7比例的商业化手办,姿势与原图一致,做工精细,材质逼真。电脑显示器屏幕上显示C4D的3D建模界面,内容是该手办的模型。电脑旁边摆放一个Bandai风格的塑料包装盒,上面印有原画。桌面上散落着画笔、美工刀、雕刻刀和颜料罐,整体环境充满手办制作的真实氛围。灯光自然,环境写实,仿佛真实摄影作品。

  • 反推提示词(来自@宝玉老师)

你在非常牛的图片但是不知道怎么写这个提示词的时候,就可以通过反推提示词的方式,让AI将画面中的元素提取出来,教你怎么写这样的提示词。

Provide a detailed and comprehensive JSON prompt describing all aspects necessary for accurately replicating the original image. Include specifics about objects, clothing, hairstyles, intricate details, accessories, photographic equipment, environment, lighting, style, body poses, and any other relevant elements, ensuring that every detail of the original image can be precisely recreated.

我认为你需要知道

如果你认为生成的图片你不是很满意,最好的方式是新开一个对话,修改提示词并重新尝试,而不是在一个上下文丰富的会话当中反复尝试。(不同工具可能有不同的效果)


4.3 AI 音频工具

主流工具

工具功能适合场景
ChatGPT Voice语音对话日常交流、口语练习
MiniMax 语音、Mimo TTS语音克隆、TTS配音、播客
Suno、海螺 AIAI 音乐生成创作歌曲、背景音乐
通义听悟语音转文字会议记录、学习笔记

这里推荐大家体验 MiMo V2.5 TTS 家族,包含

  • TTS:内置多种音色,支持自然语言、音频标签控制音频情绪

  • TTS-VoiceDesign:通过自然语言描述音色,可以定制专属音色

  • TTS-VoiceClone:上传或录制一段音频来克隆声音


4.4 AI 视频生成

主流模型与工具

模型特点
Sora(OpenAI)OpenAI 出品,现在已停止服务
Seedance(字节跳动)国内领先的视频生成模型,中文理解能力强
可灵(快手)国内非常有影响力的视频生成模型

LibTV,TapNow 等产品提供了“无限画布”的功能,是商业化AI短剧团队常用的视频生成工具。他们提供的是一个平台,可以调用不同的模型,生成并管理多模态内容。如果你感兴趣的话可以搜搜看。

AI 视频故事板画布AI 视频生成工作区

生成方式

文生视频方便创意实现,但不好保持画面一致性,不适合长视频
图生视频参考图 + 提示词,最常见的生成方式
视频生视频视频修改

视频生成的基本流程

脚本 → 分镜 → 素材生成 → 剪辑合成 → 字幕包装导出

在制作视频以前,先生成好参考图片,通过参考图+提示词的方式生成图片。

  • 对于有剧本的长视频来说,前后一致性非常重要,你在第一个镜头中用一个八岁的男孩,寸头生成的男孩的样子,在后续镜头中不可能完全一致。

  • 图片生成的价格较低,而视频抽卡的成本很高。在生成视频之前通过图片约束好画面当中的内容,可以降低抽卡次数,有效节省人民币。

  • 在视频生成时如果发现产出结果有字幕等包装内容,可以在提示词当中将这些元素标记为“严禁添加”。AI在视频当中直接生成的“包装内容”几乎不可用,在剪辑完成之后,我们再通过剪映等剪辑工具单独添加。

  • 包括有一些模型在生成视频的时候喜欢添加背景音乐,可以通过提示词约束严禁添加背景音乐

  • 在前期素材生成阶段,将场景、道具、人物等分开来制作,再通过“搭积木”的方式将各种素材组合在一起

背景主角合成
  • 先生成人物样貌,然后再生成人物三视图,可以尽可能的“约束”住人物长相
全身参考图三视图
场景 1场景 2

4.5 多模态内容组合

工作流示例:制作一段 30 秒的多模态内容

  1. 写脚本:用 Deepseek 生成一段 30 秒的解说词

  2. 生成图片与视频:用 Seedream 生成 3-4 张参考图,再使用 Seedance 生成视频

  3. 生成语音:用 TTS 将解说词转为语音

  4. 合成视频:用剪映将视频和语音合成为视频

  5. 添加字幕:用剪映的 AI 字幕功能

  6. 制作海报:使用AI绘图、canvas等能力制作视频的封面和海报

本章总结

模态工具关键技能
图像image2/SeedreamPrompt 写法、风格控制
音频Suno / TTS语音合成、音乐生成
视频Sora / Pika / 剪映脚本、分镜、剪辑
组合多工具协作产出完整项目

课后作业

  1. 用 AI 生成一组(4 张)统一风格的图片,主题自选

  2. 制作一段 30 秒的多模态内容(图 + 文 + 音)

  3. 用 Markdown 记录你的创作过程和使用的工具