AI学习中心 / 第13课
零基础课程 · 约25分钟

第13课:Multimodal 与 AIGC

学习目标 → 正文 → 示例 → 常见误区 → 小测验 → 实践任务

学习目标

  • 理解多模态和AIGC的基本含义
  • 知道生成内容类型与输入模态可以组合
  • 认识AIGC发布前的真实性、版权和隐私问题

正文

Multimodal

Multimodal = 多模态。 Mode/Modality 可以理解为“信息形式”。

常见模态:

  • 文本
  • 图片
  • 音频
  • 视频

多模态模型可以同时理解两种或更多信息形式。

AIGC

AIGC = Artificial Intelligence Generated Content 中文通常称“人工智能生成内容”。

它包括:

  • AI写作
  • AI绘画
  • AI音乐
  • AI语音
  • AI视频
  • AI代码

一个关键区别

“能生成”不等于“可以不核验直接发布”。 商业、学术、新闻、法律、医疗等场景,都要关注真实性、版权、隐私和责任。

1. 本课要建立的整体认识

多模态强调对文字、图像、音频、视频等多种信息形式的联合处理;AIGC强调由AI生成内容,二者有交集但并不相同。

2. 把核心概念逐层拆开

2.1 同一对象在不同模态中表达的信息不同

同一对象在不同模态中表达的信息不同,图片提供空间与外观,语音提供声音与语气,文字适合精确描述。

2.2 多模态系统需要完成编码、对齐和融合

多模态系统需要完成编码、对齐和融合,确保不同信息指向同一对象或事件。

2.3 AIGC的生产流程仍需要选题、资料、提示、生成、编辑、核验、授权和发布。

AIGC的生产流程仍需要选题、资料、提示、生成、编辑、核验、授权和发布。

2.4 内容质量不仅看好不好看

内容质量不仅看好不好看,还看事实、逻辑、受众、可访问性、版权和一致性。

2.5 深度伪造、人物肖像、声音克隆和未授权素材具有明显伦理与法律风险。

深度伪造、人物肖像、声音克隆和未授权素材具有明显伦理与法律风险。

3. 把概念串成一条完整流程

制作多模态课程内容时,可先以权威资料形成文字脚本,再生成图示或拍摄素材,使用TTS或真人配音,最后把字幕、画面和口播逐项对齐并人工审看。

4. 用真实场景理解

一张AI生成的实验装置图可以用于概念示意,但不能当作真实实验照片;生成的人物访谈也不能冒充真实受访者。这是“辅助表达”和“伪造证据”的边界。

5. 学习时应该怎样判断自己是否真正理解

不要只看自己是否“听过”这些词。请尝试不用原文,向一位没有技术背景的人解释本课概念;再画出关系或流程;最后换一个与你专业相关的例子。如果无法说明输入、处理、输出、依据和风险,就说明还停留在名词记忆阶段。

遇到模型、工具或规则变化时,优先保留这里学到的判断框架:先定义任务,再确认资料与边界,随后执行、测试和核验。具体品牌和界面会变化,但这种工作方法可以持续使用。

6. 本课小结

本课不是要求一次记住全部细节,而是建立一个能够继续扩展的知识框架。完成正文后,请结合后面的示例、测验和实践任务,把理解转化成自己的语言和可检查的成果。

7. 进一步拆解:从“知道名词”到“会做判断”

学习技术概念时,最容易出现的问题是记住了定义,却不知道什么时候使用,也不知道怎样发现错误。下面逐项使用同一组问题检查理解:

  • 同一对象在不同模态中表达的信息不同:继续追问它接收什么输入、产生什么输出、依据从哪里来、失败时会出现什么现象、由谁负责复核。把这五个问题写出来,概念就会从一句定义变成可用于真实工作的判断工具。
  • 多模态系统需要完成编码、对齐和融合:继续追问它接收什么输入、产生什么输出、依据从哪里来、失败时会出现什么现象、由谁负责复核。把这五个问题写出来,概念就会从一句定义变成可用于真实工作的判断工具。
  • AIGC的生产流程仍需要选题、资料、提示、生成、编辑、核验、授权和发布。:继续追问它接收什么输入、产生什么输出、依据从哪里来、失败时会出现什么现象、由谁负责复核。把这五个问题写出来,概念就会从一句定义变成可用于真实工作的判断工具。
  • 内容质量不仅看好不好看:继续追问它接收什么输入、产生什么输出、依据从哪里来、失败时会出现什么现象、由谁负责复核。把这五个问题写出来,概念就会从一句定义变成可用于真实工作的判断工具。
  • 深度伪造、人物肖像、声音克隆和未授权素材具有明显伦理与法律风险。:继续追问它接收什么输入、产生什么输出、依据从哪里来、失败时会出现什么现象、由谁负责复核。把这五个问题写出来,概念就会从一句定义变成可用于真实工作的判断工具。

8. 建立自己的操作检查表

第一张是“任务表”:写清服务对象、目标、已有材料、最终交付物和完成标准。第二张是“数据与来源表”:记录每项材料从哪里来、何时获得、是否允许使用、是否需要更新。第三张是“执行表”:把任务拆成可以观察状态的步骤,标明每一步的输入、处理、输出和失败提示。第四张是“核验表”:列出必须人工检查的事实、数字、引用、权限、安全和专业边界。

这四张表适用于本课所讲的大多数任务。它们能防止把“模型给出了结果”误认为“工作已经完成”,也能帮助团队在出现问题时迅速定位到底是需求不清、资料错误、流程中断,还是输出没有经过验证。

9. 与前后课程的关系

这套20课不是彼此孤立的知识点。本课涉及的概念,需要与Prompt中的任务说明、API与软件系统中的执行链、RAG中的资料依据、数据分析中的质量检查以及AI安全中的责任边界结合起来。学习时可以不断回到一个问题:如果把这个概念放进完整AI产品,它位于哪一层,会影响谁,又需要谁来检查?

10. 课后自查

  1. 我能否不用术语堆砌,用自己的话解释本课核心关系?
  2. 我能否画出一个包含输入、处理、输出和核验的流程?
  3. 我能否举出一个与自己专业、学习或工作有关的实例?
  4. 我能否说出至少两个容易犯的错误,以及怎样提前发现?
  5. 我能否把本课方法用于一个真实任务,并留下可检查的成果?

示例

示例1:图文问答

上传设备照片并用文字询问部件功能,模型同时处理图片和文本。

结论:多模态强调不同信息形式共同处理。

示例2:AI视频脚本到画面

先用语言模型写脚本,再用图像/视频模型生成素材。

结论:AIGC常是多个模型和流程的组合。

常见误区

  • “AIGC只指AI写文章。”——还包括图片、音频、视频、代码等。
  • “生成内容没有版权和合规问题。”——发布和商用要考虑来源、规则和权利。
  • “多模态模型看到图片就一定理解全部细节。”——仍可能遗漏或误判。

小测验

点击题目查看答案。

1. AIGC 的英文全称是什么?
  1. A. Artificial Intelligence Generated Content
  2. B. Automatic Internet Graphic Code
  3. C. Advanced Image General Control
  4. D. Artificial Integrated Global Chat
答案:A

AIGC = Artificial Intelligence Generated Content。

2. 下面哪项属于多模态场景?
  1. A. 只输入一段文字
  2. B. 上传图片并同时用文字提问
  3. C. 只打开数据库
  4. D. 只改文件名
答案:B

图片+文字属于两种模态联合处理。

3. AI生成内容发布前需要关注什么?
  1. A. 只看画面是否好看
  2. B. 真实性、版权、隐私和使用规则
  3. C. 只看文件大小
  4. D. 只看生成速度
答案:B

AIGC仍需承担真实世界中的内容责任和合规要求。

实践任务

设计一个AIGC工作流

设计“文章→配图→配音→短视频”的AI内容流程,写明每步输入、输出和人工检查点。

提交物:流程表。

完成标准

  • 至少4步
  • 包含人工检查
  • 覆盖两种以上模态