学习目标
- 理解AI、ML、DL三者的包含关系
- 知道机器学习与传统规则程序的不同
- 了解深度学习为什么适合复杂模式
正文
ML
ML = Machine Learning = 机器学习。
传统程序通常是: 规则 + 数据 → 结果。
机器学习更像: 大量数据 + 正确答案/反馈 → 学到规律 → 用规律处理新数据。
例子: 给模型很多“垃圾邮件/正常邮件”,让它学习两类邮件的特征,再判断新邮件。
DL
DL = Deep Learning = 深度学习。 Deep = 深;Learning = 学习。
深度学习是机器学习中的一类方法,核心工具是多层神经网络。
三层关系
AI(人工智能) → ML(机器学习) → DL(深度学习)
不是所有AI都必须是机器学习,也不是所有机器学习都必须用深度学习。
为什么大模型和深度学习有关?
今天的大语言模型、图像模型、语音模型,大多建立在深度学习技术基础上。
1. 本课要建立的整体认识
AI、机器学习和深度学习是包含关系:AI是目标与领域,机器学习是让系统从数据学习规律的一类方法,深度学习是以多层神经网络为核心的机器学习分支。
2. 把核心概念逐层拆开
2.1 传统规则程序由人明确写出判断条件
传统规则程序由人明确写出判断条件,适合边界清楚、规则稳定的问题。
2.2 机器学习通过样本学习输入与输出之间的规律
机器学习通过样本学习输入与输出之间的规律,效果高度依赖数据、标签和评价方式。
2.3 监督学习使用带答案的数据
监督学习使用带答案的数据,无监督学习寻找结构,强化学习通过行动与反馈改进策略。
2.4 深度学习擅长从复杂数据中学习表示
深度学习擅长从复杂数据中学习表示,但通常需要更多数据、计算和工程控制。
2.5 选择方法应从任务、数据、成本和风险出发
选择方法应从任务、数据、成本和风险出发,不应因为“深度”听起来先进就默认更合适。
3. 把概念串成一条完整流程
一个机器学习项目包括:定义任务→收集并理解数据→划分训练/验证/测试集→选择基线→训练→评价→误差分析→部署→持续监测。测试集不能反复用于调参,否则会失去客观评价作用。
4. 用真实场景理解
垃圾邮件识别可以先用人工规则,也可以用机器学习。规则便于解释但维护困难;机器学习能适应复杂模式,却可能受偏差数据影响。实际系统常把两者结合。
5. 学习时应该怎样判断自己是否真正理解
不要只看自己是否“听过”这些词。请尝试不用原文,向一位没有技术背景的人解释本课概念;再画出关系或流程;最后换一个与你专业相关的例子。如果无法说明输入、处理、输出、依据和风险,就说明还停留在名词记忆阶段。
遇到模型、工具或规则变化时,优先保留这里学到的判断框架:先定义任务,再确认资料与边界,随后执行、测试和核验。具体品牌和界面会变化,但这种工作方法可以持续使用。
6. 本课小结
本课不是要求一次记住全部细节,而是建立一个能够继续扩展的知识框架。完成正文后,请结合后面的示例、测验和实践任务,把理解转化成自己的语言和可检查的成果。
7. 进一步拆解:从“知道名词”到“会做判断”
学习技术概念时,最容易出现的问题是记住了定义,却不知道什么时候使用,也不知道怎样发现错误。下面逐项使用同一组问题检查理解:
- 传统规则程序由人明确写出判断条件:继续追问它接收什么输入、产生什么输出、依据从哪里来、失败时会出现什么现象、由谁负责复核。把这五个问题写出来,概念就会从一句定义变成可用于真实工作的判断工具。
- 机器学习通过样本学习输入与输出之间的规律:继续追问它接收什么输入、产生什么输出、依据从哪里来、失败时会出现什么现象、由谁负责复核。把这五个问题写出来,概念就会从一句定义变成可用于真实工作的判断工具。
- 监督学习使用带答案的数据:继续追问它接收什么输入、产生什么输出、依据从哪里来、失败时会出现什么现象、由谁负责复核。把这五个问题写出来,概念就会从一句定义变成可用于真实工作的判断工具。
- 深度学习擅长从复杂数据中学习表示:继续追问它接收什么输入、产生什么输出、依据从哪里来、失败时会出现什么现象、由谁负责复核。把这五个问题写出来,概念就会从一句定义变成可用于真实工作的判断工具。
- 选择方法应从任务、数据、成本和风险出发:继续追问它接收什么输入、产生什么输出、依据从哪里来、失败时会出现什么现象、由谁负责复核。把这五个问题写出来,概念就会从一句定义变成可用于真实工作的判断工具。
8. 建立自己的操作检查表
第一张是“任务表”:写清服务对象、目标、已有材料、最终交付物和完成标准。第二张是“数据与来源表”:记录每项材料从哪里来、何时获得、是否允许使用、是否需要更新。第三张是“执行表”:把任务拆成可以观察状态的步骤,标明每一步的输入、处理、输出和失败提示。第四张是“核验表”:列出必须人工检查的事实、数字、引用、权限、安全和专业边界。
这四张表适用于本课所讲的大多数任务。它们能防止把“模型给出了结果”误认为“工作已经完成”,也能帮助团队在出现问题时迅速定位到底是需求不清、资料错误、流程中断,还是输出没有经过验证。
9. 与前后课程的关系
这套20课不是彼此孤立的知识点。本课涉及的概念,需要与Prompt中的任务说明、API与软件系统中的执行链、RAG中的资料依据、数据分析中的质量检查以及AI安全中的责任边界结合起来。学习时可以不断回到一个问题:如果把这个概念放进完整AI产品,它位于哪一层,会影响谁,又需要谁来检查?
10. 课后自查
- 我能否不用术语堆砌,用自己的话解释本课核心关系?
- 我能否画出一个包含输入、处理、输出和核验的流程?
- 我能否举出一个与自己专业、学习或工作有关的实例?
- 我能否说出至少两个容易犯的错误,以及怎样提前发现?
- 我能否把本课方法用于一个真实任务,并留下可检查的成果?
示例
示例1:垃圾邮件分类
给模型许多已标注邮件,让它学习特征并分类新邮件。
结论:机器学习从数据中学习规律。
示例2:图像识别
深度神经网络可从大量图片中逐层学习复杂视觉特征。
结论:深度学习擅长高维复杂数据。
常见误区
- “AI、ML、DL是三个互不相关领域。”——通常可理解为AI包含ML,ML包含DL。
- “机器学习不需要数据。”——数据通常是核心。
- “深度学习一定比所有传统方法好。”——任务、数据、成本不同,选择也不同。
小测验
点击题目查看答案。
1. 常见的包含关系是哪一个?
- A. DL包含AI
- B. AI包含ML,ML包含DL
- C. ML包含AI
- D. 三者完全相同
常见入门关系是 AI → ML → DL。
2. 机器学习和传统规则程序的主要差别之一是什么?
- A. 机器学习可以从数据中学习规律
- B. 机器学习不能处理数据
- C. 规则程序必须有GPU
- D. 机器学习没有输出
机器学习的核心特点之一是通过数据学习模式。
3. 深度学习中的“Deep”主要指什么?
- A. 文件很大
- B. 神经网络有多层表示
- C. 网页颜色深
- D. 服务器在地下
“深”通常指多层神经网络结构。
实践任务
找三个机器学习场景
从校园生活中找3个可能使用机器学习的场景,写出输入数据、目标输出和需要的训练样例。
提交物:3个场景表。
完成标准
- 每个场景有输入和输出
- 至少说明训练数据
- 场景可验证