学习目标
- 理解 LLM、Token、Context 的基础概念
- 知道模型API调用与自己训练模型的区别
- 理解上下文窗口为什么会影响长文档处理
正文
1. LLM 是什么?
LLM = Large Language Model = 大语言模型
拆开看:
Large = 大型 Language = 语言 Model = 模型
它是一类能够处理和生成语言的大规模模型。
你现在使用的很多AI聊天能力,都建立在大语言模型上。
2. 为什么叫“语言模型”?
语言模型做的一件核心事情是:
根据已经出现的内容,计算接下来什么内容更合适。
最简单地想:
“今天天气很好,我准备去……”
人会自然想到:
散步、跑步、公园、旅行……
语言模型也会根据大量学习过的语言规律,判断什么内容更可能继续出现。
当然,现代大语言模型远比这个例子复杂。
它不仅能续写,还能:
- 回答问题;
-总结; -翻译; -写代码; -分析结构; -进行一定程度的推理; -根据指令生成内容。
3. 模型是怎样获得这些能力的?
可以先分成两个阶段:
Training:训练
模型接触大量数据,通过计算不断调整内部参数。
训练需要大量: -数据; -算力; -时间; -算法。
Inference:推理
模型训练完成以后,用户输入新内容,模型产生回答。
你在AI网站里聊天,大多数时候是在使用:
推理阶段。
这也是为什么:
你的网站服务器不需要自己拥有训练大模型的全部GPU。
网站可以通过API调用模型厂商的推理服务。
4. Token 到底是什么?
Token 是模型处理文本时使用的基本单元。
它不是固定等于:
一个字 一个词 一个英文单词
具体怎样切分,取决于模型的分词方式。
例如一句:
“我正在学习人工智能”
在模型内部可能被拆成若干Token。
英文、数字、标点也都会占用Token。
5. 为什么需要关心Token?
因为Token影响三个重要事情。
第一:上下文容量
模型一次能处理的信息是有限的。
第二:速度
输入越长、输出越长,通常需要更多计算。
第三:成本
很多模型API会按照输入和输出Token数量计费。
所以做AI产品时,不只是“能不能回答”。
还要考虑:
每次回答用了多少上下文和Token。
6. Context 是什么?
Context = 上下文。
可以把它想成:
AI当前桌面上能够看到的全部材料。
例如:
-系统指令; -你的问题; -前面的聊天记录; -上传文件; -RAG检索出来的资料; -Agent生成的阶段结果。
模型只能基于它“当前能够看到”的内容生成回答。
7. 什么是上下文窗口?
模型一次能够处理的Token数量有上限。
这个范围就叫:
Context Window 上下文窗口
可以把它想成一张有限大小的办公桌。
资料太少:
信息不够。
资料太多:
桌面放不下。
因此长文档处理往往需要:
-切分; -摘要; -检索; -分批处理; -建立知识库。
8. 为什么不能把整个知识库全部塞给模型?
假设大学知识库未来有:
几万篇资料。
用户只问:
“机械工程学生做无人机结构设计,需要哪些基础知识?”
如果把所有专业知识都塞给模型:
-成本高; -速度慢; -噪声多; -上下文可能超限。
更好的方法是:
先检索和问题最相关的内容。
例如找到:
机械设计 材料力学 工程制图 无人机结构 相关竞赛规则
然后只把这些资料放进上下文。
这就是RAG为什么重要。
9. Prompt、Context、Knowledge Base是什么关系?
可以这样理解:
Prompt
你对AI说什么。
Context
AI当前能看到什么。
Knowledge Base
系统长期保存了什么知识。
用户提出问题后:
问题 → 系统去知识库检索 → 把相关内容加入Context → 再调用模型
所以:
知识库 ≠ 上下文
知识库可能很大。
上下文只是这一次任务真正拿出来使用的一部分。
10. 什么是模型API?
API让你的程序可以调用外部模型。
流程:
CampusAI → 后端 → 模型API → 大语言模型 → 返回结果
用户不需要直接进入模型厂商网站。
CampusAI可以在自己的工作区里调用模型。
这样还可以加入:
-项目数据; -专业知识; -权限; -Agent; -Token管理; -结果保存。
11. 为什么一个AI产品可能支持多个模型?
不同模型可能在这些方面不同:
-中文; -代码; -速度; -价格; -长文本; -图像; -推理; -稳定性。
所以好的产品架构通常不会把自己完全锁死在一个模型上。
可以建立:
Model Gateway 模型网关
然后不同任务使用不同模型。
比如:
普通问答 → 成本较低模型
复杂研究 → 更强模型
图像任务 → 多模态模型
这就是产品层的价值。
12. 什么是“幻觉”?
AI生成了:
听起来很合理, 但实际不存在或不正确的内容。
这通常被称为:
Hallucination 幻觉
例如: -虚构论文; -错误作者; -错误法规; -错误统计数字; -不存在的网站。
出现这种情况并不意味着“AI完全没用”。
正确做法是:
把AI适合做的工作交给AI,把必须核验的事实交给来源。
13. 什么时候特别需要来源?
这些信息最好都不要只依赖模型记忆:
-法律法规; -政策; -比赛日期; -报名条件; -价格; -产品参数; -医学信息; -统计数据; -新闻; -论文文献。
应该结合:
搜索 官方资料 知识库 用户文件
来回答。
14. 一个完整例子:CampusAI查竞赛规则
用户问:
“2026年某竞赛什么时候报名?”
错误流程:
问题 → 直接问模型 → 模型凭记忆回答
更可靠流程:
问题 → 判断这是动态信息 → 检索竞赛官方资料 → 找到2026通知 → 把通知相关段落加入Context → 模型总结 → 显示来源
这就是:
模型能力 + RAG + 来源管理
15. 本课总结
你现在应该能够解释这几个词之间的关系:
LLM 是大语言模型。
Token 是模型处理文本的基本单元。
Context 是模型当前能参考的内容。
Context Window 是一次能够处理内容的容量范围。
Model API 是程序调用模型能力的接口。
如果把它们串起来:
程序通过API把Prompt和Context发给LLM → LLM处理Token → 生成结果 → 程序再把结果返回用户
这就是很多AI应用背后的基本流程。
示例
示例1:长PDF为什么要分段
一本几百页资料无法一次全部塞进模型上下文,就需要分块、检索、总结或多轮处理。
结论:上下文不是无限的。
示例2:调用DeepSeek
网站把用户问题通过模型API发送给已训练好的模型并获得回复。
结论:API调用属于推理使用,不等于自己训练模型。
常见误区
- “Token就是一个汉字。”——Token是模型内部的文本处理单元,和字数不是固定一一对应。
- “上下文越长一定越好。”——更长会增加成本和噪声,还需要选择相关信息。
- “调用模型API等于拥有模型。”——API通常只是远程使用能力。
小测验
点击题目查看答案。
1. LLM 的英文全称是什么?
- A. Large Language Model
- B. Long Logic Machine
- C. Local Learning Mode
- D. Language Link Module
LLM = Large Language Model,大语言模型。
2. Token 最接近下面哪种理解?
- A. 固定等于一个汉字
- B. 模型处理文本时使用的基本单元
- C. 数据库表
- D. 图片像素
Token 是模型处理文本的基本单元,不固定等于字或词。
3. Context 在大模型中通常指什么?
- A. 模型当前能够参考的信息
- B. 显卡品牌
- C. 网站备案信息
- D. 键盘缓存
上下文包括当前问题、历史对话、系统指令、检索资料等。
实践任务
估计上下文内容
列出 CampusAI 回答一个竞赛问题时,可能需要放进上下文的5类信息,并说明每类为什么有用。
提交物:5类上下文信息及理由。
完成标准
- 至少5类
- 包含用户问题和知识库资料
- 说明相关性