学习目标
- 区分模型记忆、搜索、文件、知识库和推断等来源
- 理解Source与Citation的重要性
- 知道知识库条目应保存哪些元数据
正文
AI回答中的一个句子可能来自:
- 模型训练时学到的模式;
- 当前网页搜索;
- 用户上传文件;
- 企业/学校知识库;
- AI自己的推断。
这五种来源不能混为一谈。
Source
Source = 来源。
Citation
Citation = 引用/引文标注。
好的知识库条目应保存
- 标题
- 正文
- 来源
- 来源类型
- 发布时间
- 核验时间
- 专业
- 关键词
- 风险级别
- 版本
为什么 CampusAI 需要这个?
因为大学项目尤其需要知道: “这个信息从哪里来的?” 而不仅仅是“AI说了什么”。
1. 本课要建立的整体认识
搜索负责发现可能相关的信息,来源说明信息从哪里来,引用把具体主张与具体出处连接起来,知识库则让这些材料可维护、可检索和可追溯。
2. 把核心概念逐层拆开
2.1 先明确问题和关键词
先明确问题和关键词,再使用同义词、专业术语、英文词和布尔逻辑扩大或缩小检索。
2.2 来源评价要看发布主体、原始程度、证据方法、发布时间、适用范围和是否可复核。
来源评价要看发布主体、原始程度、证据方法、发布时间、适用范围和是否可复核。
2.3 搜索结果摘要只是线索
搜索结果摘要只是线索,不能代替打开原文;转载页面也不应优先于原始发布。
2.4 引用应尽量靠近被支持的主张
引用应尽量靠近被支持的主张,并保留标题、作者或机构、日期和链接等信息。
2.5 知识库需要版本治理:内容何时加入、依据什么、何时复核、失效后如何更新。
知识库需要版本治理:内容何时加入、依据什么、何时复核、失效后如何更新。
3. 把概念串成一条完整流程
研究一个比赛时,可先找到主办方与当届通知,再核对赛道、资格、时间和AI规则,记录核验日期,将规则拆成带来源的知识条目,回答时引用相关片段。
4. 用真实场景理解
“某比赛允许使用生成式AI”是一条动态规则,不能只凭搜索摘要或往届经验。必须打开当届正式文件,确认适用赛道和限制,并让知识库保留版本。
5. 学习时应该怎样判断自己是否真正理解
不要只看自己是否“听过”这些词。请尝试不用原文,向一位没有技术背景的人解释本课概念;再画出关系或流程;最后换一个与你专业相关的例子。如果无法说明输入、处理、输出、依据和风险,就说明还停留在名词记忆阶段。
遇到模型、工具或规则变化时,优先保留这里学到的判断框架:先定义任务,再确认资料与边界,随后执行、测试和核验。具体品牌和界面会变化,但这种工作方法可以持续使用。
6. 本课小结
本课不是要求一次记住全部细节,而是建立一个能够继续扩展的知识框架。完成正文后,请结合后面的示例、测验和实践任务,把理解转化成自己的语言和可检查的成果。
7. 进一步拆解:从“知道名词”到“会做判断”
学习技术概念时,最容易出现的问题是记住了定义,却不知道什么时候使用,也不知道怎样发现错误。下面逐项使用同一组问题检查理解:
- 先明确问题和关键词:继续追问它接收什么输入、产生什么输出、依据从哪里来、失败时会出现什么现象、由谁负责复核。把这五个问题写出来,概念就会从一句定义变成可用于真实工作的判断工具。
- 来源评价要看发布主体、原始程度、证据方法、发布时间、适用范围和是否可复核。:继续追问它接收什么输入、产生什么输出、依据从哪里来、失败时会出现什么现象、由谁负责复核。把这五个问题写出来,概念就会从一句定义变成可用于真实工作的判断工具。
- 搜索结果摘要只是线索:继续追问它接收什么输入、产生什么输出、依据从哪里来、失败时会出现什么现象、由谁负责复核。把这五个问题写出来,概念就会从一句定义变成可用于真实工作的判断工具。
- 引用应尽量靠近被支持的主张:继续追问它接收什么输入、产生什么输出、依据从哪里来、失败时会出现什么现象、由谁负责复核。把这五个问题写出来,概念就会从一句定义变成可用于真实工作的判断工具。
- 知识库需要版本治理:内容何时加入、依据什么、何时复核、失效后如何更新。:继续追问它接收什么输入、产生什么输出、依据从哪里来、失败时会出现什么现象、由谁负责复核。把这五个问题写出来,概念就会从一句定义变成可用于真实工作的判断工具。
8. 建立自己的操作检查表
第一张是“任务表”:写清服务对象、目标、已有材料、最终交付物和完成标准。第二张是“数据与来源表”:记录每项材料从哪里来、何时获得、是否允许使用、是否需要更新。第三张是“执行表”:把任务拆成可以观察状态的步骤,标明每一步的输入、处理、输出和失败提示。第四张是“核验表”:列出必须人工检查的事实、数字、引用、权限、安全和专业边界。
这四张表适用于本课所讲的大多数任务。它们能防止把“模型给出了结果”误认为“工作已经完成”,也能帮助团队在出现问题时迅速定位到底是需求不清、资料错误、流程中断,还是输出没有经过验证。
9. 与前后课程的关系
这套20课不是彼此孤立的知识点。本课涉及的概念,需要与Prompt中的任务说明、API与软件系统中的执行链、RAG中的资料依据、数据分析中的质量检查以及AI安全中的责任边界结合起来。学习时可以不断回到一个问题:如果把这个概念放进完整AI产品,它位于哪一层,会影响谁,又需要谁来检查?
10. 课后自查
- 我能否不用术语堆砌,用自己的话解释本课核心关系?
- 我能否画出一个包含输入、处理、输出和核验的流程?
- 我能否举出一个与自己专业、学习或工作有关的实例?
- 我能否说出至少两个容易犯的错误,以及怎样提前发现?
- 我能否把本课方法用于一个真实任务,并留下可检查的成果?
示例
示例1:比赛规则
回答比赛要求时,优先检索主办方最新通知并附来源。
结论:动态信息需要来源和时间。
示例2:专业课程知识
课程知识可来自教材、课程大纲、权威开放课,但应标注来源层级。
结论:不同资料可信度和适用范围不同。
常见误区
- “AI能回答就不需要来源。”——项目和研究场景尤其需要依据。
- “引用链接越多越可靠。”——关键是来源质量、相关性和时效。
- “知识库正文够了,元数据没用。”——没有来源、日期、版本,很难更新和核验。
小测验
点击题目查看答案。
1. Citation 在知识库场景中通常指什么?
- A. 引用/出处标注
- B. 模型参数
- C. 显卡驱动
- D. 登录密码
Citation用于说明信息依据或引用位置。
2. 动态政策知识最应该额外保存什么?
- A. 来源和核验日期
- B. 屏幕亮度
- C. 键盘型号
- D. 图片背景色
动态信息需要可追踪来源和时间。
3. 下面哪项最不适合作为“可靠性”判断标准?
- A. 来源权威性
- B. 发布日期
- C. 是否可核验
- D. 回答语气是否自信
语气自信不是事实可靠性的充分依据。
实践任务
做一张来源卡
找一个公开的大学竞赛规则页面,记录标题、发布机构、发布日期、链接/出处、你核验的日期、3条关键规则。
提交物:1张来源卡。
完成标准
- 包含机构和日期
- 规则来自同一来源
- 记录核验日期