Skip to content

第 03 周 · AI 基础:模型、聊天机器人、智能体与 Skill

本周建立后续实训必须共用的语言:大语言模型负责根据上下文生成内容,聊天机器人组织一次次对话,智能体围绕目标继续读取资料和调用工具,Skill 则保存已经跑通的方法。四者有关联,但不是同一个东西。

学习这些概念不是为了背定义,而是为了判断一句“已经完成”究竟意味着什么:它只是生成了一段文字,还是确实读取了文件、调用了工具、产生了可打开的结果?

大模型在做什么:生成不是知道一切

大语言模型(Large Language Model, LLM)可以理解为一个根据当前上下文不断预测后续内容的生成系统。它在训练中学习了大量语言模式,因此擅长续写、改写、归纳、比较和生成结构化草稿;但它不会因为表达自信就自动获得真实世界的最新事实。

模型一次回答通常受四类信息影响:

  1. 训练中学到的语言和知识模式。
  2. 当前任务说明和对话历史。
  3. 提供给它的文件、网页或检索结果。
  4. 产品设置、工具能力和安全规则。

当资料缺失时,模型仍会尝试生成“像答案的答案”,于是可能把常见模式、推测或错误信息写得很完整。课堂上不要求学生掌握模型训练公式,但必须能识别三种状态:原文明确、合理推断、缺少依据。

改善输出不能只靠“再认真一点”。更有效的做法是补资料、缩小问题、要求标注出处、规定缺失信息写“待确认”,并提前写清验收标准。提示词不是魔法咒语,而是一份给协作者看的任务说明。

第一阶段 · 看见变化 · 第 1 课 · 45 分钟

大模型在做什么:生成不是知道一切

为什么看起来很流畅的回答,仍可能不准确、过时或没有依据?

先理解再动手

大模型根据上下文生成最可能的表达,不等于拥有事实数据库或现实判断能力

这节先把“会说”和“知道”拆开:模型能生成、归纳和改写,但需要材料和核验才能可靠地用于真实任务。

上下文

当前输入给模型的材料、要求与对话历史。

生成

基于模式预测下一段表达,因此可能流畅但缺少依据。

核验

回到来源、数据或现实系统确认内容能否成立。

教师示范:给同一问题两份回答:一份有资料链接、一份没有;带学生标出可以直接核验的句子。

易错提醒:不要把“回答很自信”当作“它一定准确”。

教师讲解脚本 · 8 分钟

不要先给定义。先把问题“为什么看起来很流畅的回答,仍可能不准确、过时或没有依据?”投出来,给学生 30 秒独立判断,再请两位同学说出不同答案;教师只追问依据,暂不公布结论。

  1. 0–2 分钟
    从真实情境进入

    结合同题不同回答样例和来源缺失样例呈现一个小情境,让学生先说“我会怎么做”,把已有经验调动出来。

  2. 2–4 分钟
    拆开三个关键点

    依次解释“上下文—生成—核验”。每解释一个概念,都回到情境中指出它对应的事实、动作或判断。

  3. 4–6 分钟
    示范完整判断过程

    给同一问题两份回答:一份有资料链接、一份没有;带学生标出可以直接核验的句子。

  4. 6–8 分钟
    用反例校正理解

    明确边界:不要把“回答很自信”当作“它一定准确”。 请学生用一句话改写刚才的判断,让它更准确、可执行。

课堂案例与追问

课堂案例:以“大模型在做什么:生成不是知道一切”为场景,先让学生仅凭直觉给出做法;再要求他们用“上下文、生成、核验”逐项说明依据,比较两种做法会得到什么不同结果。

  • “你的判断依据来自材料中的哪一处,而不是自己的猜测?”
  • “如果缺少上下文,这一步还能直接开始吗?需要补什么?”
  • “哪一种做法最容易出现‘不要把“回答很自信”当作“它一定准确”。’这类问题?怎样提前避免?”

收束:本节不要求学生背出术语,而要能用上下文、生成、核验解释自己的选择。

过渡到实践:进入任务前,先让学生把三个关键点勾到任务单上;后续操作要服务于本节目标:“理解大模型生成文本的基本特点,并能解释为什么需要资料、核验和版本信息。”。

WorkBuddy 实操卡

同一问题,两种模式 · 问一问 · 工作目录「灯火计划」· 灯火计划资料包

  1. 对「迎新晚会要不要加抽奖」各问一次:不给资料的「问一问」
  2. 再把 meeting-notes.md 放进工作目录,同样问题再问一次
  3. 学生在核验卡上标:流畅句子、有出处句子、缺少依据的句子
迎新晚会要不要加抽奖?请给出建议。
预期看到
  • 无资料时回答可能很流畅但没有出处
  • 有纪要时它应引用材料,仍可能把推测写成结论
人必须检查
  • 不把流畅当正确
  • 标出至少两处需要回查的信息
禁止
  • 不开启「允许完全访问」
  • 不发送群消息、邮件或通知
  • 不写入真实日历或通讯录
  • 不上传学号、手机号、身份证号等个人敏感信息
教师机

投屏对照两份回答,不要评价“哪个模型更聪明”。

有电脑的学生

可自己复现两次提问,但提交的是核验卡不是更好的回答。

手机学生

看投屏,完成核验卡。

WorkBuddy 实战蓝皮书 https://workbuddy.homes/ 第 3 章三种工作模式

本节 AI 协作点

AI 会参与这节课,但它不是替学生完成任务;每次使用都要留下可核验的过程证据。

AI 的角色

文本生成器与协作对象

让 AI 做什么

让 AI 回答同一个问题,并与带资料、工具和后续步骤的智能体流程进行对照。

人要检查什么

区分它生成的说法、实际读取的资料和真实发生的工具动作。

保留什么证据

完成一张“回答—资料—工具—结果—下一步”的协作结构图。

本节目标

理解大模型生成文本的基本特点,并能解释为什么需要资料、核验和版本信息。

准备材料
  • 同题不同回答样例
  • 来源缺失样例
  • 判断卡
互动方式

两人比对回答中的“已知、推测、缺少依据”。

  1. 0–8 分钟
    概念讲解

    学生:带着问题“为什么看起来很流畅的回答,仍可能不准确、过时或没有依据?”记录三个关键词。

    教师:先讲清概念、边界和真实例子,再请学生表达自己的初步判断。

  2. 8–15 分钟
    教师示范

    学生:观察教师如何用概念分析一个具体案例,标出依据。

    教师:边操作边说出判断过程,特别指出“这一步为什么不能只凭感觉”。

  3. 15–27 分钟
    引导辨析

    学生:三人小组比较答案,补上一个反例或限制条件。

    教师:追问“依据来自哪里、有没有另一种解释”,帮助学生把概念用对。

  4. 27–39 分钟
    应用练习

    学生:把今天的概念用到一张新的情境卡上,形成首版判断。

    教师:巡回检查学生是否会把概念和事实、推测混在一起。

  5. 39–45 分钟
    离场证据

    学生:提交“我现在能解释:理解大模型生成文本的基本特点,并能解释为什么需要资料、核验和版本信息。”。

    教师:按证据完整度快速反馈,为下节调整分层支持。

完成证据

一张回答核验卡,标出至少两处需要回查的信息。

离场前自查

已完成 0 / 3 项

给教师的提示与备用方案

提示:让学生先用证据解释,再补充术语;不要把概念讲成需要背诵的定义。

备用方案:使用资料包里预置的两份回答样例完成标注。

聊天机器人与智能体:回答和行动的区别

聊天机器人主要处理“输入一段话—返回一段话”的循环。智能体则可能围绕一个目标持续执行:读取文件、规划步骤、调用搜索或代码工具、检查结果,再决定下一步。区别不在界面像不像聊天,而在它是否真的与外部资料和工具发生了可观察的交互。

比较项聊天回答智能体流程
主要结果文本或多媒体回答回答、文件、工具状态和后续动作
工作跨度通常是一轮或几轮对话可跨多个步骤持续推进
外部能力可能没有可能读取文件、搜索、运行代码或操作应用
主要风险内容错误、过时、无依据内容风险加上越权、误写、误发和错误执行
验证方式检查内容和来源同时检查计划、工具调用、产物和外部状态

因此,智能体说“我已经发出通知”不能作为发送成功的证据。要看真实工具结果、消息状态或接收端。反过来,页面上出现一份草稿也不代表它已经发送;语言、界面和外部状态必须分开验证。

NIST 的 AI 风险管理资料把测试、评估、验证和确认视为持续过程。在本课中,它被压缩为一句操作原则:看实际输入、实际动作和实际产物,不用模型的自我描述代替证据。

第一阶段 · 看见变化 · 第 2 课 · 45 分钟

聊天机器人与智能体:回答和行动的区别

同样是“整理会议”,为什么一种只给建议,另一种能把任务持续推进?

先理解再动手

聊天机器人主要生成回答;智能体还要围绕目标组织步骤、调用工具并带回结果

差异不在“谁更会说话”,而在能否把目标保留在过程里,读取资料、执行动作并依据结果继续推进。

回答

模型根据你当前的输入生成一段内容,通常等下一次追问。

工具

连接文件、日历、表格、消息等真实系统的能力。

循环

根据结果判断下一步,再把新结果带回上下文。

教师示范:以“会后行动安排”为例,画出聊天回答停在建议处、智能体继续读纪要和查日历的不同路径。

易错提醒:不要把任何带对话框的产品都称为智能体。

教师讲解脚本 · 8 分钟

不要先给定义。先把问题“同样是“整理会议”,为什么一种只给建议,另一种能把任务持续推进?”投出来,给学生 30 秒独立判断,再请两位同学说出不同答案;教师只追问依据,暂不公布结论。

  1. 0–2 分钟
    从真实情境进入

    结合DeepSeek 对话示例和WorkBuddy 流程示例呈现一个小情境,让学生先说“我会怎么做”,把已有经验调动出来。

  2. 2–4 分钟
    拆开三个关键点

    依次解释“回答—工具—循环”。每解释一个概念,都回到情境中指出它对应的事实、动作或判断。

  3. 4–6 分钟
    示范完整判断过程

    以“会后行动安排”为例,画出聊天回答停在建议处、智能体继续读纪要和查日历的不同路径。

  4. 6–8 分钟
    用反例校正理解

    明确边界:不要把任何带对话框的产品都称为智能体。 请学生用一句话改写刚才的判断,让它更准确、可执行。

课堂案例与追问

课堂案例:以“聊天机器人与智能体:回答和行动的区别”为场景,先让学生仅凭直觉给出做法;再要求他们用“回答、工具、循环”逐项说明依据,比较两种做法会得到什么不同结果。

  • “你的判断依据来自材料中的哪一处,而不是自己的猜测?”
  • “如果缺少回答,这一步还能直接开始吗?需要补什么?”
  • “哪一种做法最容易出现‘不要把任何带对话框的产品都称为智能体。’这类问题?怎样提前避免?”

收束:本节不要求学生背出术语,而要能用回答、工具、循环解释自己的选择。

过渡到实践:进入任务前,先让学生把三个关键点勾到任务单上;后续操作要服务于本节目标:“区分一次文本回答与“目标—资料—工具—结果—下一步”的智能体协作过程。”。

WorkBuddy 实操卡

主界面三区 + 三种模式 · 想一想 · 工作目录「灯火计划」· 灯火计划资料包

  1. 指出左侧任务、中间对话、右侧产物
  2. 用同一句“把筹备会后续安排好”先走「想一想」
  3. 观察它是否计划读取纪要、是否准备发送通知
  4. 学生给示例贴标签:生成 / 读取 / 调用 / 确认 / 返回结果
帮我把今天的迎新晚会筹备会后续安排好。
预期看到
  • 「想一想」先出计划再等确认
  • 计划里出现读取材料,而不是只给建议
  • 若计划包含发送或改日历,应停在确认点
人必须检查
  • 能区分聊天回答和智能体连续动作
  • 能指出至少一个人必须确认的节点
禁止
  • 不开启「允许完全访问」
  • 不发送群消息、邮件或通知
  • 不写入真实日历或通讯录
  • 不上传学号、手机号、身份证号等个人敏感信息
教师机

停在计划页,不进入「做一做」。

有电脑的学生

跟看计划,截一张“计划/工具/确认点”记录。

手机学生

在对照图上标注三区和三个模式。

WorkBuddy 实战蓝皮书 https://workbuddy.homes/ 第 3–4 章:界面、任务与第一个任务

本节 AI 协作点

AI 会参与这节课,但它不是替学生完成任务;每次使用都要留下可核验的过程证据。

AI 的角色

文本生成器与协作对象

让 AI 做什么

让 AI 回答同一个问题,并与带资料、工具和后续步骤的智能体流程进行对照。

人要检查什么

区分它生成的说法、实际读取的资料和真实发生的工具动作。

保留什么证据

完成一张“回答—资料—工具—结果—下一步”的协作结构图。

本节目标

区分一次文本回答与“目标—资料—工具—结果—下一步”的智能体协作过程。

准备材料
  • DeepSeek 对话示例
  • WorkBuddy 流程示例
  • 动作标签卡
互动方式

小组给示例贴上“生成、读取、调用、确认、返回结果”标签。

  1. 0–8 分钟
    概念讲解

    学生:带着问题“同样是“整理会议”,为什么一种只给建议,另一种能把任务持续推进?”记录三个关键词。

    教师:先讲清概念、边界和真实例子,再请学生表达自己的初步判断。

  2. 8–15 分钟
    教师示范

    学生:观察教师如何用概念分析一个具体案例,标出依据。

    教师:边操作边说出判断过程,特别指出“这一步为什么不能只凭感觉”。

  3. 15–27 分钟
    引导辨析

    学生:三人小组比较答案,补上一个反例或限制条件。

    教师:追问“依据来自哪里、有没有另一种解释”,帮助学生把概念用对。

  4. 27–39 分钟
    应用练习

    学生:把今天的概念用到一张新的情境卡上,形成首版判断。

    教师:巡回检查学生是否会把概念和事实、推测混在一起。

  5. 39–45 分钟
    离场证据

    学生:提交“我现在能解释:区分一次文本回答与“目标—资料—工具—结果—下一步”的智能体协作过程。”。

    教师:按证据完整度快速反馈,为下节调整分层支持。

完成证据

一张聊天与智能体工作方式对照图。

离场前自查

已完成 0 / 3 项

给教师的提示与备用方案

提示:让学生先用证据解释,再补充术语;不要把概念讲成需要背诵的定义。

备用方案:使用资料包「聊天 vs 智能体」对照图完成标注。

Skill 是什么:把做对的方法保存下来

一次对话成功,可能只是材料简单或运气好。只有当一套方法在相近新材料上仍然稳定,才值得保存为 Skill。Skill 不等于一条很长的提示词,它至少应回答:

  • 什么时候应该触发,什么时候不适用?
  • 需要哪些输入,允许读取什么范围?
  • 步骤按什么顺序执行?
  • 哪些工具可以用,哪些动作必须确认?
  • 输出是什么格式,怎样判断合格?
  • 缺资料或出现冲突时,是停止、降级还是请求补充?

以“会议转行动安排”为例,一个可靠 Skill 不应保证“自动安排好一切”,而应规定:只使用指定纪要;原文未明确的负责人和日期写待确认;输出待办表并带出处;真实发送和改日历前停止;用第二份相近纪要复测。

不是所有任务都值得做 Skill。一次性、目标尚未稳定、仍需大量临场判断或风险过高的流程,先保留为普通任务清单更合适。Skill 的价值来自稳定复用,而不是文件名本身。

第一阶段 · 看见变化 · 第 3 课 · 45 分钟

Skill 是什么:把做对的方法保存下来

一段反复跑通的协作流程,怎样从一次对话变成下次可复用的 Skill?

先理解再动手

Skill 是可重复执行的任务说明包,不是一句长提示词

它把触发条件、输入材料、步骤、工具规则、检查与输出模板固定下来,让智能体在相似任务中稳定复用。

SKILL.md

核心说明文件,交代用途、适用条件、步骤和验收方式。

参考资料

业务规则、字段解释、范例等按需读取的材料。

脚本与模板

需要稳定执行或固定输出时使用的辅助文件。

教师示范:展示一个最小 Skill 文件夹,让学生把“会议行动安排”分别放进说明、参考资料和模板。

易错提醒:不要把临时聊天记录原封不动保存成 Skill;先验证流程是否稳定。

教师讲解脚本 · 8 分钟

不要先给定义。先把问题“一段反复跑通的协作流程,怎样从一次对话变成下次可复用的 Skill?”投出来,给学生 30 秒独立判断,再请两位同学说出不同答案;教师只追问依据,暂不公布结论。

  1. 0–2 分钟
    从真实情境进入

    结合SKILL.md 结构示例和流程卡呈现一个小情境,让学生先说“我会怎么做”,把已有经验调动出来。

  2. 2–4 分钟
    拆开三个关键点

    依次解释“SKILL.md—参考资料—脚本与模板”。每解释一个概念,都回到情境中指出它对应的事实、动作或判断。

  3. 4–6 分钟
    示范完整判断过程

    展示一个最小 Skill 文件夹,让学生把“会议行动安排”分别放进说明、参考资料和模板。

  4. 6–8 分钟
    用反例校正理解

    明确边界:不要把临时聊天记录原封不动保存成 Skill;先验证流程是否稳定。 请学生用一句话改写刚才的判断,让它更准确、可执行。

课堂案例与追问

课堂案例:以“Skill 是什么:把做对的方法保存下来”为场景,先让学生仅凭直觉给出做法;再要求他们用“SKILL.md、参考资料、脚本与模板”逐项说明依据,比较两种做法会得到什么不同结果。

  • “你的判断依据来自材料中的哪一处,而不是自己的猜测?”
  • “如果缺少SKILL.md,这一步还能直接开始吗?需要补什么?”
  • “哪一种做法最容易出现‘不要把临时聊天记录原封不动保存成 Skill;先验证流程是否稳定。’这类问题?怎样提前避免?”

收束:本节不要求学生背出术语,而要能用SKILL.md、参考资料、脚本与模板解释自己的选择。

过渡到实践:进入任务前,先让学生把三个关键点勾到任务单上;后续操作要服务于本节目标:“理解 Skill 是任务说明、资料范围、流程、工具规则和验收标准的可复用组合。”。

WorkBuddy 实操卡

专家 · 技能 · 连接器 · 问一问 · 工作目录「灯火计划」· 灯火计划资料包

  1. 打开技能市场,搜索「会议」或「行动项」
  2. 打开一个现成 Skill,只读 SKILL.md 的触发条件、输入、步骤、确认点、验收
  3. 不要一次安装十几个 Skill
  4. 学生把“筹备会转行动安排”拼成触发—输入—步骤—输出—检查
预期看到
  • 看到 Skill 是文件夹和说明,不是一句长提示词
  • 能说出输入材料和输出格式
人必须检查
  • 没有把临时聊天记录保存成 Skill
  • 没有给商店 Skill 授权真实通讯录
禁止
  • 不开启「允许完全访问」
  • 不发送群消息、邮件或通知
  • 不写入真实日历或通讯录
  • 不上传学号、手机号、身份证号等个人敏感信息
教师机

只展示一个会议类 Skill 的结构。

有电脑的学生

可安装一个会议 Skill,但本节只读说明、不跑真实发送。

手机学生

阅读资料包 08-skill-draft.md,标出五个构成块。

WorkBuddy 实战蓝皮书 https://workbuddy.homes/ 第 5 章:加载一个真正用得上的 Skill

本节 AI 协作点

AI 会参与这节课,但它不是替学生完成任务;每次使用都要留下可核验的过程证据。

AI 的角色

文本生成器与协作对象

让 AI 做什么

让 AI 回答同一个问题,并与带资料、工具和后续步骤的智能体流程进行对照。

人要检查什么

区分它生成的说法、实际读取的资料和真实发生的工具动作。

保留什么证据

完成一张“回答—资料—工具—结果—下一步”的协作结构图。

本节目标

理解 Skill 是任务说明、资料范围、流程、工具规则和验收标准的可复用组合。

准备材料
  • SKILL.md 结构示例
  • 流程卡
  • 技能商店样例
互动方式

三人将一次会议整理流程拼成“触发—输入—步骤—输出—检查”五块。

  1. 0–8 分钟
    概念讲解

    学生:带着问题“一段反复跑通的协作流程,怎样从一次对话变成下次可复用的 Skill?”记录三个关键词。

    教师:先讲清概念、边界和真实例子,再请学生表达自己的初步判断。

  2. 8–15 分钟
    教师示范

    学生:观察教师如何用概念分析一个具体案例,标出依据。

    教师:边操作边说出判断过程,特别指出“这一步为什么不能只凭感觉”。

  3. 15–27 分钟
    引导辨析

    学生:三人小组比较答案,补上一个反例或限制条件。

    教师:追问“依据来自哪里、有没有另一种解释”,帮助学生把概念用对。

  4. 27–39 分钟
    应用练习

    学生:把今天的概念用到一张新的情境卡上,形成首版判断。

    教师:巡回检查学生是否会把概念和事实、推测混在一起。

  5. 39–45 分钟
    离场证据

    学生:提交“我现在能解释:理解 Skill 是任务说明、资料范围、流程、工具规则和验收标准的可复用组合。”。

    教师:按证据完整度快速反馈,为下节调整分层支持。

完成证据

一张个人 Skill 构成卡。

离场前自查

已完成 0 / 3 项

给教师的提示与备用方案

提示:让学生先用证据解释,再补充术语;不要把概念讲成需要背诵的定义。

备用方案:用资料包 Skill 草稿完成五块拼图。

中国语境:国产模型生态与"会操作不会思考"

  • 国产模型生态:本课程实训使用的 WorkBuddy 底层接入多家大模型;日常可接触的还有 DeepSeek、豆包、Kimi、通义千问、混元等国产模型与腾讯元宝、文心一言等应用。换产品的成本越来越低——这正说明值得学的是"模型在做什么"的共同原理,而不是某家的按钮位置。
  • 监管框架:《生成式人工智能服务管理暂行办法》要求生成内容真实准确可靠,并按《互联网信息服务深度合成管理规定》进行标识(AI 生成内容需要显式/隐式标识)。你们在短视频平台看到的"AI 生成"角标,就是这条规定的落地。
  • "会操作不会思考"的警钟:北京大学尚俊杰教授观察到,很多学生"会用豆包、会调 Kimi,却说不清生成式 AI 的工作原理、怎么判断答案是否可信——典型的会操作但不会思考"。本周的概念语言,就是防止自己变成"高级操作工"的底座。
  • 北建大"杠精学员":北京建筑大学教师训练了一个专门抬杠的 AI 智能体,学生要与它辩论 AI 伦理问题、对抗模型漏洞。你会发现 AI 犯错,比发现 AI 成功更有教育价值——本周实训就包含"故意让 AI 出错"环节。

45 分钟课堂节奏

课节时间线环节
第 1 节 · 大模型在做什么0–5'导入:同一个问题问两个模型,答案为何不同?
5–15'讲授"生成≠知道"与四类影响因素
15–35'动手:标记三种状态练习——给一段 AI 回答标注"原文明确 / 合理推断 / 缺少依据"
35–43'组间比对标注差异,讨论分歧点
43–45'收束:流畅度不等于正确性
第 2 节 · 回答与行动的区别0–5'情景:智能体说"通知已发出",你信吗?
5–15'讲授聊天机器人与智能体的对比表
15–33'动手(手机即可):观察一次智能体运行的工具调用记录,找出"语言承诺"与"实际产物"
33–43'"故意喂错"环节:给智能体一份日期混乱的纪要,看它怎么办
43–45'收束:看实际输入、动作、产物,不看自我描述
第 3 节 · Skill 与方法沉淀0–5'提问:你上次成功的方法,下次还能复现吗?
5–15'讲授 Skill 六问与"会议转行动"示例
15–35'小组起草一份"课程笔记整理"Skill 说明草稿,互查触发条件与禁止事项
35–43'讨论:哪些任务不该做成 Skill?
43–45'收束 + 预告下周进入灯火计划

深一步追问(给"吃不饱"的同学)

  • 预测下一个词的机制,为什么天然带有"编造倾向"?这与"幻觉"(hallucination)是什么关系?
  • 为什么同一个模型在不同 App 里表现不同?系统提示词和产品设置改变了什么?
  • 如果要求模型"不确定时说不知道",它会变得更好还是更保守?"知道模型不知道"难在哪里?

本周小结

  • 模型生成连贯内容,不自动保证事实正确和资料最新。
  • 智能体的关键特征是围绕目标读取、调用、观察和继续推进。
  • Skill 应保存经过复测的完整方法,包括边界、确认点和验收标准。

迁移练习

选择“整理课程笔记”“规划社团例会”或“检查作业格式”中的一个任务,分别写出聊天机器人版本和智能体版本。圈出智能体需要调用的资料或工具,并标出至少一个人工确认点。

延伸阅读

面向刚入学的本科生:用 WorkBuddy 完成「灯火计划」这条可检查的校园任务。