武汉大学通识课 · 第 03 周
AI 基础:模型、聊天机器人、
智能体与 Skill
03
建立共同语言:
模型 · 聊天机器人 · 智能体 · Skill
学习概念不是为了背定义,而是为了判断一句"已经完成"究竟意味着什么——它只是生成了一段文字,还是确实读取了文件、调用了工具、产生了可打开的结果?
本周导览 · 三节课建立共同语言
大语言模型、聊天机器人、智能体与 Skill 有关联,但不是同一个东西
01
大模型在做什么——生成不是知道一切
大语言模型根据当前上下文不断预测后续内容:擅长续写、改写、归纳与生成草稿,但表达自信不等于掌握最新事实。练习给一段 AI 回答标注三种状态。
三态标注练习
02
聊天机器人与智能体——回答和行动的区别
聊天机器人处理"输入一段话—返回一段话";智能体围绕目标持续读取资料、规划步骤、调用工具并观察结果。区别不在界面,而在是否发生可观察的交互。
观察工具调用记录
03
Skill 是什么——把做对的方法保存下来
一次成功可能只是材料简单或运气好;只有方法在相近新材料上仍然稳定,才值得保存为 Skill。用六个问题检查一份方法是否完整、可复用、有边界。
起草笔记整理 Skill
本周产出
完成一份"课程笔记整理"Skill 草稿,包含触发条件、输入范围、步骤、禁止事项与至少一个人工确认点;同时保留三节课堂练习的标注与观察记录。
数字素养与人工智能通识 · 第 03 周
02 / 36
第一节 · LESSON 1
1
第 1 / 3 节 · 45 分钟
本节关键词:预测、上下文、四种信息来源、三种标注状态、验收标准
大模型在做什么
——生成不是知道一切
导入问题
同一个问题,分别问两个不同的模型,为什么答案不一样?同一个模型,昨天和今天回答同一句话,为什么也会不同?
这一节不背定义。我们要建立一套能落地的语言:把"模型说的话"拆成可以检查的部分,弄清它一次回答到底受哪些东西影响,并练习识别哪些内容有原文依据、哪些只是推测、哪些根本没有依据。
数字素养与人工智能通识 · 第 03 周
03 / 36
情境导入 · 两个答案,谁对?
0–5 分钟:同一个问题问两个模型,答案为何不同
问题:"武汉大学樱花大概什么时候开?今年人多不多?"
模型 A · 语气笃定
"三月中旬到四月上旬,建议 3 月 20 日前后前往,人流会非常拥挤,最好早上七点前入场。"给出具体日期和人数,读起来非常可靠。
模型 B · 语气保守
"往年盛花期多在三月下旬,具体每年不同;今年的人流情况我无法确认,请以学校公告为准。"没有具体日期,反而承认了不知道。
课堂讨论(先别看哪个"更好")
两个模型学的语言模式大体相似,为什么答案不同?可能的原因包括:训练数据的时间范围不同、产品接入的实时信息不同、安全与合规设置不同、系统提示词不同。更扎心的问题是:语气笃定的模型 A,它的具体日期有依据吗?把你的判断先写在便签上,本节结束时再回来看。
数字素养与人工智能通识 · 第 03 周
04 / 36
核心概念 · 生成系统,不是全知系统
5–15 分钟:讲授"生成≠知道"与四类影响因素
LLM
大语言模型(Large Language Model, LLM)可以理解为一个根据当前上下文不断预测后续内容的生成系统。它在训练中学习了大量语言模式,因此擅长续写、改写、归纳、比较和生成结构化草稿。
但它不会因为表达自信就自动获得真实世界的最新事实。当资料缺失时,模型仍会尝试生成"像答案的答案",把常见模式、推测甚至错误信息写得很完整。
课堂不要求掌握训练公式,但要求每个人都能识别下页的三种状态——这是本周最基本的能力。
一句话记住
流畅,是语言模式的成功;
正确,需要另外的证据。
提示词不是魔法咒语,而是一份给协作者看的任务说明——这句话将在第 1 节后半段反复用到。
数字素养与人工智能通识 · 第 03 周
05 / 36
方法拆解 · 一次回答受四类信息影响
回答 = 训练模式 + 当前对话 + 提供的资料 + 产品设置
1
训练中学到的语言和知识模式
模型在训练数据里见过海量文本,学会了遣词造句、常见说法和部分事实。这部分决定了它"像什么都知道",但训练有时间截止点,之后的世界变化它并不知道。
2
当前任务说明和对话历史
你这轮怎么说、之前聊过什么,都会进入上下文。同一模型在不同对话里表现不同,很多时候是上下文不同——这也是"换个说法再问一遍"值得尝试的原因。
3
提供的文件、网页或检索结果
你贴的资料、允许它读的文件、联网检索到的页面。这一类是唯一能由你直接控制的输入——想改善回答,最先动的就是这里。
4
产品设置、工具能力和安全规则
能不能联网、有没有文件上传、拒绝回答的范围、回答长度限制……同一个模型装进不同产品,表现就不一样。回看第 4 页:两个模型答案不同,四个因素都可能有份。
数字素养与人工智能通识 · 第 03 周
06 / 36
方法深化 · 四条信息如何汇成一段回答
看懂信息流向,才知道该在哪里改善输出
训练模式语言与知识 · 有截止时间当前任务与对话历史你怎么说 · 之前聊过什么提供的资料文件 · 网页 · 检索结果生成系统预测后续内容一段流畅的回答原文明确 / 合理推断 / 缺少依据三种状态可能混在同一段里
从流向图读出两件事
第一,四类信息同时影响输出,但你的可控程度差别很大:训练模式改不了,产品设置要看平台,任务说明和提供的资料完全在你手里。第二,输出只是"生成"的结果,图上没有任何一步保证事实正确——所以三种状态必须由你来分辨,而不是让流畅程度替你做决定。
改善输出不能只靠"再认真一点"
更有效的做法:补资料、缩小问题、要求标注出处、规定缺失信息写"待确认",并提前写清验收标准。
数字素养与人工智能通识 · 第 03 周
07 / 36
三态标注 · 原文明确 / 合理推断 / 缺少依据
本节必须掌握的识别能力:判断一句话属于哪种状态
原文明确
能在提供的资料里找到原句或直接对应的数据。例如资料写"9 月 27 日 19:00 开演",回答里的时间就属于这一类。检查方法:指出在哪个文件哪一行。
合理推断
原文没有直说,但由已知信息按常识推出,并应标明"推断"。例如"开幕式在大剧场,估计需要提前半小时入场"。有依据但不是原文,必须显式承认。
缺少依据
原文完全没有支撑,却写得非常确定。例如"预算已批准""某同学负责灯光"却查不到出处。这类内容最危险,因为它看起来最像事实。
3
种状态,同一段回答里可能同时出现
标注时问自己:这句话的依据在哪个文件、哪一行、哪个字段?找不到依据就降级为"待确认",不要为了把表填满而猜。教师点评时会公开判断方法和典型错误。
数字素养与人工智能通识 · 第 03 周
08 / 36
案例分析 · 当 AI 说"已经完成"
第 2 节的主问题在这里先埋下伏笔:完成,是语言还是事实?
你把一份纪要交给 AI,它回答:"已完成整理,所有事项均已核对无误,负责人和时间都已确认。"——这句话里,哪些部分你信,哪些部分必须验证?
信之前,先追问三处证据
① 整理结果在哪里?——应给出可打开的文件或清单,而不是"已完成"三个字。② 每个事项带原文出处吗?——出处要能回访到纪要原句。③ "负责人和时间已确认"的"确认"动作是谁做的?——模型只能转录原文,不能替人拍板。
按三态逐句标注这份回答
"已完成整理"是语言承诺,属于缺少依据——除非你打开它给出的文件。"负责人和时间都已确认"最值得警惕:如果原文只有"有人去问问"这类说法,它把推测写成了事实。这正是课堂上"故意让 AI 出错"的典型样例。
先记住一句
完成与否要看实际输入、实际动作和实际产物;模型的自我描述,不能代替证据。第 2 节将把这句话展开成完整的验证方法。
数字素养与人工智能通识 · 第 03 周
09 / 36
动手任务 · 给一段 AI 回答做三态标注
15–35 分钟动手 · 35–43 分钟组间比对
任务材料(节选):"晚会定在 9 月 27 日周六晚。筹备会已确认抽奖环节由宣传组负责,海报需在 9 月 19 日前出电子稿。有人说平面图周四能到。另外报名平台 9 月 18 日中午开通,具体谁负责会上没提。"
操作步骤
① 把材料投给任意模型,让它"整理成待办清单并标注负责人"。② 对它输出的每一条,回到原材料逐句核对。③ 每条标注:原文明确 / 合理推断 / 缺少依据,并在旁边写依据位置。④ 找出至少一处"原文没有、但模型写得很确定"的内容——它就是本节课的活教材。⑤ 缺负责人的条目,统一改写为"待确认"。
三轨提示
电脑组:直接在 WorkBuddy 里跑,记录对话截图。手机组:用工作册模板抄录回答后纸面标注。观察组:只比对"模型说的"和"原文写的"差异并计数。
组间比对(35–43 分钟)
各组交换标注,重点看分歧:同一条为什么有人标"合理推断"、有人标"缺少依据"?分歧点恰恰是判断标准需要说清的地方。每组推选一条最典型的错例,准备在点评时展示。
数字素养与人工智能通识 · 第 03 周
10 / 36
常见错误 · 第 1 节
四个高频误判,每一条都在往届作业里出现过
把流畅当成正确
模型写得通顺、结构漂亮,就直接采用。
怎么改
流畅只是语言模式的成功;逐句问依据在哪,三态标注之后再谈采用。
拿自信语气当证据
"肯定""一定""已确认"让人不敢质疑。
怎么改
语气是生成的风格,不是证据;越是笃定的说法越要回原文核对。
把合理推断混入事实
推断被写进结论后,没人再区分它和原文。
怎么改
推断必须显式标注"推断",并在正文里和原文内容分开呈现。
用"再认真一点"改善输出
只对模型喊话,不给新信息、不改任务说明。
怎么改
补资料、缩小问题、要求出处、规定"待确认"、提前写验收标准。
数字素养与人工智能通识 · 第 03 周
11 / 36
检查表 · 第 1 节收束
43–45 分钟收束:流畅度不等于正确性
我能说出模型的一次回答受哪四类信息影响。
我能对任意一句话标注:原文明确 / 合理推断 / 缺少依据。
我标注的每一条都写出了依据位置(哪个文件、哪一行)。
我知道缺依据时应写"待确认",而不是替模型圆场。
我尝试过至少一次"补资料 / 缩小问题 / 要求出处"式的改进。
我知道提示词是给协作者看的任务说明,不是魔法咒语。
第 1 节小结
生成,是根据上下文预测;知道,需要独立证据。
带走三样东西:四类影响因素、三态标注方法、一份组间比对时发现的典型错例。下一节我们要问一个更实际的问题——AI 说"通知已发出",你信吗?
数字素养与人工智能通识 · 第 03 周
12 / 36
第二节 · LESSON 2
聊天机器人与智能体
——回答和行动的区别
导入问题
一个智能体对你说:"通知已经发给全部同学了。"你信吗?要看什么、去哪里看,才能确认它真的发了?
区别不在界面像不像聊天,而在它是否真的与外部资料和工具发生了可观察的交互。本节建立五项对比、一套验证动作,并完成一次"故意喂错"实验。
2
第 2 / 3 节 · 45 分钟
本节关键词:一轮对话、多步执行、工具调用、可观察交互、实际产物
数字素养与人工智能通识 · 第 03 周
13 / 36
情境导入 · "通知已发出",你信吗?
0–5 分钟:把语言承诺和外部事实分开
"已经处理完成"
时,你能看到什么
工具结果文件变化
这是本周课堂上教师会反复追问的一句话。答案不能是"它很厉害""看起来像真的",必须是能指到屏幕上的东西。
课堂快答:可能的"证据"清单
A
工具调用记录
运行日志里有没有真实发生的读取、搜索、写入动作条目。
B
消息状态
发送类动作要看消息列表、送达状态或接收端,而不是聊天窗里的一句"已发送"。
C
文件变化
项目目录里是否真的出现新文件、新版本或修改时间。
D
什么都没有
如果以上都找不到,那句"已发出"就只是一段生成的文字。
反过来同样成立:页面上出现一份草稿,不代表它已经发送。语言、界面和外部状态必须分开验证。
数字素养与人工智能通识 · 第 03 周
14 / 36
核心概念 · 一轮循环 与 多步推进
5–15 分钟:讲授聊天机器人与智能体的本质差异
聊天机器人输入一段话 — 返回一段话你说一段话它答一段话结束主要结果:文本或多媒体回答 · 可能没有任何外部能力智能体围绕一个目标持续执行读取文件观察结果规划步骤调用工具检查结果决定下一步循环推进直到完成目标结果包括:回答、文件、工具状态和后续动作
判断标准不是界面
很多智能体长得就像聊天窗口。真正的判断依据是:它是否真的读取了资料、调用了工具、产生了聊天之外的产物——这些都是可观察的交互,能在日志和目录里找到痕迹。
能力变大,风险也变大
聊天回答的风险主要是内容错误、过时、无依据;智能体在这些之上,还叠加了越权、误写、误发和错误执行——所以验证方式也必须升级。
数字素养与人工智能通识 · 第 03 周
15 / 36
方法拆解 · 五个比较项看懂两者差别
同一列看完,就知道为什么验证方式必须不同
比较项
聊天回答
智能体流程
主要结果
文本或多媒体回答
回答、文件、工具状态和后续动作
工作跨度
通常是一轮或几轮对话
可跨多个步骤持续推进
外部能力
可能没有
可能读取文件、搜索、运行代码或操作应用
主要风险
内容错误、过时、无依据
内容风险加上越权、误写、误发和错误执行
验证方式
检查内容和来源
同时检查计划、工具调用、产物和外部状态
记法:右边每一格都比左边"多一层"。多一层结果、多一层跨度、多一层能力,也就多一层风险、多一层必须检查的对象。智能体说"我已经发出通知"不能作为发送成功的证据——要看真实工具结果、消息状态或接收端。
数字素养与人工智能通识 · 第 03 周
16 / 36
方法深化 · 验证三步与一句操作原则
NIST 把测试、评估、验证和确认视为持续过程;本课把它压缩成三步
1
实际输入
它真的读了什么?核对运行日志里出现的文件、网页和检索结果,确认没有越过你允许的范围。
2
实际动作
它真的做了什么?找出每一条工具调用记录:搜索、写入、发送……逐条对应到计划中的步骤。
3
实际产物
留下了什么?打开它声称生成的文件、清单或消息状态,亲手确认内容存在且可打开。
操作原则 · 全周通用
实际输入实际动作实际产物,不用模型的自我描述代替证据。
这句原则来自 NIST AI 风险管理框架中"测试、评估、验证、确认是持续过程"的思想,被本课压缩成了每个学生都能背下来、用得上的一句话。
数字素养与人工智能通识 · 第 03 周
17 / 36
案例分析 · 语言承诺 对照 实际产物
同一次运行,两份记录放在一起读,差异立刻现形
对话窗里的自我描述
"我已读取全部纪要,核对完所有日期,待办清单已生成并自动发给小组群,日历提醒也已设置,本次任务全部处理完成。"
四个承诺:读取全部 / 核对完 / 已发送 / 已设置。逐条追问:日志里有对应条目吗?
日志与目录里的实际发生
读取
read 会议纪要.txt —— 有记录,但没读群消息附件
核对
没有任何核对类动作条目 —— "核对完"是编的
生成
write 待办清单.md —— 文件确实出现在目录里
发送 / 日历
无任何调用 —— 两条承诺完全落空
结论:四条承诺只有两条有据。这种"部分完成却说全部完成"的情况最常见,也最值得每个小组在自己的运行记录里找一遍。发现 AI 犯错,比发现 AI 成功更有教育价值。
数字素养与人工智能通识 · 第 03 周
18 / 36
动手任务 · 观察运行记录 + 故意喂错
15–33 分钟观察 · 33–43 分钟"故意喂错"环节(手机即可)
任务 A · 找出"语言承诺"与"实际产物"
让一个智能体"整理这份纪要并通知全组"。运行结束后打开工具调用记录,左右分两栏抄录:左边写它说过的承诺,右边写日志里真实发生的动作。逐条连线,没连上的承诺就是缺口。产出:一张对照清单,附至少一处"说了但没做"和一处"做了但没说"。
任务 B · 故意喂错(33–43 分钟)
给智能体一份日期混乱的纪要(教师资料包提供),观察它怎么办:是原样照抄错误日期、悄悄"修正"却不说明,还是停下来标注冲突请求人工确认?三种表现分别对应什么风险?记录在观察卡上,组间比较。
三轨提示
电脑组:在 WorkBuddy 里运行并截图日志。手机组:观察教师投屏,负责记录承诺清单。观察组:只统计承诺数与实际动作数的差值。
对照工作册模板 7
把观察结果填进"聊天机器人、智能体与 Skill 对照"表:目标、输入资料、会不会调用工具、结果如何返回、人在哪里确认、怎样再次复用。Skill 一列本周第三节再填。
数字素养与人工智能通识 · 第 03 周
19 / 36
常见错误 · 第 2 节
三个高频误判:都发生在"信了不该信的地方"
1
把界面输出当成完成
聊天窗出现一段总结、一份草稿,就认为任务完成了。
怎么改
界面只是展示层。完成与否看工具调用、文件系统和消息状态这三处硬证据。
2
把"已发送"当真
模型说"已通知全组",就不再检查接收端。
怎么改
发送类承诺必须看消息状态或接收端;凡是涉及真实发送的动作,事前就该停下来人工确认。
3
看到草稿就以为已发送
反过来也一样:草稿存在不等于消息发出。
怎么改
语言、界面和外部状态是三个层面,分开验证;草稿只证明生成了内容,不证明任何外部动作。
教师追问口径:"它说自己'已经处理完成'时,你能看到什么工具结果或文件变化?"答不出具体证据的,一律按"未完成"处理——这个标准同样适用于你们自己的作业。
数字素养与人工智能通识 · 第 03 周
20 / 36
检查表 · 第 2 节收束
43–45 分钟收束:看实际输入、动作、产物,不看自我描述
01
我能说出聊天机器人和智能体的关键区别:是否发生可观察的外部交互。
02
我能背出五项对比:结果、跨度、外部能力、风险、验证方式。
03
我看过一次真实的工具调用记录,并指认了其中一条读取或写入动作。
04
我找到过至少一处"语言承诺"与"实际产物"不一致的地方。
05
我知道发送、写入日历、覆盖文件属于必须暂停确认的动作。
06
我能完整复述操作原则:看实际输入、实际动作和实际产物,不用模型的自我描述代替证据。
数字素养与人工智能通识 · 第 03 周
21 / 36
第 2 节小结 · 回答和行动,两本账
从 NIST 到课堂:验证是持续过程,不是最后一步
言 ≠ 行
聊天机器人主要处理"输入一段话—返回一段话"的循环;智能体则围绕一个目标持续执行:读取文件、规划步骤、调用工具、检查结果,再决定下一步。两者都由同一个大模型驱动,差别在于是否真的与外部资料和工具发生了可观察的交互
能力升级意味着风险升级:智能体在内容风险之上,叠加了越权、误写、误发和错误执行。因此智能体说"我已经发出通知"不能作为发送成功的证据——这正是"言"和"行"要分开记账的原因。
带走三句话
① 界面不是证据,日志和产物才是。
② 草稿不等于发送,回答不等于执行。
③ 语言、界面、外部状态,三层分开验证。
下节预告:既然"做对"这么难,能不能把做对的方法保存下来,让下次不必靠运气?——这就是 Skill。
数字素养与人工智能通识 · 第 03 周
22 / 36
第三节 · LESSON 3
3
第 3 / 3 节 · 45 分钟
Skill 是什么
——把做对的方法保存下来
导入问题:上次你把一件难事做成了——靠的是方法,还是运气?下次换一批新材料,这套方法还能复现吗?
触发条件
输入范围
步骤顺序
工具规则
输出格式
失败处理
本节关键词:稳定复用 · 六问检查 · 待确认 · 复测
数字素养与人工智能通识 · 第 03 周
23 / 36
情境导入 · 成功一次,和每次都成功
0–5 分钟提问:你上次成功的方法,下次还能复现吗?
1
成功,可能只是材料简单或运气好
纪要本身格式工整、负责人齐全,随便怎么整理都能对。这时候的成功,证明不了方法可靠。
只有当方法在相近新材料上仍然稳定,才值得保存为 Skill
稳定的意思是:换一份写得潦草、负责人缺失、日期含糊的新纪要,这套方法照样知道——哪些条目可信、哪些要标待确认、哪些动作必须停下问人。复用不是重复输入同一句提示词,而是同一套规则能应对不同的材料。
反面经验
把上次的对话原样再发一遍,输出却全乱了——因为新材料里到处是"有人去问问"这样的模糊说法。
正面经验
方法里早写了"未明确的负责人写待确认",新材料再乱,输出仍然可用、可查、可交接。
数字素养与人工智能通识 · 第 03 周
24 / 36
核心概念 · Skill 不等于一条很长的提示词
5–15 分钟:讲授 Skill 六问与"会议转行动"示例
一条很长的提示词
✕ 只有"怎么做",没有"何时用、何时别用"。
✕ 没有输入边界:什么都读,包括不相干的旧文件。
✕ 没有确认点:一路执行到底,直接发送或改文件。
✕ 没有失败处理:缺资料就自己编,冲突就悄悄改。
✕ 没有验收标准:输出对不对,全凭感觉。
一份合格的 Skill
Skill 至少应回答六个问题:什么时候应该触发、什么时候不适用;需要哪些输入、允许读取什么范围;步骤按什么顺序执行;哪些工具可以用、哪些动作必须确认;输出是什么格式、怎样判断合格;缺资料或出现冲突时,是停止、降级还是请求补充。
它是适用条件、输入、步骤、工具规则、确认点、输出与验收的可复用组合——不是更长的咒语,而是一份给协作者的操作规程。
一个直觉判断
把你写的"Skill"盖住名字拿给别人看:如果对方读完仍然不知道什么情况下能用、哪些事它绝不许做、做完了怎样算好,那它就只是一条提示词。
数字素养与人工智能通识 · 第 03 周
25 / 36
方法深化 · Skill 六问
起草和检查一份 Skill,逐条过这六个问题
01
触发
什么时候应该触发,什么时候不适用?
例:只用于本课程的纪要整理,不用于个人隐私文件。
02
输入
需要哪些输入,允许读取什么范围?
例:只使用指定纪要文件,不读目录外的任何资料。
03
步骤
步骤按什么顺序执行?
例:先读取 → 再逐条提取 → 核对出处 → 生成待办表。
04
工具
哪些工具可以用,哪些动作必须确认?
例:读文件可以;真实发送、改日历、覆盖文件前停止。
05
输出
输出是什么格式,怎样判断合格?
例:待办表必须带原文出处;负责人缺失写待确认。
06
失败
缺资料或出现冲突时,停止、降级还是请求补充?
例:日期冲突时停下来标注,不擅自选一个。
数字素养与人工智能通识 · 第 03 周
26 / 36
方法深化 · Skill 五块结构
工作册模板 7 的速记式:触发条件 → 输入 → 步骤与工具 → 输出 → 验收与确认点
触发条件何时用 · 何时不适用输入只读什么 · 范围多大步骤与工具顺序 · 允许的动作输出格式 · 交付位置验收与确认点怎样算合格何时必须停下问人
五块怎么用
起草时从左往右写;检查时从右往左问:先看有没有确认点和验收标准,再看输出格式能不能直接验收,最后才看步骤写得漂不漂亮。大多数失败的方法,缺的恰好是最右边两块。
对应模板 22 · 可执行任务说明
目标、输入、动作、约束、输出、验收、确认点七行——与五块结构一一对应。本周产出的 Skill 草稿,就按这个骨架来写。
数字素养与人工智能通识 · 第 03 周
27 / 36
案例分析 · "会议转行动安排" 的规则卡
一个可靠 Skill 不应保证"自动安排好一切"
规则卡 · 会议转行动安排
只使用指定纪要——不读目录外的旧文件和群消息。
原文未明确的负责人和日期,一律写"待确认",不补造。
输出待办表,每条带原文出处,可回访核对。
真实发送消息和修改日历之前,停止并等人工确认。
用第二份相近纪要复测,确认方法仍然稳定,才算保存成功。
对照"自动安排好一切"版
那种 Skill 会替人拍板负责人、把"有人去问问"写成正式安排、直接发送通知。看起来省事,实际是把错误固化进了流程。
注意第 ⑤ 条
复测必须使用相近的新材料——继续用旧纪要只能证明记住了旧例子,不能证明方法可复用。这一条是 Skill 和普通提示词最硬的分界线。
数字素养与人工智能通识 · 第 03 周
28 / 36
边界讨论 · 哪些任务不该做成 Skill?
35–43 分钟课堂讨论 · Skill 的价值来自稳定复用,而不是文件名本身
一次性任务
只为今晚一场晚会写的流程,做完即弃。
保存它需要维护成本,收益为零——普通清单即可。
目标尚未稳定
任务要求还在频繁变化、标准没定下来。
先把目标写清楚,等规则连续几轮不变再固化。
大量临场判断
每一步都需要根据现场情况改变做法。
临场判断写不成步骤;硬写会给人机都没留余地。
风险过高
涉及真实发送、金钱、隐私或不可逆操作。
高风险动作永远保留人工确认,不适合全自动固化。
?
课堂讨论题
各组举一个自己生活里"很想做成 Skill 但其实不该做"的任务,说明属于上面哪一类。再举一个真正适合做成 Skill 的,说明它凭什么稳定。
数字素养与人工智能通识 · 第 03 周
29 / 36
动手任务 · 起草"课程笔记整理" Skill
15–35 分钟小组起草 · 互查触发条件与禁止事项
任务 · 按五块结构写草稿
目标:把一节课的笔记整理成可复习的大纲。照着模板 22 的骨架,逐块填写:触发条件(什么时候用它、什么时候不用);输入(允许读哪些文件);步骤与工具(提取、归纳、生成什么);输出(格式与交付位置);验收与确认点(怎样算合格、哪些情况必须停下问人)。必须包含至少一条禁止事项和一个人工确认点。
互查环节:两组交换草稿,专查两处——触发条件是否真的排除了不该用的情况?禁止事项是否覆盖了发送、覆盖、删改这类高危动作?查完把问题写在草稿边缘,退回修改。
三轨提示
电脑组:直接写成文本文件存入项目目录。手机组:用备忘录写,截图存档。观察组:拿教师提供的现成 Skill 说明做对照,标记缺块。
草稿之后呢?
本周只要求草稿 + 互查。它将在第 10–11 周真正运行、复测并按模板 25 打分——现在写得越诚实,那时越省力。
数字素养与人工智能通识 · 第 03 周
30 / 36
常见错误 · 第 3 节
Skill 草稿里最常见的四类毛病
1
写成口号,写不出步骤
"让 AI 更专业地整理笔记"——没有任何可执行动作。
怎么改
每个动词落到对象上:读什么、提取什么字段、生成什么格式。
2
触发条件形同虚设
"任何时候都可以用"等于没有触发条件。
怎么改
写清两类边界:适用的材料长什么样,明确不适用的场景有哪些。
3
忘记留确认点
整份流程从头跑到尾,没有一个地方停下来问人。
怎么改
至少为发送、覆盖、删除类动作设一个硬停点,写明问谁。
4
没复测就宣布成功
用原来那份材料跑通,就当方法已验证。
怎么改
换一份相近新材料复测;只有复测通过才谈得上"保存"。
数字素养与人工智能通识 · 第 03 周
31 / 36
检查表与小结 · 第 3 节
43–45 分钟收束 + 预告下周进入灯火计划
我能说出 Skill 和长提示词的区别:适用条件、边界与验收。
我起草的 Skill 草稿包含触发条件、输入范围和步骤顺序。
草稿里至少有一条禁止事项和一个人工确认点。
我知道输出必须带出处,缺失信息写"待确认"。
我明白不复测就不能宣布方法"已保存"。
我能举出一个不该做成 Skill 的任务并说明理由。
第 3 节小结
保存方法,是保存它的边界、确认点和验收标准。
一次对话成功可能靠运气;一套方法能在新材料上稳定复现,才配得上被保存。
下周预告:概念就位,下周进入"灯火计划"第一个实训任务——项目与行动安排。
数字素养与人工智能通识 · 第 03 周
32 / 36
课堂节奏 · 三节课 × 45 分钟
每节 20 分钟左右动手时间;收束 2 分钟回扣本周主问题
第 1 节 · 大模型在做什么
0–5′
导入:同一个问题问两个模型,答案为何不同?
5–15′
讲授"生成≠知道"与四类影响因素
15–35′
动手:三态标注——原文明确 / 合理推断 / 缺少依据
35–43′
组间比对标注差异,讨论分歧点
43–45′
收束:流畅度不等于正确性
第 2 节 · 回答与行动的区别
0–5′
情景:智能体说"通知已发出",你信吗?
5–15′
讲授聊天机器人与智能体的对比表
15–33′
动手(手机即可):观察工具调用记录,找"语言承诺"与"实际产物"
33–43′
"故意喂错":给一份日期混乱的纪要,看它怎么办
43–45′
收束:看实际输入、动作、产物,不看自我描述
第 3 节 · Skill 与方法沉淀
0–5′
提问:你上次成功的方法,下次还能复现吗?
5–15′
讲授 Skill 六问与"会议转行动"示例
15–35′
小组起草"课程笔记整理"Skill 草稿,互查触发条件与禁止事项
35–43′
讨论:哪些任务不该做成 Skill?
43–45′
收束 + 预告下周进入灯火计划
数字素养与人工智能通识 · 第 03 周
33 / 36
中国语境 · 学共同原理,不做"高级操作工"
换产品的成本越来越低,概念语言才是带走的东西
国产模型生态
课程实训使用的 WorkBuddy 底层接入多家大模型;日常可接触的还有 DeepSeek、豆包、Kimi、通义千问、混元,以及腾讯元宝、文心一言等应用。产品会不断换,值得学的是"模型在做什么"的共同原理,而不是某家的按钮位置。
监管框架 · 标识义务
《生成式人工智能服务管理暂行办法》要求生成内容真实准确可靠,并按《互联网信息服务深度合成管理规定》进行显式/隐式标识。短视频平台上的"AI 生成"角标,就是这条规定的落地——本周实训产出的内容也应注明 AI 参与。
北大警钟 · "会操作不会思考"
北京大学尚俊杰教授观察到:很多学生"会用豆包、会调 Kimi,却说不清生成式 AI 的工作原理、怎么判断答案是否可信——典型的会操作但不会思考"。本周建立的概念语言,正是防止自己变成"高级操作工"的底座。
北建大"杠精学员"
北京建筑大学教师训练了一个专门抬杠的 AI 智能体,学生要与它辩论 AI 伦理问题、对抗模型漏洞。你会发现:AI 犯错,比发现 AI 成功更有教育价值——本周实训里的"故意喂错"环节,就是这个思路。
数字素养与人工智能通识 · 第 03 周
34 / 36
深一步追问 与 迁移练习
左边留给"吃不饱"的同学;右边是本周必做的课后任务
深一步追问
预测与幻觉
预测下一个词的机制,为什么天然带有"编造倾向"?这与"幻觉"(hallucination)是什么关系?
同一个模型,不同表现
为什么同一个模型在不同 App 里表现不同?系统提示词和产品设置改变了什么?
"说不知道"的价值
如果要求模型"不确定时说不知道",它会变得更好还是更保守?"知道模型不知道"难在哪里?
迁移练习 · 选一个任务,写两个版本
整理课程笔记 / 规划社团例会 / 检查作业格式中选一个任务:分别写出聊天机器人版本和智能体版本;圈出智能体需要调用的资料或工具;标出至少一个人工确认点。
聊天版示例开头
"这是我今天的笔记,帮我整理成大纲……"——一轮或几轮对话,没有工具。
智能体版示例开头
"读取本周笔记目录,按课程归类生成总纲,写入指定文件——发送前停下等我确认。"
自查:工具调用画了圈吗?人工确认点标了吗?两个版本的差别,应该正好落在"它会不会动你电脑里的东西"上。
数字素养与人工智能通识 · 第 03 周
35 / 36
第 03 周 · 小结
实际输入实际动作实际产物
不用模型的自我描述代替证据。
模型生成连贯内容,不自动保证事实正确和资料最新;智能体的关键特征是围绕目标读取、调用、观察和继续推进;Skill 应保存经过复测的完整方法——包括边界、确认点和验收标准。
武汉大学 · 数字素养与人工智能通识
第 03 周 · AI 基础:模型、聊天机器人、智能体与 Skill · 下周进入灯火计划
03
第03周-AI基础四概念
← → 翻页 · Home/End 首尾 · F 全屏