第 08 周 · WEEK 08
任务三(上):把数据
整理成可回答的问题
数据表看起来客观,但每一行如何形成、每一列代表什么,都会影响结论
本周不急着画图——先把原始表变成一份可以解释、可以复算的数据工作底稿:保留原表,所有清理都有理由,关键数字至少人工复算一次。
武汉大学通识课 · 数字素养与人工智能通识
01 / 36
本周导览:三节课,一条工作底稿主线
先读懂字段,再提出问题,最后让 AI 协作——每一步都留下可解释的记录
1
读字段
打开 07-attendance.csv,第一步不是求平均值,而是建立数据字典:每个字段回答六问——含义、类型、单位、空白、一行代表什么、有无身份键。
落点:24 行 ≠ 24 人
2
提问题
“看看数据有什么发现”没有明确终点。可分析的问题要写清对象、指标、比较维度和用途;签到率这类指标的分子分母,都要能落到筛选规则。
落点:先定问题,再选图
3
AI 协作分析
AI 能识别异常、生成清理建议、编写公式,但它给出的数字必须能在原表和操作记录中重现。七项分析记录,一项都不能少。
落点:复算留痕,每步可解释
本周产出
数据字典
质量问题记录
分析问题
AI 分析操作记录
数字素养与人工智能通识 · 第 08 周
02 / 36
第一节 · 45 分钟
01
先看数据:
每一列到底
表示什么
本节产出:一份 8 字段的数据字典初稿
导入问题
拿到一张表,你的第一反应是
“求个平均数”,还是“先弄懂每一列”
数据表看起来比文字材料更“客观”,但表中每一行如何形成、每一列代表什么、哪些人没有进入数据,都会影响结论。本周不急着画图——第一步是打开表格后先建立数据字典(Data Dictionary),把原始表变成可以解释、可以复算的工作底稿。
数据字典六问
空白与身份键
行数 ≠ 人数
数字素养与人工智能通识 · 第 08 周
03 / 36
导入情境:24 行 = 24 人吗?
第 1 节课的悬念先埋在这里,35 分钟后各组用数据字典来揭晓
24
07-attendance.csv 的记录行数
?
现实中到底有多少名参与者?
直接说“有 24 名参与者”之前,先想想一张表里的行是怎样形成的。下面三条线索都藏在表里,本节课我们不急着给答案,先学会提出正确的问题。
线索一
同一个姓名可能在不同行重复出现——是同名,还是同一个人被记了两次?
线索二
志愿者和新生混在同一张表里——每一行都代表一名“参与者”吗?
线索三
有些行的字段值看起来根本不可能成立,还有些行无报名无签到却进入了表格。
记住这句话:行数只是表的物理结构,不自动等于现实中的人数。
数字素养与人工智能通识 · 第 08 周
04 / 36
核心概念:数据字典六问
打开表格后,第一步不是求平均值,而是让每个字段都能自圆其说
6 问
问一
名称与含义
字段名称和业务含义是什么?“渠道”两个字本身不会告诉你它记录的是报名途径还是宣传来源。
问二
类型
它是文本、日期、类别还是数值?类型决定你能做什么计算——文本不能求和,类别不能求平均。
问三
单位与取值
单位是什么,允许哪些取值?时间有没有超出 24 小时的值?人数有没有负数?超出取值范围就是异常信号。
问四
空白的含义
空白表示没有、未知、未填还是不适用?四种含义混在一起,会直接污染后续统计。
问五
一行的意义
一行代表一次记录、一个人还是一个事件?一行意义不清,所有“人数”“次数”都会失真。
问六
身份键
是否存在稳定身份键(如学号),可以判断重复?没有身份键,重复只能标为“疑似”。
对应工作册模板 17
数据字典的每一列都对应一问:字段名 · 含义 · 类型/单位 · 允许值 · 缺失情况 · 异常或疑问 · 处理决定。
数字素养与人工智能通识 · 第 08 周
05 / 36
方法拆解:先辨类型,再定单位
字段类型决定你能做的计算;单位与取值范围决定异常怎么判
文本
示例字段
姓名、备注、学院名称
能做什么
能计数、能分组,不能求和求平均
字典里要写清
把“学院”当类别还是文本,决定分组统计的口径
日期/时间
示例字段
报名时间、签到时间
能做什么
能排序、能算间隔,能发现不可能值
字典里要写清
签到时间若出现 25:08 这类值,说明记录环节出了问题
类别
示例字段
报名渠道、角色(新生/志愿者/工作人员)
能做什么
能分组比较,能算各类占比
字典里要写清
类别清单要先枚举:渠道有哪几种?角色有哪几种?
数值
示例字段
人数、金额、次数
能做什么
能求和、平均、最大最小
字典里要写清
先确认单位与分母,再谈精确数字
动手时
为 07-attendance.csv 的 8 个字段逐一标注类型,并写下每个字段允许的取值范围——写不出来的,就是你还没看懂的字段。
数字素养与人工智能通识 · 第 08 周
06 / 36
方法深化:空白的四种含义与身份键
同一格空白,可能是四件完全不同的事;同一行重复,可能是两个人也可能是一个人
空白的四种含义
没有
事件确实未发生,如“未报名”是一个真实状态。
误当“未填”→ 把真实为零算成缺失,人数虚高或虚低。
未知
发生过但不知道值,需要回查来源。
误当“没有”→ 把不知道当不存在,漏掉真实参与者。
未填
本应填写但遗漏,属于质量问题。
误当“不适用”→ 掩盖收集流程的漏洞,错失补救机会。
不适用
该字段对此行本来就不适用。
误当“未知”→ 白白花时间回查根本不存在的答案。
身份键:判断重复的唯一依据
判断两行是否同一人,靠的不是肉眼相似,而是稳定身份键——学号、工号这类唯一编号。

07-attendance.csv 里没有这样的字段,所以任何“重复”都只能是疑似:先标记、写清不同处理规则对结果的影响,不静默认定,也不急着删除。
本页小结:空白要写明是哪一种,重复要写明依据是什么——数据字典里每一条模糊,都会在统计时放大成一个错误。
数字素养与人工智能通识 · 第 08 周
07 / 36
案例分析:六类质量问题,先记录再动手
每发现一处,先记录进质量问题清单,不要立即删除——答案在课堂上揭晓
01
缺失
本应有的值空白或缺失——找到实例后,记下在哪一行、哪个字段、打算怎么处理。
02
重复
疑似同一实体被记录多次——找到实例后,记下在哪一行、哪个字段、打算怎么处理。
03
无效值
超出取值范围的值——找到实例后,记下在哪一行、哪个字段、打算怎么处理。
04
口径混合
不同来源的记录混在一列——找到实例后,记下在哪一行、哪个字段、打算怎么处理。
05
时间错位
时间与事件对不上——找到实例后,记下在哪一行、哪个字段、打算怎么处理。
06
身份不明
无法判断一行属于谁——找到实例后,记下在哪一行、哪个字段、打算怎么处理。
课堂揭晓 · 35 分钟后
建完字典后,各组回报:你们在表里各找到了几处问题?属于哪一类?

老师会带大家核对三类典型线索——重复出现的姓名、不可能成立的时间、与统一平台口径不一致的渠道——并追问:你把谁算进了分母?换了处理规则,结论会不会变?
提示:本表是练习用的历史样表,数据日期与本项目晚会并非同一时间——它训练的是方法,不是活动结果本身。
数字素养与人工智能通识 · 第 08 周
08 / 36
动手任务:为 CSV 建立数据字典(15 分钟)
对照工作册模板 17,逐字段填写,保留原表,一切处理都先记录
8 字段
任务要求
打开 07-attendance.csv,为全部 8 个字段逐一填写数据字典:字段名、业务含义、类型/单位、允许值、缺失情况、异常或疑问、处理决定(保留 / 修正 / 排除 / 待确认)。遇到说不清含义的字段,不要猜——写“待确认”并注明卡在哪里。
两条铁律
① 原表只读,不删不改;
② 没有稳定身份键时,重复一律标“疑似”,并写明不同处理规则会怎样影响结果。
基础轨
只填“字段名 / 含义 / 类型”三列,保证 8 个字段全覆盖;空白列统一先写“待确认”。
标准轨
按模板 17 七列全部填写,并至少标出两类质量问题(缺失 / 无效值 / 口径混合等),写明所在行。
挑战轨
完成后额外回答:若把“疑似重复”按不同规则处理(保留 / 合并 / 删除),表中“人数”会怎样变化?用一句话说明。
数字素养与人工智能通识 · 第 08 周
09 / 36
常见错误:这些坑,每年都有人踩
建字典阶段最容易犯的四类错误——对照自查,错了就改记录,不改原表
4 坑
✗ 直接在原表上删改
看到“不对劲”的行就顺手删除——原表被破坏后,任何人(包括你自己)都无法再验证清理是否合理。正确做法:原表只读,问题记入质量清单,在副本上处理并写明理由。
✗ 把行数当人数
统计口径还没定,就先宣布“有 24 人参与”。行数只是物理结构:重复、混合角色、无效记录都还没排除,这个数字什么都说明不了。
✗ 四种空白混为一谈
把“没有报名”“不知道”“忘了填”“本来就不适用”统一当成“缺失”处理,或者干脆忽略。四种含义对应四种后果,混淆任何两种都会让统计失真——字典里必须逐字段写明。
✗ 凭肉眼认定重复
名字一样就断定是同一人并直接合并。没有学号等稳定身份键时,同名可能是两个人,同一人也可能出现多次——只能标“疑似”,并展示不同处理规则下结果的变化。
共同点:这四类错误的根源都是“跳过了数据字典直接下结论”。先把六问答完,大部分坑自然绕开。
数字素养与人工智能通识 · 第 08 周
10 / 36
第一节检查表:交之前逐项打勾
6 条全过,数据字典才算初稿完成
每个字段都回答了六问:含义、类型、单位与取值、空白含义、一行代表什么、有无身份键。
空白列逐字段写明了是“没有 / 未知 / 未填 / 不适用”中的哪一种。
没有稳定身份键的字段组合,重复一律标“疑似”,未静默认定或删除。
发现的问题全部记入质量清单:缺失、重复、无效值、口径混合、时间错位、身份不明。
原表保持只读,所有处理都写在副本并注明理由与“处理决定”。
说不清的字段没有硬猜,统一写“待确认”并注明卡在哪里。
合格字典的样子
字段名含义类型决定处理决定列:保留 / 修正 / 排除 / 待确认
每一行都能回答“这是什么、为什么这样处理”;带标记的行对应质量清单里的条目,可回查、可复算。
数字素养与人工智能通识 · 第 08 周
11 / 36
第一节小结 · 先看数据
行数只是表的物理结构,
不自动等于现实中的人数
01 · 字典先行
打开表先建数据字典,六问答完再谈任何统计——字段名不自动说明业务含义。
02 · 记录优先
六类质量问题先记录再处理;没有身份键,重复只能标“疑似”并说明规则影响。
03 · 原表神圣
原表只读,处理在副本,每一步都写明理由——这是后面两节课的共同底座。
下一节:有了看懂的表,如何提出一个值得回答的问题?
12 / 36
02
第二节 · 45 分钟
提出数据问题:
图表要回答什么
本节产出:一个可分析的问题 + 一条写清分母的指标公式
导入问题
“看看数据有什么发现”——这句话为什么让所有人都卡住?
它没有明确终点:不知道看哪几列、算什么指标、和谁比较、得出结论给谁用。这一节我们把这种模糊的大题目,改写成可以动手分析的问题。
数字素养与人工智能通识 · 第 08 周
13 / 36
导入:“看看数据有什么发现”,卡在哪?
快问快答 5 分钟:把你的“卡点”写在工作册页边
看看这份数据,
有什么发现吗?
这是数据分析里最常见的开场白,也是最没法定义“做完”的一句话。它听起来开放,实际上把所有决定都甩给了你——而你没有判断依据。
四个卡点
A
对象不明
看谁的数据?新生、志愿者还是全部行?
B
指标不明
“发现”用什么衡量?人数、比例还是差异?
C
比较不明
和谁比?不同渠道之间?今年和去年?
D
用途不明
结论给谁用、用来做什么决定?
本节目标:把四个“不明”逐一填上,模糊的大题目就变成了可分析的问题——下一页给出改写公式。
数字素养与人工智能通识 · 第 08 周
14 / 36
核心概念:可分析问题的四要素
对象、指标、比较维度、用途——四项写清,问题才算立起来
对象谁的数据指标用什么衡量比较维度和谁比用途给谁用
示例:一个合格的问题长这样
“在排除工作人员并保留疑似重复记录的口径下,不同报名渠道的新生签到率有何差异?这个差异是否值得筹备组调整提醒方式?”
对象=新生;指标=签到率;比较维度=报名渠道;用途=决定是否调整提醒方式。四要素齐了,动手的人才知道“做完”长什么样。
口径先于计算
“排除工作人员”“保留疑似重复”都是口径声明——先声明,再算数。
用途决定精度
只为“是否调整提醒方式”服务,就不必追求小数点后两位的精确。
写进记录
问题写进工作册,后面 AI 分析的每一步都要回到这句话核对。
数字素养与人工智能通识 · 第 08 周
15 / 36
方法拆解:签到率公式——分母是灵魂
分子和分母都要能落到筛选规则;写不清分母的百分比不要相信
签到率
符合口径且完成签到的人数
符合口径的报名人数
分子怎么落到规则
“完成签到”要能从签到时间列判断:哪些行算签到、哪些行算缺席,必须先在字典里定义。“符合口径”指已经排除了不该进来的人——口径声明写进了问题,就要同样写进筛选条件。
分母最容易出错
分母错了,分子再准也没用。志愿者和工作人员算不算报名人数?疑似重复的行算一行还是两行?“无报名却出现在表里”的记录进不进分母?每一个决定都必须写进指标定义,而不是算完再解释。
自查一句话
把公式给一位没看过数据你的同学:他能不能只凭你的文字定义,从原表独立算出同一个数字?能,才算“落到筛选规则”;不能,说明定义里还有模糊地带。
数字素养与人工智能通识 · 第 08 周
16 / 36
方法深化:五类问题,对应五种图
先确定问题类型,再决定需要什么计算和图表——不要反过来
5 类
比较
不同渠道的新生签到率谁高谁低?
柱状图 / 条形图
趋势
报名人数随时间怎样变化?
折线图
构成
各渠道报名在总量中各占多少?
堆叠条 / 占比图
分布
签到时间集中在哪个区间?
直方图 / 箱线图
关系
报名时间早晚与是否签到有关联吗?
散点图 / 分组比较
方向别搞反
不要先选一个漂亮图形,再倒推它“似乎能说明什么”——图表是回答问题的工具,不是装饰结论的海报。
数字素养与人工智能通识 · 第 08 周
17 / 36
案例分析:口径冲突时,宁可不给精确数字
“学院群接龙”没有完整报名记录,怎么办?
情境:你想比较“不同报名渠道的新生签到率”。统一活动平台有完整报名记录;但表里还有若干行来自学院群接龙——有人接龙、有人没接,报名总数根本无从知晓。这时还能把两类渠道放进同一个分母比较吗?
选项 A
改问题
把问题收窄为“统一平台各渠道之间的签到率比较”,接龙渠道另作定性说明。问题诚实了,结论才站得住。
选项 B
补数据
回找接龙群的完整记录,把缺的报名人数补上;补不到就在质量清单里记为“无法补齐”,不要假装它存在。
选项 C
并列口径
两种口径各算各的、并列展示,明确标注各自分母——宁可两个不完全的数字,不要一个看似精确的假数字。
★ 本课示范选择:并列口径,绝不强行生成一个精确数字。
原则:分母到不了的地方,结论就不该到达。口径冲突不是麻烦,而是提醒你——数据和问题之间还差一步诚实。
数字素养与人工智能通识 · 第 08 周
18 / 36
动手任务:写问题 · 定指标 · 查分母(20 分钟)
三步一次完成,写在工作册“分析问题”栏,供第三节 AI 分析直接使用
3 步
STEP 1
写出你的分析问题
把“看看有什么发现”改写成含四要素的一句话:对象(谁)、指标(什么)、比较维度(和谁比)、用途(给谁用、做什么决定)。写完互相念给同伴听,让对方说出你打算比较什么——说不出来就重写。
STEP 2
定义指标公式
像签到率那样,把指标写成“分子 ÷ 分母”,每一项都能落到筛选规则:哪些行算进来、哪些被排除、疑似重复怎么处理。把公式原样写进记录,不要只写“我算了签到率”。
STEP 3
做一次分母检查
对着 07-attendance.csv 逐条自问:分母里的每个人都真的有报名记录吗?接龙渠道的行能进同一个分母吗?有任何一条答不上来,就回到第 18 页的三个选项——改问题、补数据或并列口径。
三轨提示
基础轨:只写 STEP 1,四要素填满即过关。
标准轨:三步全做,公式与筛选规则一一对应。
挑战轨:额外设计一个“并列口径”版本,并说明两个数字为什么不能相加或平均。
数字素养与人工智能通识 · 第 08 周
19 / 36
常见错误:提问题阶段的四个陷阱
问题阶段的一个含糊,到图表阶段会放大成一场误读
✗ 先选图,再倒推问题
看到别人用饼图很漂亮,就先决定画饼图,再凑一个“构成”问题。方向反了:图是答案的形状,先有问题,才知道答案该长什么样。
✗ 分母悄悄换人
分子算的是新生,分母却把志愿者和工作人员都算进去。签到率瞬间被稀释,而且没人发现——因为公式里根本没写口径。
✗ 问题大到无法回答
“新生喜欢什么样的活动?”——没有时间范围、没有可观察指标、数据也不支持。要学会收窄:两周内、现有数据能回答的问题。
✗ 把相关当因果
“报名早的人签到率高,所以早报名导致准时到场”——可能只是组织方式不同。关系类问题只说明关联,下因果结论需要更强的证据。
自查:把你的问题念给同伴——能用“对象、指标、比较维度、用途”四词复述出来的,才合格。
数字素养与人工智能通识 · 第 08 周
20 / 36
第二节检查表:问题立住了吗?
7 条全过,你的问题才有资格进入下一节的 AI 分析
01
问题包含全部四要素:对象、指标、比较维度、用途,缺一项就补写。
02
指标已写成“分子 ÷ 分母”公式,每一项都能落到具体筛选规则。
03
分母经过了逐行检查:志愿者与工作人员的去留、疑似重复的处理都已声明。
04
渠道口径冲突已处理:改问题、补数据或并列口径,没有强行生成精确数字。
05
问题类型明确(比较 / 趋势 / 构成 / 分布 / 关系),且先有问题后想图。
06
问题能在现有数据范围内回答,没有引用不存在的数据。
07
问题原样写进了工作册,第三节 AI 分析将回到这句话逐字核对。
数字素养与人工智能通识 · 第 08 周
21 / 36
第二节小结:先定问题,再选图
图表只是最后一环;发现口径或误读问题时,必须返回前一环修正
“看看有什么发现”
是给心安的,
写清四要素才是给
答案铺路的。
讲义中的验证闭环提醒我们:图表是最后一环。往后每发现一次口径问题或误读,都要回到问题定义这一环修正,而不是在图上反复调色。
01
四要素
对象、指标、比较维度、用途——一个问题立起来的四根柱子。
02
分母即口径
签到率公式里,分母写清了谁能进来;分母含糊的百分比一律不可信。
03
冲突三选一
改问题、补数据、并列口径——口径冲突时宁可诚实的不精确。
04
先问后图
五类问题对应五类图;选图是回答的结果,不是装饰的起点。
数字素养与人工智能通识 · 第 08 周
22 / 36
导入问题
当 AI 三秒钟给出
“签到率 87.5%”
你敢直接写进报告吗?
AI 可以帮助识别异常、生成清理建议、编写公式或代码、汇总数据和制作图表——这些能力都是真的。但它提供的每一个数字,都必须能在原表和操作记录中重现。本节练习的就是这件事:让 AI 协助分析,同时让每一步都可解释。
七项分析记录
原表只读 · 副本作业
关键数字人工复算
第三节 · 45 分钟
03
让 AI 协助分析:
每一步
都可解释
本节产出:一份填完的 AI 分析操作记录(工作册模板 18)
数字素养与人工智能通识 · 第 08 周
23 / 36
开场演示:AI 给了个漂亮结论,全班找茬
5 分钟:这段回答哪里站不住?每人至少提一个问
AI
某 AI 助手 · 收到完整 CSV 后 3 秒返回
分析完成!本次活动共 24 人参与,整体签到率 87.5%,各渠道表现均衡,说明宣传策略非常成功。建议保持现有方式即可,数据质量良好,未发现异常。
看起来专业、完整、还有行动建议——问题在哪?
全班找茬(课堂口头发言,不给标准答案)
“24 人参与”从哪来?
行数是记录数还是人数?重复、无效行排除过吗?
87.5% 的分母是什么?
分子分母各是哪些行?口径声明在哪里?
“各渠道均衡”怎么算的?
接龙渠道有完整报名记录吗?分母可比吗?
“未发现异常”可信吗?
它检查过不可能的时间值和空白列吗?
“建议保持现状”负责任吗?
没有任何限制说明,就敢下行动建议?
本节立场:不是不用 AI,而是让它的每一个数字都能在原表和操作记录中重现——接下来两页给出方法。
数字素养与人工智能通识 · 第 08 周
24 / 36
核心概念:AI 分析操作记录的七项
一份合格的 AI 分析记录至少包含七项——对应工作册模板 18
7 项
01
原文件与副本
使用的是哪个原文件和副本——文件名、位置、版本都要写。
02
问题与口径
分析问题与指标口径,原样粘贴第二节写好的那句话。
03
任务说明
AI 收到的任务说明和允许范围——只许用哪些列、不许做什么。
04
执行步骤
实际执行的筛选、清理、计算步骤,顺序不能省。
05
采用与拒绝
哪些建议被采用、修改或拒绝,以及理由——拒绝也是记录。
06
人工复算
一项人工复算及其结果:至少一个关键数字自己再算一遍。
07
未解决问题
当前仍未解决的数据质量问题——诚实保留缺口,不装干净。
为什么是七项:缺任何一项,“可解释”就断了链条——别人(包括三个月后的你)无法重现这个结论。
数字素养与人工智能通识 · 第 08 周
25 / 36
方法拆解:原表只读,副本作业
最稳妥的操作:既能形成当前分析口径,也能让别人看到原始状态和每一步判断
原表 · 只读07-attendance.csv永不修改 · 永不删除复制分析副本 · 作业区+ 质量标记列+ 处理决定列每行写明:为什么这样处理口径当前分析口径原始状态可回看每一步判断可追溯
“质量标记”列写什么
该行发现了什么:疑似重复、无效时间、口径混合、无报名进入……只描述事实,先不决定去留——标记是记录,不是判决。
“处理决定”列写什么
保留 / 修正 / 排除 / 待确认,加上一句理由。换一种处理规则结果会不会变?会变就要写出来——这正是下一环节追问的入口。
数字素养与人工智能通识 · 第 08 周
26 / 36
方法深化:追问的固定姿势
课中追问口诀:先问依据在哪,再给提示——对 AI 和对同学都一样
3 步
第一步
问依据,不要结论
““依据在哪个文件、哪一行、哪个字段?””
让 AI 把每个数字指回原表的具体位置。指不回来的数字,一律不入记录——它可能只是模型的“合理想象”。
1
第二步
看过程,不只看结果
““你执行了哪些筛选和计算?按顺序列出来。””
要求 AI 展示中间步骤,而不是只给最终值。步骤写得出来,才能复现;写不出来,说明它没真的“算”。
2
第三步
做复算,对齐结果
““我自己按这个步骤再算一遍,看是否一致。””
挑一个关键数字人工复算。一致,记录通过;不一致,先查规则理解差异,再查数据本身——顺序不能反。
3
迁移:这套追问同样用于小组互查——先追问“依据在哪”,再给提示;这是教师参考里明确的课堂互动方式。
数字素养与人工智能通识 · 第 08 周
27 / 36
案例分析:AI 建议“按姓名去重”,然后呢?
看似顺手的专业建议,往往是误删真实记录的开始
AI:检测到姓名重复的记录,建议按姓名去重后重新计算,结果更干净。
我的追问 1:同名是否一定同一人?
班里两个同名同学很正常。姓名不是稳定身份键——没有学号,就不能把“同名”等同于“同人”。
我的追问 2:不同签到时间是否可能代表多次活动?
同一人出现多行,也许是参加了多场活动、多次登记。直接去重,可能把真实记录误删掉。
我的追问 3:自动去重会不会误删真实记录?
让它先说清判定规则和影响范围:会删掉哪些行、不同规则下指标怎么变——再决定采用、修改还是拒绝。
记录怎么写
在操作记录第 05 项写明:AI 建议按姓名去重 → 因无稳定身份键而拒绝自动去重 → 改为标“疑似重复”并在副本注明不同处理规则对结果的影响。
数字素养与人工智能通识 · 第 08 周
28 / 36
动手任务:与 AI 完成一轮可复现的分析(23 分钟)
用第二节写好的问题驱动 AI,同步填写工作册模板 18 操作记录
1 轮
操作流程
① 给 AI 下任务:贴入你的分析问题与口径,声明允许范围(只用哪些列、不许修改文件)。
② 让 AI 执行:识别异常、生成清理建议、给出计算步骤——每一步都要求指回行号与字段。
③ 你来记录:按模板 18 逐列填写输入范围、动作、AI 返回、发现的问题、是否采用。
④ 你来复算:挑一个关键数字(如某渠道的签到率),按它给的步骤人工再算一遍。
⑤ 你来收尾:把仍未解决的问题如实写进记录第 07 项,不装干净。
基础轨
只完成①–③:拿到 AI 结果并完整填写记录,复算留到课后。
标准轨
五步全做;拒绝或修改至少一条 AI 建议,写明理由。
挑战轨
故意让 AI 用两种不同去重规则各算一次,对比结果差异并解释原因。
验收标准:同伴只看你的操作记录,就能不问你任何问题、独立重现同一个数字——这就是“可解释”。
数字素养与人工智能通识 · 第 08 周
29 / 36
常见错误:AI 协作中的四个想当然
AI 分析最大的风险不是算错,而是你没法知道它算没算对
✗ 把 AI 回答当计算结果
“它说 87.5% 就写 87.5%”——大模型生成的是基于上下文的内容,不自动等于事实。没有步骤、没有行号、没有复算的数字,只是看起来像结果。
✗ 让 AI 直接改原表
为了省事把原表交给 AI 清理,改完才发现理由没记、原状没了。正确姿势:原表只读,AI 只在副本上建议,决定由你写理由。
✗ 全盘照单,无一条拒绝
记录里“是否采用”全是勾——这不是协作,是代劳。合格的记录至少有一处“采用 / 修改 / 拒绝”的取舍和理由,证明判断发生在你这里。
✗ 复算不一致就怀疑数据
一不一致就断定“数据有问题”。排查有顺序:先查双方对口径和规则的理解是否一致,再查步骤是否相同,最后才轮到怀疑数据本身。
一句话记住:AI 负责加速,你负责可解释——数字能重现,结论才算数。
数字素养与人工智能通识 · 第 08 周
30 / 36
第三节检查表:这轮 AI 分析能交吗?
7 条对应七项记录——交之前逐项自查,缺哪条补哪条
记录写明了所用原文件与副本的文件名和位置。
第二节的问题与口径原样粘贴,没有改动措辞。
给 AI 的任务说明与允许范围已原文保存。
筛选、清理、计算步骤按顺序完整可查。
至少一条 AI 建议被采用 / 修改 / 拒绝,理由写清。
一项关键数字已人工复算,结果与 AI 一致(或差异已解释)。
仍未解决的数据质量问题已如实写入记录。
原表保持只读;所有标记与决定都在副本中留痕。
收束一句
原表只读,副本作业,复算留痕——这三件事做到了,AI 才是你的分析员,而不是你的替身。
数字素养与人工智能通识 · 第 08 周
31 / 36
第三节小结:每一步都可解释
AI 协作的目标不是更快出数,而是让每个数字都经得起追问
数字能重现
结论才算数。
本周三节课其实是一条链:数据字典让字段可解释,分析问题让计算有终点,操作记录让 AI 可回查。任何一环断了,后面的图表再漂亮也要推倒重来——这正是讲义中“验证闭环”的含义。
01
七项记录缺一不可
从原文件到未解决问题,链条断在哪,重现就死在哪。
02
拒绝也是判断
对 AI 的建议有取有舍并写明理由,思考才发生在你身上。
03
复算是最低训练量
关键数字人工再算一遍——不是不信任 AI,是保持思维强度。
数字素养与人工智能通识 · 第 08 周
32 / 36
课堂节奏:三节课 × 45 分钟
每节课都是“导入 → 讲授 → 动手 → 对抗/揭晓 → 收束”五段
第 1 节 · 读字段
0–5'
导入:24 行 = 24 人吗?(埋下悬念)
5–15'
讲授数据字典六问
15–35'
动手:为 CSV 建立 8 字段的数据字典
35–43'
揭晓:实际人数为什么少于 24?各组报数
43–45'
收束:行数 ≠ 人数
第 2 节 · 提问题
0–5'
快问:“看看数据有什么发现”卡在哪?
5–15'
讲授分析问题公式与指标定义(写清分母)
15–35'
动手:写分析问题 + 指标公式 + 分母检查
35–43'
口径冲突:接龙渠道没有完整报名记录怎么办?
43–45'
收束:先定问题再选图
第 3 节 · AI 协作分析
0–5'
演示:AI 给出一个漂亮结论,全班找茬
5–12'
讲授七项分析记录要求
12–35'
动手:与 AI 协作完成一轮分析,同步填写操作记录
35–43'
追问练习:AI 建议按姓名去重——该问它什么?
43–45'
收束:原表只读,副本作业,复算留痕
数字素养与人工智能通识 · 第 08 周
33 / 36
中国语境:数据素养是公共能力,不只是理工科技能
国家战略 · 武大课程 · 校园现实 · AI 依赖 · 数据合规
第五大生产要素
“数据二十条”与数据要素市场建设中,数据已被确立为与土地、劳动力、资本、技术并列的第五大生产要素。武大开设《数据要素》《数据科学导论》等全校课程,校长张平文院士亲自讲授数据科学——无论你学什么专业,“看懂数据”都会成为基本素养。
校园里每天都在产生“脏数据”
报名接龙、问卷星、签到表、社团纳新表……本课用的 07-attendance.csv 里有重复行、不可能时间、口径混合——这不是教学刁难,而是真实世界的常态。学会整理它们,是大学第一年的实用技能。
约四成研究生承认 AI 依赖致思维惰性
浙大团队的调研提醒我们:AI 可以秒级给出精确数字,但约四成受访研究生承认过度依赖 AI 造成思维惰性。数据领域的表现就是——看起来会算,其实不会算,也不敢质疑算出的数。人工复算一次,就是保持思维强度的最低训练量。
个人信息保护法的脱敏要求
处理个人信息须遵循最小必要与知情同意。分析问卷和报名数据时,姓名、学号、手机号都属于个人信息——课程演练统一使用模拟资料;真实数据必须先脱敏,再进入分析流程。
数字素养与人工智能通识 · 第 08 周
34 / 36
深一步追问 与 迁移练习
左边给“吃不饱”的同学,右边是本周课后作业
深一步追问(不设标准答案)
Q1 · 为什么“平均值”最容易骗人?
举一个用平均值掩盖分布差异的校园例子——想想“平均绩点”“平均每天使用手机时长”。
Q2 · 空白的四种含义混淆,各会引发什么错误结论?
没有 / 未知 / 未填 / 不适用——逐对推演:每一种混淆会把你引向哪个错误方向?
Q3 · AI 分析与人工复算不一致,先排查什么?
排除哪些原因之后,才应该怀疑数据本身?把排查顺序写成一串。
迁移练习 · 本周作业
找一张不含敏感信息的小表格(社团台账、课程评价汇总、公开数据集均可),完成三件事:
① 5 字段数据字典
至少 5 个字段逐一回答六问,写明空白含义。
② 3 类质量问题
标出 3 类质量问题并写明位置与建议处理方式。
③ 1 个可回答问题
设计一个能在现有数据范围内回答的问题,附指标公式与分母说明。
下节课带入小组互查:同伴只凭你的字典和问题,复算你的数字。
数字素养与人工智能通识 · 第 08 周
35 / 36
第 08 周 · 收束
行数只是表的物理结构,
不自动等于现实中的人数
下一周我们把整理好的底稿画成图——带着数据字典、写清分母的问题和一份可复现的 AI 分析记录,图表才值得被相信。
武汉大学通识课 · 数字素养与人工智能通识 · 任务三(上)
36 / 36
第08周-数据整理与字典
← → 翻页 · Home/End 首尾 · F 全屏