一列数据表示的变量及其含义。
Appearance
Appearance
数据表看起来比文字材料更“客观”,但表中每一行如何形成、每一列代表什么、哪些人没有进入数据,都会影响结论。本周不急着画图,先把原始表变成一份可以解释、可以复算的数据工作底稿。
学习成果包括数据字典、质量问题记录、分析问题和 AI 分析操作记录。原则是:保留原表,所有清理都有理由,关键数字至少人工复算一次。
图 3:图表只是最后一环,发现口径或误读问题时必须返回前一环修正。
打开表格后,第一步不是求平均值,而是建立数据字典(Data Dictionary)。每个字段至少要回答:
07-attendance.csv 有 24 行,但不能直接说“有 24 名参与者”。同一个姓名可能重复出现,志愿者和新生混在一起,异常时间 25:08 不可能成立,还有无报名无签到却进入表格的记录。行数只是表的物理结构,不自动等于现实中的人数。
数据质量问题可以分成缺失、重复、无效值、口径混合、时间错位和身份不明。每发现一处,先记录,不要立即删除。没有稳定身份键时,只能把重复标为“疑似”,并说明不同处理规则会怎样影响结果。
没有读懂字段含义就开始画图,会造成什么误导?
数据表中的每一列都代表一个定义、单位和采集方式;没读懂字段就可能算出漂亮但无意义的结果。
一列数据表示的变量及其含义。
数值是人数、金额、比例还是时间。
空白、重复、极端值可能来自真实情况,也可能是录入问题。
教师示范:教师打开一张样例表,逐列问“它代表什么、单位是什么、哪些值需要先检查”。
易错提醒:不要一拿到表就让 AI 直接“分析并画图”。
不要先给定义。先把问题“没有读懂字段含义就开始画图,会造成什么误导?”投出来,给学生 30 秒独立判断,再请两位同学说出不同答案;教师只追问依据,暂不公布结论。
结合07-attendance.csv和数据字典模板呈现一个小情境,让学生先说“我会怎么做”,把已有经验调动出来。
依次解释“字段—单位—缺失与异常”。每解释一个概念,都回到情境中指出它对应的事实、动作或判断。
教师打开一张样例表,逐列问“它代表什么、单位是什么、哪些值需要先检查”。
明确边界:不要一拿到表就让 AI 直接“分析并画图”。 请学生用一句话改写刚才的判断,让它更准确、可执行。
课堂案例:以“先看数据:每一列到底表示什么”为场景,先让学生仅凭直觉给出做法;再要求他们用“字段、单位、缺失与异常”逐项说明依据,比较两种做法会得到什么不同结果。
收束:本节不要求学生背出术语,而要能用字段、单位、缺失与异常解释自己的选择。
过渡到实践:进入任务前,先让学生把三个关键点勾到任务单上;后续操作要服务于本节目标:“建立数据字典,识别字段含义、单位、缺失值、重复值和时间范围。”。
问一问 · 读字段 · 问一问 · 工作目录「灯火计划」· 灯火计划资料包
请阅读 07-attendance.csv,不要画图、不要给晚会建议。
输出数据字典:字段名、含义、单位、取值范围、缺失/异常备注。
指出你不确定的字段,标成待确认。
不要改正原表。逐列问“它代表什么、单位是什么”。
提交数据字典。
看教师投屏的前 8 行,完成 3 个字段定义。
WorkBuddy 实战蓝皮书 https://workbuddy.homes/ 第 11 章 Excel:先读懂再计算
AI 会参与这节课,但它不是替学生完成任务;每次使用都要留下可核验的过程证据。
数据整理与分析助手
协助解释字段、提出清理步骤、完成小范围汇总或提示异常值。
先保留原始数据,再核对字段含义、计算逻辑和异常是否真实存在。
保留输入数据范围、操作记录、AI 输出和至少一项人工复算。
建立数据字典,识别字段含义、单位、缺失值、重复值和时间范围。
组内分列检查,再合并为一份共同数据字典。
学生:听清本节要使用的概念、操作边界和完成标准,在任务单上标记关键动作。
教师:先讲“为什么这样做”,再讲工具或步骤;说明资料边界和不可擅自执行的动作。
学生:跟着示范观察一遍完整的最小流程,记录输入、动作、检查和输出。
教师:投屏完成一个小样,边做边说出判断依据和常见错误。
学生:在小组内用同一份小样资料完成关键一步,再相互核对。
教师:用追问代替代做:先问资料够不够、动作是否明确、结果怎样检查。
学生:基于真实或模拟资料完成自己的首版,并保留来源和操作痕迹。
教师:巡视并记录常见偏差,提醒不确定信息要标出。
学生:提交版本、依据与下一步修改说明。
教师:检查证据是否足够,并决定下节从哪里继续。
一份数据字典,含字段含义、单位、时间和问题备注。
提示:要求学生保留资料来源、版本和判断理由;智能体输出不能替代这些证据。
备用方案:打印表头,手工写字典。
“看看数据有什么发现”没有明确终点。一个可分析问题应写清对象、指标、比较维度和用途。例如:
在排除工作人员并保留疑似重复记录的口径下,不同报名渠道的新生签到率有何差异?这个差异是否值得筹备组调整提醒方式?
接着必须定义指标:
签到率 = 符合口径且完成签到的人数 ÷ 符合口径的报名人数分子和分母都要能落到筛选规则。若“学院群接龙”没有完整报名记录,就不能与统一平台直接使用同一分母比较。此时可以改问题、补数据,或并列展示两种口径,而不是强行生成一个精确数字。
常见分析问题包括比较、趋势、构成、分布和关系。先确定问题类型,再决定需要什么计算和图表;不要先选一个漂亮图形,再倒推它似乎能说明什么。
“画一张图”为什么不是一个好的分析任务?
先说清观众需要知道什么,再决定比较、趋势、构成或关系中的哪一种表达最合适。
不同对象之间谁多谁少、差异多大。
同一指标随时间怎样变化。
一个整体由哪些部分组成。
教师示范:教师展示同一组数据的柱状图、折线图和饼图,让学生判断各自回答了什么问题。
易错提醒:不要先选“好看的图”,再倒推它要回答的问题。
不要先给定义。先把问题““画一张图”为什么不是一个好的分析任务?”投出来,给学生 30 秒独立判断,再请两位同学说出不同答案;教师只追问依据,暂不公布结论。
结合数据字典和问题设计卡呈现一个小情境,让学生先说“我会怎么做”,把已有经验调动出来。
依次解释“比较—趋势—构成”。每解释一个概念,都回到情境中指出它对应的事实、动作或判断。
教师展示同一组数据的柱状图、折线图和饼图,让学生判断各自回答了什么问题。
明确边界:不要先选“好看的图”,再倒推它要回答的问题。 请学生用一句话改写刚才的判断,让它更准确、可执行。
课堂案例:以“提出数据问题:图表要回答什么”为场景,先让学生仅凭直觉给出做法;再要求他们用“比较、趋势、构成”逐项说明依据,比较两种做法会得到什么不同结果。
收束:本节不要求学生背出术语,而要能用比较、趋势、构成解释自己的选择。
过渡到实践:进入任务前,先让学生把三个关键点勾到任务单上;后续操作要服务于本节目标:“把数据兴趣转化为对象、指标、比较方式和读者明确的分析问题。”。
想一想 · 图表要回答的问题 · 想一想 · 工作目录「灯火计划」· 灯火计划资料包
根据数据字典,提出三个分析问题。
每个问题写清:对象、指标、比较方式、读者是谁、现有数据能否回答。
不要建议我们还没采集的新数据,也不要直接生成图表。用同一组数据说明柱状/折线/构成各自回答什么。
提交入选问题。
从三张问题卡里选一张并改到可回答。
WorkBuddy 实战蓝皮书 https://workbuddy.homes/ 第 4 章:输出和验收先写清
AI 会参与这节课,但它不是替学生完成任务;每次使用都要留下可核验的过程证据。
数据整理与分析助手
协助解释字段、提出清理步骤、完成小范围汇总或提示异常值。
先保留原始数据,再核对字段含义、计算逻辑和异常是否真实存在。
保留输入数据范围、操作记录、AI 输出和至少一项人工复算。
把数据兴趣转化为对象、指标、比较方式和读者明确的分析问题。
每组提出三个问题,其他组投票选择“最可回答、最有用”的一个。
学生:听清本节要使用的概念、操作边界和完成标准,在任务单上标记关键动作。
教师:先讲“为什么这样做”,再讲工具或步骤;说明资料边界和不可擅自执行的动作。
学生:跟着示范观察一遍完整的最小流程,记录输入、动作、检查和输出。
教师:投屏完成一个小样,边做边说出判断依据和常见错误。
学生:在小组内用同一份小样资料完成关键一步,再相互核对。
教师:用追问代替代做:先问资料够不够、动作是否明确、结果怎样检查。
学生:基于真实或模拟资料完成自己的首版,并保留来源和操作痕迹。
教师:巡视并记录常见偏差,提醒不确定信息要标出。
学生:提交版本、依据与下一步修改说明。
教师:检查证据是否足够,并决定下节从哪里继续。
一个明确的数据问题和对应指标说明。
提示:要求学生保留资料来源、版本和判断理由;智能体输出不能替代这些证据。
备用方案:问题设计卡。
AI 可以帮助识别异常、生成清理建议、编写公式或代码、汇总数据和制作图表。但它提供的数字必须能在原表和操作记录中重现。
一份合格的 AI 分析记录至少包含:
例如,AI 建议按姓名去重时,应立即追问:同名是否一定同一人?不同签到时间是否可能代表多次活动?没有学号或稳定标识时,自动去重会不会误删真实记录?
最稳妥的操作是保留只读原表,在副本中新增“质量标记”和“处理决定”列。这样既能形成当前分析口径,也能让别人看到原始状态和每一步判断。
怎样让 AI 帮忙整理或分析数据,同时保留你能解释的过程?
对 AI 的请求应包含数据范围、问题、方法约束和期望输出;结果要能回到原表核对。
明确使用哪张表、哪些列、哪些行。
如去重、分组、计算或比较,不能只说“分析一下”。
输出要包含计算依据、图表说明和异常提醒。
教师示范:教师让 AI 对一小份表做分组统计,再手工核对一项计算和一条异常提示。
易错提醒:不要把 AI 给出的数字直接复制进报告而不核对原表。
不要先给定义。先把问题“怎样让 AI 帮忙整理或分析数据,同时保留你能解释的过程?”投出来,给学生 30 秒独立判断,再请两位同学说出不同答案;教师只追问依据,暂不公布结论。
结合原始数据和分析操作记录表呈现一个小情境,让学生先说“我会怎么做”,把已有经验调动出来。
依次解释“输入范围—分析动作—可解释结果”。每解释一个概念,都回到情境中指出它对应的事实、动作或判断。
教师让 AI 对一小份表做分组统计,再手工核对一项计算和一条异常提示。
明确边界:不要把 AI 给出的数字直接复制进报告而不核对原表。 请学生用一句话改写刚才的判断,让它更准确、可执行。
课堂案例:以“让 AI 协助分析:每一步都可解释”为场景,先让学生仅凭直觉给出做法;再要求他们用“输入范围、分析动作、可解释结果”逐项说明依据,比较两种做法会得到什么不同结果。
收束:本节不要求学生背出术语,而要能用输入范围、分析动作、可解释结果解释自己的选择。
过渡到实践:进入任务前,先让学生把三个关键点勾到任务单上;后续操作要服务于本节目标:“用可复核指令让 AI 协助清理、汇总或提出分析建议,并记录操作过程。”。
做一做 · 可复核的小汇总 · 做一做 · 工作目录「灯火计划」· 灯火计划资料包
输入:07-attendance.csv 的副本,不要改原文件。
问题:(粘贴本组选定问题)
动作:按指定字段分组计数;列出重复行和缺失签到。
约束:写明计算口径;异常值不要悄悄删除。
输出:汇总.md + 操作记录.md(输入范围、操作、结果、需人工核对项)。
验收:我能根据操作记录手工复算其中一项。对一小份表做分组统计并手工核对。
提交汇总和操作记录。
用教师提供的汇总结果,复算一个格子。
WorkBuddy 实战蓝皮书 https://workbuddy.homes/ 第 11 章:数字与原文一致
AI 会参与这节课,但它不是替学生完成任务;每次使用都要留下可核验的过程证据。
数据整理与分析助手
协助解释字段、提出清理步骤、完成小范围汇总或提示异常值。
先保留原始数据,再核对字段含义、计算逻辑和异常是否真实存在。
保留输入数据范围、操作记录、AI 输出和至少一项人工复算。
用可复核指令让 AI 协助清理、汇总或提出分析建议,并记录操作过程。
两人交换操作记录,检查是否能复现一次处理。
学生:听清本节要使用的概念、操作边界和完成标准,在任务单上标记关键动作。
教师:先讲“为什么这样做”,再讲工具或步骤;说明资料边界和不可擅自执行的动作。
学生:跟着示范观察一遍完整的最小流程,记录输入、动作、检查和输出。
教师:投屏完成一个小样,边做边说出判断依据和常见错误。
学生:在小组内用同一份小样资料完成关键一步,再相互核对。
教师:用追问代替代做:先问资料够不够、动作是否明确、结果怎样检查。
学生:基于真实或模拟资料完成自己的首版,并保留来源和操作痕迹。
教师:巡视并记录常见偏差,提醒不确定信息要标出。
学生:提交版本、依据与下一步修改说明。
教师:检查证据是否足够,并决定下节从哪里继续。
一份数据处理记录,含输入、操作、结果和人工核对。
提示:要求学生保留资料来源、版本和判断理由;智能体输出不能替代这些证据。
备用方案:预计算的汇总表 + 一个让学生复算的空格。
07-attendance.csv 里有重复行、不可能时间(25:08)、口径混合——这不是教学刁难,而是真实世界的常态。| 课节 | 时间线 | 环节 |
|---|---|---|
| 第 1 节 · 读字段 | 0–5' | 导入:24 行 = 24 人吗?(埋下悬念) |
| 5–15' | 讲授数据字典六问 | |
| 15–35' | 动手:为 CSV 建立 8 字段的数据字典 | |
| 35–43' | 揭晓:实际人数为什么少于 24?各组报数 | |
| 43–45' | 收束:行数≠人数 | |
| 第 2 节 · 提问题 | 0–5' | 快问:"看看数据有什么发现"卡在哪? |
| 5–15' | 讲授分析问题公式与指标定义(写清分母) | |
| 15–35' | 动手:写分析问题 + 指标公式 + 分母检查 | |
| 35–43' | 口径冲突:接龙渠道没有完整报名记录怎么办? | |
| 43–45' | 收束:先定问题再选图 | |
| 第 3 节 · AI 协作分析 | 0–5' | 演示:AI 给出一个漂亮结论,全班找茬 |
| 5–12' | 讲授七项分析记录要求 | |
| 12–35' | 动手:与 AI 协作完成一轮分析,同步填写操作记录 | |
| 35–43' | 追问练习:AI 建议按姓名去重——该问它什么? | |
| 43–45' | 收束:原表只读,副本作业,复算留痕 |
找一张不含敏感信息的小表格,为至少 5 个字段建立数据字典,标出 3 类质量问题,并设计一个可以在现有数据范围内回答的问题。