Skip to content

第 08 周 · 任务三(上):把数据整理成可回答的问题

数据表看起来比文字材料更“客观”,但表中每一行如何形成、每一列代表什么、哪些人没有进入数据,都会影响结论。本周不急着画图,先把原始表变成一份可以解释、可以复算的数据工作底稿。

学习成果包括数据字典、质量问题记录、分析问题和 AI 分析操作记录。原则是:保留原表,所有清理都有理由,关键数字至少人工复算一次。

数据分析验证闭环

图 3:图表只是最后一环,发现口径或误读问题时必须返回前一环修正。

先看数据:每一列到底表示什么

打开表格后,第一步不是求平均值,而是建立数据字典(Data Dictionary)。每个字段至少要回答:

  • 字段名称和业务含义是什么?
  • 它是文本、日期、类别还是数值?
  • 单位是什么,允许哪些取值?
  • 空白表示没有、未知、未填还是不适用?
  • 一行代表一次记录、一个人还是一个事件?
  • 是否存在稳定身份键,可以判断重复?

07-attendance.csv 有 24 行,但不能直接说“有 24 名参与者”。同一个姓名可能重复出现,志愿者和新生混在一起,异常时间 25:08 不可能成立,还有无报名无签到却进入表格的记录。行数只是表的物理结构,不自动等于现实中的人数。

数据质量问题可以分成缺失、重复、无效值、口径混合、时间错位和身份不明。每发现一处,先记录,不要立即删除。没有稳定身份键时,只能把重复标为“疑似”,并说明不同处理规则会怎样影响结果。

第四阶段 · 真实任务三 · 第 1 课 · 45 分钟

先看数据:每一列到底表示什么

没有读懂字段含义就开始画图,会造成什么误导?

先理解再动手

数据分析先理解字段含义与质量,再谈图表和结论

数据表中的每一列都代表一个定义、单位和采集方式;没读懂字段就可能算出漂亮但无意义的结果。

字段

一列数据表示的变量及其含义。

单位

数值是人数、金额、比例还是时间。

缺失与异常

空白、重复、极端值可能来自真实情况,也可能是录入问题。

教师示范:教师打开一张样例表,逐列问“它代表什么、单位是什么、哪些值需要先检查”。

易错提醒:不要一拿到表就让 AI 直接“分析并画图”。

教师讲解脚本 · 8 分钟

不要先给定义。先把问题“没有读懂字段含义就开始画图,会造成什么误导?”投出来,给学生 30 秒独立判断,再请两位同学说出不同答案;教师只追问依据,暂不公布结论。

  1. 0–2 分钟
    从真实情境进入

    结合07-attendance.csv和数据字典模板呈现一个小情境,让学生先说“我会怎么做”,把已有经验调动出来。

  2. 2–4 分钟
    拆开三个关键点

    依次解释“字段—单位—缺失与异常”。每解释一个概念,都回到情境中指出它对应的事实、动作或判断。

  3. 4–6 分钟
    示范完整判断过程

    教师打开一张样例表,逐列问“它代表什么、单位是什么、哪些值需要先检查”。

  4. 6–8 分钟
    用反例校正理解

    明确边界:不要一拿到表就让 AI 直接“分析并画图”。 请学生用一句话改写刚才的判断,让它更准确、可执行。

课堂案例与追问

课堂案例:以“先看数据:每一列到底表示什么”为场景,先让学生仅凭直觉给出做法;再要求他们用“字段、单位、缺失与异常”逐项说明依据,比较两种做法会得到什么不同结果。

  • “你的判断依据来自材料中的哪一处,而不是自己的猜测?”
  • “如果缺少字段,这一步还能直接开始吗?需要补什么?”
  • “哪一种做法最容易出现‘不要一拿到表就让 AI 直接“分析并画图”。’这类问题?怎样提前避免?”

收束:本节不要求学生背出术语,而要能用字段、单位、缺失与异常解释自己的选择。

过渡到实践:进入任务前,先让学生把三个关键点勾到任务单上;后续操作要服务于本节目标:“建立数据字典,识别字段含义、单位、缺失值、重复值和时间范围。”。

WorkBuddy 实操卡

问一问 · 读字段 · 问一问 · 工作目录「灯火计划」· 灯火计划资料包

  1. 把 07-attendance.csv 放入工作目录
  2. 「问一问」解释每列含义、单位、缺失和异常
  3. 组内合并为一份数据字典,不画图
请阅读 07-attendance.csv,不要画图、不要给晚会建议。
输出数据字典:字段名、含义、单位、取值范围、缺失/异常备注。
指出你不确定的字段,标成待确认。
不要改正原表。
预期看到
  • 发现缺失签到、重复姓名或异常时间
  • 没有把“报名人数”直接说成“到场人数”
人必须检查
  • 每列含义是人确认过的
  • 原 CSV 未被覆盖
禁止
  • 不开启「允许完全访问」
  • 不发送群消息、邮件或通知
  • 不写入真实日历或通讯录
  • 不上传学号、手机号、身份证号等个人敏感信息
教师机

逐列问“它代表什么、单位是什么”。

有电脑的学生

提交数据字典。

手机学生

看教师投屏的前 8 行,完成 3 个字段定义。

WorkBuddy 实战蓝皮书 https://workbuddy.homes/ 第 11 章 Excel:先读懂再计算

本节 AI 协作点

AI 会参与这节课,但它不是替学生完成任务;每次使用都要留下可核验的过程证据。

AI 的角色

数据整理与分析助手

让 AI 做什么

协助解释字段、提出清理步骤、完成小范围汇总或提示异常值。

人要检查什么

先保留原始数据,再核对字段含义、计算逻辑和异常是否真实存在。

保留什么证据

保留输入数据范围、操作记录、AI 输出和至少一项人工复算。

本节目标

建立数据字典,识别字段含义、单位、缺失值、重复值和时间范围。

准备材料
  • 07-attendance.csv
  • 数据字典模板
  • WorkBuddy 或表格工具
互动方式

组内分列检查,再合并为一份共同数据字典。

  1. 0–8 分钟
    方法讲解

    学生:听清本节要使用的概念、操作边界和完成标准,在任务单上标记关键动作。

    教师:先讲“为什么这样做”,再讲工具或步骤;说明资料边界和不可擅自执行的动作。

  2. 8–15 分钟
    教师示范

    学生:跟着示范观察一遍完整的最小流程,记录输入、动作、检查和输出。

    教师:投屏完成一个小样,边做边说出判断依据和常见错误。

  3. 15–27 分钟
    引导练习

    学生:在小组内用同一份小样资料完成关键一步,再相互核对。

    教师:用追问代替代做:先问资料够不够、动作是否明确、结果怎样检查。

  4. 27–39 分钟
    独立实践

    学生:基于真实或模拟资料完成自己的首版,并保留来源和操作痕迹。

    教师:巡视并记录常见偏差,提醒不确定信息要标出。

  5. 39–45 分钟
    提交与复盘

    学生:提交版本、依据与下一步修改说明。

    教师:检查证据是否足够,并决定下节从哪里继续。

完成证据

一份数据字典,含字段含义、单位、时间和问题备注。

离场前自查

已完成 0 / 3 项

给教师的提示与备用方案

提示:要求学生保留资料来源、版本和判断理由;智能体输出不能替代这些证据。

备用方案:打印表头,手工写字典。

提出数据问题:图表要回答什么

“看看数据有什么发现”没有明确终点。一个可分析问题应写清对象、指标、比较维度和用途。例如:

在排除工作人员并保留疑似重复记录的口径下,不同报名渠道的新生签到率有何差异?这个差异是否值得筹备组调整提醒方式?

接着必须定义指标:

text
签到率 = 符合口径且完成签到的人数 ÷ 符合口径的报名人数

分子和分母都要能落到筛选规则。若“学院群接龙”没有完整报名记录,就不能与统一平台直接使用同一分母比较。此时可以改问题、补数据,或并列展示两种口径,而不是强行生成一个精确数字。

常见分析问题包括比较、趋势、构成、分布和关系。先确定问题类型,再决定需要什么计算和图表;不要先选一个漂亮图形,再倒推它似乎能说明什么。

第四阶段 · 真实任务三 · 第 2 课 · 45 分钟

提出数据问题:图表要回答什么

“画一张图”为什么不是一个好的分析任务?

先理解再动手

图表应服务一个明确问题,而不是展示所有可计算的数字

先说清观众需要知道什么,再决定比较、趋势、构成或关系中的哪一种表达最合适。

比较

不同对象之间谁多谁少、差异多大。

趋势

同一指标随时间怎样变化。

构成

一个整体由哪些部分组成。

教师示范:教师展示同一组数据的柱状图、折线图和饼图,让学生判断各自回答了什么问题。

易错提醒:不要先选“好看的图”,再倒推它要回答的问题。

教师讲解脚本 · 8 分钟

不要先给定义。先把问题““画一张图”为什么不是一个好的分析任务?”投出来,给学生 30 秒独立判断,再请两位同学说出不同答案;教师只追问依据,暂不公布结论。

  1. 0–2 分钟
    从真实情境进入

    结合数据字典和问题设计卡呈现一个小情境,让学生先说“我会怎么做”,把已有经验调动出来。

  2. 2–4 分钟
    拆开三个关键点

    依次解释“比较—趋势—构成”。每解释一个概念,都回到情境中指出它对应的事实、动作或判断。

  3. 4–6 分钟
    示范完整判断过程

    教师展示同一组数据的柱状图、折线图和饼图,让学生判断各自回答了什么问题。

  4. 6–8 分钟
    用反例校正理解

    明确边界:不要先选“好看的图”,再倒推它要回答的问题。 请学生用一句话改写刚才的判断,让它更准确、可执行。

课堂案例与追问

课堂案例:以“提出数据问题:图表要回答什么”为场景,先让学生仅凭直觉给出做法;再要求他们用“比较、趋势、构成”逐项说明依据,比较两种做法会得到什么不同结果。

  • “你的判断依据来自材料中的哪一处,而不是自己的猜测?”
  • “如果缺少比较,这一步还能直接开始吗?需要补什么?”
  • “哪一种做法最容易出现‘不要先选“好看的图”,再倒推它要回答的问题。’这类问题?怎样提前避免?”

收束:本节不要求学生背出术语,而要能用比较、趋势、构成解释自己的选择。

过渡到实践:进入任务前,先让学生把三个关键点勾到任务单上;后续操作要服务于本节目标:“把数据兴趣转化为对象、指标、比较方式和读者明确的分析问题。”。

WorkBuddy 实操卡

想一想 · 图表要回答的问题 · 想一想 · 工作目录「灯火计划」· 灯火计划资料包

  1. 基于数据字典提出三个可被现有数据回答的问题
  2. 投票选一个
  3. 不在这节出图
根据数据字典,提出三个分析问题。
每个问题写清:对象、指标、比较方式、读者是谁、现有数据能否回答。
不要建议我们还没采集的新数据,也不要直接生成图表。
预期看到
  • 问题能被这张表回答
  • 不是“画一张好看的图”
人必须检查
  • 比较对象明确
  • 读者明确
禁止
  • 不开启「允许完全访问」
  • 不发送群消息、邮件或通知
  • 不写入真实日历或通讯录
  • 不上传学号、手机号、身份证号等个人敏感信息
教师机

用同一组数据说明柱状/折线/构成各自回答什么。

有电脑的学生

提交入选问题。

手机学生

从三张问题卡里选一张并改到可回答。

WorkBuddy 实战蓝皮书 https://workbuddy.homes/ 第 4 章:输出和验收先写清

本节 AI 协作点

AI 会参与这节课,但它不是替学生完成任务;每次使用都要留下可核验的过程证据。

AI 的角色

数据整理与分析助手

让 AI 做什么

协助解释字段、提出清理步骤、完成小范围汇总或提示异常值。

人要检查什么

先保留原始数据,再核对字段含义、计算逻辑和异常是否真实存在。

保留什么证据

保留输入数据范围、操作记录、AI 输出和至少一项人工复算。

本节目标

把数据兴趣转化为对象、指标、比较方式和读者明确的分析问题。

准备材料
  • 数据字典
  • 问题设计卡
  • 图表案例
互动方式

每组提出三个问题,其他组投票选择“最可回答、最有用”的一个。

  1. 0–8 分钟
    方法讲解

    学生:听清本节要使用的概念、操作边界和完成标准,在任务单上标记关键动作。

    教师:先讲“为什么这样做”,再讲工具或步骤;说明资料边界和不可擅自执行的动作。

  2. 8–15 分钟
    教师示范

    学生:跟着示范观察一遍完整的最小流程,记录输入、动作、检查和输出。

    教师:投屏完成一个小样,边做边说出判断依据和常见错误。

  3. 15–27 分钟
    引导练习

    学生:在小组内用同一份小样资料完成关键一步,再相互核对。

    教师:用追问代替代做:先问资料够不够、动作是否明确、结果怎样检查。

  4. 27–39 分钟
    独立实践

    学生:基于真实或模拟资料完成自己的首版,并保留来源和操作痕迹。

    教师:巡视并记录常见偏差,提醒不确定信息要标出。

  5. 39–45 分钟
    提交与复盘

    学生:提交版本、依据与下一步修改说明。

    教师:检查证据是否足够,并决定下节从哪里继续。

完成证据

一个明确的数据问题和对应指标说明。

离场前自查

已完成 0 / 3 项

给教师的提示与备用方案

提示:要求学生保留资料来源、版本和判断理由;智能体输出不能替代这些证据。

备用方案:问题设计卡。

让 AI 协助分析:每一步都可解释

AI 可以帮助识别异常、生成清理建议、编写公式或代码、汇总数据和制作图表。但它提供的数字必须能在原表和操作记录中重现。

一份合格的 AI 分析记录至少包含:

  1. 使用的是哪个原文件和副本。
  2. 分析问题与指标口径。
  3. AI 收到的任务说明和允许范围。
  4. 实际执行的筛选、清理、计算步骤。
  5. 哪些建议被采用、修改或拒绝,以及理由。
  6. 一项人工复算及其结果。
  7. 当前仍未解决的数据质量问题。

例如,AI 建议按姓名去重时,应立即追问:同名是否一定同一人?不同签到时间是否可能代表多次活动?没有学号或稳定标识时,自动去重会不会误删真实记录?

最稳妥的操作是保留只读原表,在副本中新增“质量标记”和“处理决定”列。这样既能形成当前分析口径,也能让别人看到原始状态和每一步判断。

第四阶段 · 真实任务三 · 第 3 课 · 45 分钟

让 AI 协助分析:每一步都可解释

怎样让 AI 帮忙整理或分析数据,同时保留你能解释的过程?

先理解再动手

AI 可以协助分析,但每一步都要让人能复查输入、操作与结果

对 AI 的请求应包含数据范围、问题、方法约束和期望输出;结果要能回到原表核对。

输入范围

明确使用哪张表、哪些列、哪些行。

分析动作

如去重、分组、计算或比较,不能只说“分析一下”。

可解释结果

输出要包含计算依据、图表说明和异常提醒。

教师示范:教师让 AI 对一小份表做分组统计,再手工核对一项计算和一条异常提示。

易错提醒:不要把 AI 给出的数字直接复制进报告而不核对原表。

教师讲解脚本 · 8 分钟

不要先给定义。先把问题“怎样让 AI 帮忙整理或分析数据,同时保留你能解释的过程?”投出来,给学生 30 秒独立判断,再请两位同学说出不同答案;教师只追问依据,暂不公布结论。

  1. 0–2 分钟
    从真实情境进入

    结合原始数据和分析操作记录表呈现一个小情境,让学生先说“我会怎么做”,把已有经验调动出来。

  2. 2–4 分钟
    拆开三个关键点

    依次解释“输入范围—分析动作—可解释结果”。每解释一个概念,都回到情境中指出它对应的事实、动作或判断。

  3. 4–6 分钟
    示范完整判断过程

    教师让 AI 对一小份表做分组统计,再手工核对一项计算和一条异常提示。

  4. 6–8 分钟
    用反例校正理解

    明确边界:不要把 AI 给出的数字直接复制进报告而不核对原表。 请学生用一句话改写刚才的判断,让它更准确、可执行。

课堂案例与追问

课堂案例:以“让 AI 协助分析:每一步都可解释”为场景,先让学生仅凭直觉给出做法;再要求他们用“输入范围、分析动作、可解释结果”逐项说明依据,比较两种做法会得到什么不同结果。

  • “你的判断依据来自材料中的哪一处,而不是自己的猜测?”
  • “如果缺少输入范围,这一步还能直接开始吗?需要补什么?”
  • “哪一种做法最容易出现‘不要把 AI 给出的数字直接复制进报告而不核对原表。’这类问题?怎样提前避免?”

收束:本节不要求学生背出术语,而要能用输入范围、分析动作、可解释结果解释自己的选择。

过渡到实践:进入任务前,先让学生把三个关键点勾到任务单上;后续操作要服务于本节目标:“用可复核指令让 AI 协助清理、汇总或提出分析建议,并记录操作过程。”。

WorkBuddy 实操卡

做一做 · 可复核的小汇总 · 做一做 · 工作目录「灯火计划」· 灯火计划资料包

  1. 复制 CSV 为 working 副本,保留原文件
  2. 让它按学院或按“报名/到场”做小汇总
  3. 人工复算一项
  4. 全过程写入操作记录
输入:07-attendance.csv 的副本,不要改原文件。
问题:(粘贴本组选定问题)
动作:按指定字段分组计数;列出重复行和缺失签到。
约束:写明计算口径;异常值不要悄悄删除。
输出:汇总.md + 操作记录.md(输入范围、操作、结果、需人工核对项)。
验收:我能根据操作记录手工复算其中一项。
预期看到
  • 有操作记录
  • 至少一项可复算
  • AI 没有直接给出晚会改进方案冒充分析
人必须检查
  • 原数据仍在
  • 口径写清是报名还是到场
禁止
  • 不开启「允许完全访问」
  • 不发送群消息、邮件或通知
  • 不写入真实日历或通讯录
  • 不上传学号、手机号、身份证号等个人敏感信息
教师机

对一小份表做分组统计并手工核对。

有电脑的学生

提交汇总和操作记录。

手机学生

用教师提供的汇总结果,复算一个格子。

WorkBuddy 实战蓝皮书 https://workbuddy.homes/ 第 11 章:数字与原文一致

本节 AI 协作点

AI 会参与这节课,但它不是替学生完成任务;每次使用都要留下可核验的过程证据。

AI 的角色

数据整理与分析助手

让 AI 做什么

协助解释字段、提出清理步骤、完成小范围汇总或提示异常值。

人要检查什么

先保留原始数据,再核对字段含义、计算逻辑和异常是否真实存在。

保留什么证据

保留输入数据范围、操作记录、AI 输出和至少一项人工复算。

本节目标

用可复核指令让 AI 协助清理、汇总或提出分析建议,并记录操作过程。

准备材料
  • 原始数据
  • 分析操作记录表
  • AI 工具
互动方式

两人交换操作记录,检查是否能复现一次处理。

  1. 0–8 分钟
    方法讲解

    学生:听清本节要使用的概念、操作边界和完成标准,在任务单上标记关键动作。

    教师:先讲“为什么这样做”,再讲工具或步骤;说明资料边界和不可擅自执行的动作。

  2. 8–15 分钟
    教师示范

    学生:跟着示范观察一遍完整的最小流程,记录输入、动作、检查和输出。

    教师:投屏完成一个小样,边做边说出判断依据和常见错误。

  3. 15–27 分钟
    引导练习

    学生:在小组内用同一份小样资料完成关键一步,再相互核对。

    教师:用追问代替代做:先问资料够不够、动作是否明确、结果怎样检查。

  4. 27–39 分钟
    独立实践

    学生:基于真实或模拟资料完成自己的首版,并保留来源和操作痕迹。

    教师:巡视并记录常见偏差,提醒不确定信息要标出。

  5. 39–45 分钟
    提交与复盘

    学生:提交版本、依据与下一步修改说明。

    教师:检查证据是否足够,并决定下节从哪里继续。

完成证据

一份数据处理记录,含输入、操作、结果和人工核对。

离场前自查

已完成 0 / 3 项

给教师的提示与备用方案

提示:要求学生保留资料来源、版本和判断理由;智能体输出不能替代这些证据。

备用方案:预计算的汇总表 + 一个让学生复算的空格。

中国语境:数据素养是公共能力,不只是理工科技能

  • 国家战略背景:数据已被确立为与土地、劳动力、资本、技术并列的第五大生产要素("数据二十条"及数据要素市场建设)。武大也开设了《数据要素》《数据科学导论》等全校课程,校长张平文院士亲自讲授数据科学——无论你学什么专业,"看懂数据"都会成为基本素养。
  • 校园数据现实:报名接龙、问卷星、签到表、社团纳新表……大学生每天都在产生和接收"脏数据"。本课用的 07-attendance.csv 里有重复行、不可能时间(25:08)、口径混合——这不是教学刁难,而是真实世界的常态。
  • AI 分析的两面:AI 可以秒级给出"签到率 87.5%"这样精确的数字,但浙大团队的调研提醒我们:约四成受访研究生承认过度依赖 AI 造成思维惰性。数据领域的表现就是——看起来会算,其实不会算,也不敢质疑算出的数。人工复算一次,就是保持思维强度的最低训练量。
  • 数据合规意识:《个人信息保护法》要求处理个人信息遵循最小必要与知情同意。分析问卷和报名数据时,姓名、学号、手机号属于个人信息——课程演练统一使用模拟资料,真实数据必须先脱敏。

45 分钟课堂节奏

课节时间线环节
第 1 节 · 读字段0–5'导入:24 行 = 24 人吗?(埋下悬念)
5–15'讲授数据字典六问
15–35'动手:为 CSV 建立 8 字段的数据字典
35–43'揭晓:实际人数为什么少于 24?各组报数
43–45'收束:行数≠人数
第 2 节 · 提问题0–5'快问:"看看数据有什么发现"卡在哪?
5–15'讲授分析问题公式与指标定义(写清分母)
15–35'动手:写分析问题 + 指标公式 + 分母检查
35–43'口径冲突:接龙渠道没有完整报名记录怎么办?
43–45'收束:先定问题再选图
第 3 节 · AI 协作分析0–5'演示:AI 给出一个漂亮结论,全班找茬
5–12'讲授七项分析记录要求
12–35'动手:与 AI 协作完成一轮分析,同步填写操作记录
35–43'追问练习:AI 建议按姓名去重——该问它什么?
43–45'收束:原表只读,副本作业,复算留痕

深一步追问(给"吃不饱"的同学)

  • 为什么"平均值"最容易骗人?举一个用平均值掩盖分布差异的校园例子。
  • 数据字典里的"空白"有四种可能含义(无/未知/未填/不适用),混淆它们各会引发什么错误结论?
  • 如果 AI 分析与你的人工复算不一致,排除哪些原因后才应该怀疑数据本身?

本周小结

  • 行数不等于人数,字段名也不自动说明业务含义。
  • 分析问题必须定义对象、指标、比较维度和用途,尤其要写清分母。
  • AI 可以协助处理数据,但原表、步骤、人工复算和未解决问题必须保留。

迁移练习

找一张不含敏感信息的小表格,为至少 5 个字段建立数据字典,标出 3 类质量问题,并设计一个可以在现有数据范围内回答的问题。

延伸阅读

面向刚入学的本科生:用 WorkBuddy 完成「灯火计划」这条可检查的校园任务。