COMM5000 Data Literacy for Business
🧩 整学期只做一个二手车项目
这门课没有 exam,三次提交都是同一个项目:一份 1,005,000 行的印度二手车 Excel,问题从头到尾都是二手车价格能不能预测、豪华品牌和普通品牌之间有没有差别。M1 做描述统计和图表,M2 做假设检验,Final Report 用回归建模,最后给客户写建议。每一段的结论都要写清下一段打算怎么做,M2 开头还要先回顾 M1 的发现。所以你在 M1 里随手做的分组和清洗,会一路带到 Final。我的做法是从 M1 开始就在 Excel 里单独建一页,记下每一步处理了哪些行、为什么这样处理,后面两次提交直接翻出来用。
🔤 Brand 列先 TRIM 再分组
数据里的品牌写法并不统一,官方举的例子就有前后带空格的 ' BMW '。luxury 组只算 Audi、BMW、Mercedes 三个品牌,其余都归 non-luxury。如果你直接拿原始 Brand 列做筛选,带空格的那批 BMW 会掉进 non-luxury,M1 要的三组统计表(全样本、luxury、non-luxury)就会算错,M2 比较两组均值的检验也跟着错,而且从表面上很难看出来。官方提示用 TRIM 和 LOWER 统一写法。我会再用 PivotTable 把 Brand 的所有写法列一遍,逐个确认每个值都归到了对的组,再去算 Mean、Median 和 SD。Fuel 列也有 PETROL、petrol、hybridd 这类写法,处理思路一样,改了什么都写进报告里说明理由。
♻️ M2 要用没删过的全量数据
M1 要你找出重复记录、Unknown、缺失值和离谱的极端值,比如开了一百万公里以上的车,并说明你怎么处理。到了 M2,官方写明:检验用完整的 1,005,000 行,只清理 Brand,重复记录、Unknown 和 outlier 都不删,这样全班的结果可以互相对照。如果你顺手拿 M1 清洗好的那张表跑 M2,两组均值和检验统计量就会和别人对不上。我的做法是把原始数据另存一份,M2 只在上面加一列 TRIM 过的 Brand。重复记录和极端值会怎样影响检验,可以写进讨论部分,官方也鼓励这样做。检验本身要比较价格和里程两个变量,用 p 值法,在百分之一和百分之五两个显著性水平下各下一次结论,两个水平下结论有变化就要单独写出来。
🗓️ 十周内容和三次提交对照
| 周 | 课上讲什么 | 项目进度 |
|---|---|---|
| W1–W3 | 图表、描述统计、概率、抽样推断 | M1 用到的全部工具 |
| W4 | 置信区间 | 周五下午 5 点交 M1 |
| W5 | 显著性检验 | M2 要用的检验方法 |
| W6 | 一个自变量的回归 | 给同学的 M1 互评截止 |
| W7 |






