MSIN0010 Coursework (2 assessments) R 数据分析
🧾 一行是一笔交易,先数人
上一期 Coursework 1 给的电商数据,记录的是不同顾客的一笔笔交易,题目让你分析平台顾客的年龄。
顺手的做法是对年龄那一列求均值、画直方图。如果同一位顾客买了五次,他的年龄就被算了五次;一位每周都来买的 25 岁顾客,分量抵得上五位只买过一次的 50 岁顾客。算出来的数更像常买的人的年龄。
动手前先看一行代表什么:一位顾客,还是一笔交易。按交易算,就照实写「交易对应的年龄」;想说顾客本身,先按顾客去重再算,两种口径不放进同一句结论。
📊 均值和图说同一件事
上一期的题目要求至少一个统计量加一张图,还要解释它们怎么说明年龄。
只放一个平均年龄,会漏掉分布的形状。举个假设的例子:五位顾客 20、20、20、20、60 岁,均值 28,中位数 20,直方图上四个人挤在 20 岁,一个人在 60 岁。只看 28,你会以为客群接近三十岁,可五个人里没有一个是这个年纪。
我的做法是均值、中位数一起报,配一张直方图,再写一句三者共同支持的判断。比较年龄和价格用散点图,比较年龄和品类先分组整理。看到关联只写关联,年龄不能直接当成买得不同的原因。
🔗 每段代码挨着它的结果
上一期每道数据题都写明:附上全部 R 代码,写清哪段代码产出哪个结果。提交是一个 PDF,模板推荐使用,不强制。
如果你把代码全堆到附录,正文只放图和数字,看的人对不上哪张图来自哪几行,算对了也说明不了。数字抄进正文时也容易和输出差一位小数,挨着放就一眼能核对。我的做法是一小问一个块:问题、代码、输出、两三句解释,按这个顺序排,图的坐标轴和计数对象也写在图下面。
还有一处:上一期生成式工具只能像查 Google 一样帮你写代码,概率推导那几道题明令不能用,要写出推导步骤。本期规定以 Moodle 上新发的 brief 为准。
📏 均值差的区间怎么读
比较两组平均每单件数时,先定好相减顺序,比如 A−B,再确认两组是互不重叠、独立抽取的样本。只有样本标准差时用 t 区间;同一批顾客的前后记录要按配对处理。
饮品店比较两份菜单的假设区间(杯/人):
| 95% 区间 | 能写的判断 |
|---|---|
| 0.1 到 0.5 | 支持 A 的总体均值更高 |
| −0.2 到 0.5 | 排除不了零差异 |
| −0.5 到 −0.1 | 支持 B 的总体均值更高 |
写结论前过一遍:






