MAST20034 Critical Thinking with Data (MAST20034)
📏 样本翻十倍,偏差还在
你大概默认 n 越大结论越稳。Week 5 讲推断的五个假设,排在头一个的是 representative sample;Week 9 说得更直:抽样方法本身偏了,样本再大也只是把同一个错误放大。
原因在两种误差。随机误差按 1/√n 下降,样本翻十倍,大约降到原来的三分之一;抽样框漏掉的人,再多收几千份也补不回来,置信区间只会更窄地围着错的位置。1936 年 Literary Digest 用电话和汽车登记名单抽样,样本很大,可当时有电话有车的多是有钱人,结论跟着偏了。
所以拿到一个研究,我的做法是先问名单从哪来,再看 n。
🧭 11 周在练同一张清单
Week 1 的 Six W 问数据谁收、为什么收、收了什么、怎么收、何时、何地;Week 3 的六大支柱看设计能不能压住偏差;Week 5 的三层问题看证据、分析和结论;Week 10 的 Hill 九条判断能不能说到因果。
如果你按周背,每周的框架都记得,读到一篇没见过的研究却不知道先问哪一条,写出来的点评就会东一句西一句。我的做法是把它们叠成一张表,按顺序过一遍:数据怎么来,设计能不能排除混杂,分析有没有报效应量和置信区间,结论能不能说到因果。Week 5 专门提醒,只写 p < 0.05 会丢掉方向和效应大小,读的人没法还原你的推断。
拿一篇「喝奶茶的人更容易失眠」的报道试一遍:Six W 问数据是谁收的、怎么收的;支柱问有没有对照组;三层问题问报没报效应量;Hill 九条问时间顺序,是先喝奶茶还是先睡不着。四步走完,能说的结论就清楚了。
🔁 往回查记录不等于 case-control
Week 4 的四种观察性研究里,cohort 和 case-control 是课上反复强调的一组区分。直觉是看时间:翻旧档案的就叫 case-control。
课上看的是分组依据。按暴露分组(吸烟和不吸烟)再看结局,是 cohort,哪怕数据全是过去的记录,也叫 retrospective cohort;按结局分组(得病和没得病)再问过去的暴露,才是 case-control。拿到一段研究描述,先找它从哪一群人出发。
分错了,后面的指标也跟着错:case-control 只能算 OR,算不了 incidence 和 RR;结局常见时,OR 会夸大 RR。Doll 和 Hill 1950 年那项从 649 名肺癌病人和 649 名对照出发,是 case-control,算出 OR 约 14;1954 年从四万多名医生的吸烟习惯出发往后跟踪,是 cohort,还看出了吸得越多风险越高。两项放在一起对照,分组依据一眼就清楚。
🗺️ 学期路线表
| 周次 | 主题 | 拿来做什么 |
|---|---|---|
| W1 | Six W | 读数据先问六个问题 |
| W2 | 图形五原则 |






