MSIN0096 Coursework 统计建模
📉 logit 系数 0.2 不等于涨 20 个点
上一期有一份 assignment 拿买不买苹果做例子,比较 LPM、logit 和 probit,还要报边际效应和预测概率。
LPM 的系数可以直接读成概率变化。logit 的系数是对数赔率的变化,要先换算。赔率是发生概率除以不发生概率,系数 0.2 意味着赔率乘以 exp(0.2),约 1.22 倍。起点是 50% 时,赔率从 1 变成 1.22,概率涨到约 55%,多了约 5 个百分点;起点是 90% 时,赔率从 9 变成约 11,只多约 1.7 个。同一个系数,起点不同,概率涨幅就不同。
所以写结论时先说清模型和变量单位,再写「其他变量不变」,最后分开写赔率变化和概率变化。
🧑🎓 前后分数是 3 个人的 3 个差值
上一期的区间与检验那份 brief 里有一组 Training 数据:同一批学生训练前后各考一次,另外还有两组不同受访者的比较。
如果你把前测和后测当成两组独立样本,丢进两样本 t 检验,检验用的波动就算错了。正确的分析单位是每个人的差值。比如三名学生 60 到 65、75 到 78、80 到 84,固定用后减前,得到 5、3、4,配对数是 3,不是 6。
动手前先按学生 ID 把前后接上,行号相同不能证明是同一个人。另一题比较有无 A-level 的两组受访者,两组人不同,这时才用独立组。还有一点:分数上升只说明观察到变化,没有对照组就不能全算在训练头上。
🔍 系数表跑出来只做完一半
上一期回归那份 brief 用信用卡年消费做多元回归,要求检查共线性和残差。
如果你跑完模型就开始解释系数,到诊断这一步就交不上东西。自变量之间高度相关时,单个系数会很不稳,正负号都可能翻;残差有明显形状,说明模型漏了东西。我的做法是先看相关矩阵和 VIF,再画残差对拟合值的图,确认没大问题再写解释。诊断发现问题时,在报告里写清你怎么处理,比如去掉一个高度相关的变量,或者给 y 取对数后重跑。
同一份里的 eBay 数据也要先动手:竞争性拍卖按至少两次出价定义,这个变量要你自己从出价次数做出来,再进模型。
📋 先认结果变量,再选模型
上一期几份 brief 用到的方法很多,选哪个取决于你要预测的那一列是什么。
| 结果变量 | 上一期用的方法 | 系数或输出怎么读 |
|---|---|---|
| 连续数值,如年消费、mpg | 多元回归、Ridge、Lasso、回归树 | 其他不变时 y 的变化量 |
| 是否发生,如买没买 | LPM、logit、probit | LPM 读概率,logit 先换算 |






