QBUS5001 Final Exam|删变量之前,先把这条链走完
review 多元回归的时候,最容易出事的动作是拿到 Excel 输出,照着 p-value 把不显著的几行一口气全划掉。那张输出确实一次性给了 F、t、R²、Adjusted R² 和残差图,可它们回答的问题分在不同层级上。删哪个、删完还剩什么,得沿着一条链一格一格走。
🧭 整体那一格过了,单个变量还要一个个看
先看整体的 F-test。它一次检验全部斜率同时为零这个假设;拒绝原假设,只能说明这组自变量里至少有一个斜率不为零。具体是哪一个,这一格给不出来。
往下才轮到每行系数的 t-test,它逐个去看某个系数偏离零的证据有多强。
假设一张输出里的 Significance F 小到可以拒绝原假设,而下面有三行 p-value 都在 0.4 以上,这两个结论可以同时成立。整体那一格给的是全部斜率的联合判断,单行那一格才落到某一个变量身上。
| 看哪一格 | 这一格在问什么 | 能得到的结论 |
|---|---|---|
| 整体 F-test | 全部斜率同时为零这个假设 | 至少一个斜率有偏离零的证据 |
| 单行 t-test | 某个系数偏离零的证据强度 | 该变量在当前模型里的统计证据 |
| Adjusted R² | 惩罚变量个数后的拟合水平 | 规模不同的两版模型哪个更受支持 |
| 残差图与共线性 | 推断前提的成立情况 | 前面统计结果可以怎样解释 |
✂️ 删变量这件事,一次只动一个
看到几行不显著,接下来的动作是一次移除一个候选变量,然后重新估计整个模型。每重估一次,剩下变量的系数、标准误、p-value 和拟合指标都会跟着变一遍。初始输出里那几行不显著的记录,只对那一版模型有效;删掉一个之后,它们就已经过期了。
course 材料里那组 Graduate Salary 数据走的就是这条路。9 个自变量的模型先拟合出来,WAM、Coffee、SocialEvents 依次被移除,最后落到 6 个自变量。三个变量分三次删,中间每次都重新跑一遍回归。照着第一版输出一口气划掉三行,得到的那版模型没有经过逐步重估,剩下变量的显著性也没有重新核过。
📌 初始输出里的不显著记录,只属于那一版模型。移除一个变量以后,剩下所有系数和 p-value 都要重新读一遍。






