第五章:Linear Regression (1) — 单元习题

总分:100分 | 建议用时:70分钟
范围:线性回归模型、基函数、正规方程、几何解释、评估指标


占位图
在这里插入图片描述

一、单项选择题(每题2分,共20题,40分)

1. 线性回归模型"线性"的含义是指对什么线性?
A. 对输入特征x线性
B. 对模型参数w线性
C. 对输出t线性
D. 对基函数线性

2. 线性回归中引入x0=1x_0=1x0=1的目的是?
A. 增加模型非线性
B. 将截距项w0w_0w0统一纳入向量化计算
C. 提高模型精度
D. 减少参数量

3. 以下哪个不是常见的基函数类型?
A. 多项式基函数 ϕj(x)=xj\phi_j(x)=x^jϕj(x)=xj
B. 高斯RBF基函数
C. ReLU激活函数
D. Sigmoid基函数

4. 基函数在深度学习之前的主要作用是什么?
A. 减少计算量
B. 手工设计特征→使简单线性模型能拟合复杂关系
C. 自动学习特征
D. 替代梯度下降

5. 使用5次多项式基函数相比简单线性模型通常能?
A. 提高训练MSE
B. 降低训练MSE
C. MSE不变
D. 无法确定

6. 线性回归的误差函数E(w)=12∑(tn−yn)2E(w)=\frac{1}{2}\sum(t_n-y_n)^2E(w)=21(tnyn)2中系数12\frac{1}{2}21的作用是?
A. 使误差减半
B. 求导后消除平方的系数2,简化表达式
C. 提高数值精度
D. 没有实际意义

7. 误差函数E(w)E(w)E(w)关于www是什么类型的函数?
A. 线性函数
B. 二次函数(抛物线型)
C. 指数函数
D. 对数函数

8. 正规方程(Normal Equations)的矩阵形式是?
A. Xw=t\mathbb{X}\mathbf{w} = \mathbf{t}Xw=t
B. XTXw=XTt\mathbb{X}^T\mathbb{X}\mathbf{w} = \mathbb{X}^T\mathbf{t}XTXw=XTt
C. XXTw=t\mathbb{X}\mathbb{X}^T\mathbf{w} = \mathbf{t}XXTw=t
D. w=XTt\mathbf{w} = \mathbb{X}^T\mathbf{t}w=XTt

9. 线性回归的闭式解为?
A. w∗=XTt\mathbf{w}^* = \mathbb{X}^T\mathbf{t}w=XTt
B. w∗=(XTX)−1XTt\mathbf{w}^* = (\mathbb{X}^T\mathbb{X})^{-1}\mathbb{X}^T\mathbf{t}w=(XTX)1XTt
C. w∗=X−1t\mathbf{w}^* = \mathbb{X}^{-1}\mathbf{t}w=X1t
D. w∗=XXTt\mathbf{w}^* = \mathbb{X}\mathbb{X}^T\mathbf{t}w=XXTt

10. 从几何角度看,线性回归的最优预测Y\mathbb{Y}Y是什么?
A. t\mathbf{t}t沿X\mathbb{X}X列方向的任意投影
B. t\mathbf{t}tX\mathbb{X}X列空间上的正交投影
C. t\mathbf{t}t本身
D. X\mathbb{X}X的任意线性组合

11. 残差向量e⃗=t−Xw\vec{e} = \mathbf{t} - \mathbb{X}\mathbf{w}e =tXw与什么正交?
A. 与t\mathbf{t}t正交
B. 与X\mathbb{X}X的所有列正交
C. 与w\mathbf{w}w正交
D. 与自身正交

12. MSE(均方误差)的公式是?
A. 1N∑(tn−yn)\frac{1}{N}\sum(t_n - y_n)N1(tnyn)
B. 1N∑∣tn−yn∣\frac{1}{N}\sum|t_n - y_n|N1tnyn
C. 1N∑(tn−yn)2\frac{1}{N}\sum(t_n - y_n)^2N1(tnyn)2
D. ∑(tn−yn)2\sum(t_n - y_n)^2(tnyn)2

13. RMSE相比MSE的优势是?
A. 计算更快
B. 与原始数据单位相同,更易解释
C. 对大误差不敏感
D. 不需要真实标签

14. R2=0.85R^2=0.85R2=0.85意味着?
A. 模型预测了85%的数据点
B. 模型相比均值基线减少了85%的误差
C. 模型准确率为85%
D. 85%的参数是显著的

15. MAE相比MSE的优势是?
A. 可导性更好
B. 对异常值(outliers)更鲁棒
C. 计算更简单
D. 对大误差惩罚更大

16. 好的残差图应该呈现什么特征?
A. 有明显的上升趋势
B. 有明显的下降趋势
C. 点随机散布在0附近,无规律
D. 所有点都在0以上

17. 设计矩阵X\mathbb{X}X的大小是?
A. D×ND \times ND×N
B. N×DN \times DN×D
C. N×(D+1)N \times (D+1)N×(D+1)(含x0=1x_0=1x0=1的增广列)
D. (D+1)×N(D+1) \times N(D+1)×N

18. 正规方程有唯一解的条件是?
A. X\mathbb{X}X是方阵
B. XTX\mathbb{X}^T\mathbb{X}XTX可逆
C. 数据量N=1
D. 不需要任何条件

19. 线性回归中,若XTX\mathbb{X}^T\mathbb{X}XTX不可逆,可能的原因是?
A. 特征之间存在完美多重共线性
B. 数据量太大
C. 使用了基函数
D. 目标值不是连续的

20. 以下哪项评估指标以百分比形式表示?
A. MSE
B. RMSE
C. R²
D. MAPE


二、判断题(每题2分,共15题,30分。正确打√,错误打×)

21. 线性回归模型y=w0+w1x2y=w_0+w_1x^2y=w0+w1x2不属于线性模型,因为x2x^2x2是非线性的。( )

22. 基函数ϕj(x)\phi_j(\mathbf{x})ϕj(x)可以是输入x\mathbf{x}x的非线性函数。( )

23. 深度学习兴起后,手工设计基函数的需求减少了,因为NN可以自动学习特征。( )

24. 增广输入x0=1x_0=1x0=1使截距w0w_0w0和其他参数可以统一用wTx\mathbf{w}^T\mathbf{x}wTx表示。( )

25. 平方和误差函数E(w)E(w)E(w)www的凸二次函数,只有一个全局最小值。( )

26. 正规方程XTXw=XTt\mathbb{X}^T\mathbb{X}\mathbf{w}=\mathbb{X}^T\mathbf{t}XTXw=XTt需要迭代优化才能求解。( )

27. 闭式解w∗=(XTX)−1XTt\mathbf{w}^*=(\mathbb{X}^T\mathbb{X})^{-1}\mathbb{X}^T\mathbf{t}w=(XTX)1XTt需要计算矩阵逆,当D很大时计算代价高。( )

28. 几何上,最小二乘解对应t\mathbf{t}tspan(X)\text{span}(\mathbb{X})span(X)上的正交投影。( )

29. RMSE和MSE本质上是同一个指标的不同表达形式。( )

30. R2R^2R2可以为负值。( )

31. MAE对大误差的惩罚比MSE更重。( )

32. 残差图出现U型趋势说明模型拟合良好。( )

33. 正规方程等价于梯度下降法求得的解。( )

34. MAPE不适用于目标值可能为零的情况。( )

35. 多项式基函数的阶数越高,模型在训练集上的MSE一定越低。( )


三、简答题(每题4分,共5题,20分)

36. 什么是基函数(Basis Function)?为什么在深度学习之前基函数很重要?请列举至少三种常见基函数类型。

37. 请写出线性回归的正规方程(Normal Equations)的推导逻辑:从误差函数到闭式解的完整思路。

38. 请从几何角度解释线性回归的最小二乘解:为什么最优预测是t\mathbf{t}tspan(X)\text{span}(\mathbb{X})span(X)上的正交投影?

39. 请对比MSE、RMSE、MAE和R²四种评估指标,说明各自的特点和适用场景。

40. 什么是好的残差图?残差图出现模式(如U型或漏斗型)分别说明模型可能存在什么问题?


四、计算题(每题5分,共2题,10分)

41. 给定3个数据点:(x1=1,t1=2)(x_1=1, t_1=2)(x1=1,t1=2), (x2=2,t2=3)(x_2=2, t_2=3)(x2=2,t2=3), (x3=3,t3=5)(x_3=3, t_3=5)(x3=3,t3=5)。使用简单线性模型y=w0+w1xy=w_0+w_1xy=w0+w1x
(1) 写出设计矩阵X\mathbb{X}X和目标向量t\mathbf{t}t
(2) 计算XTX\mathbb{X}^T\mathbb{X}XTXXTt\mathbb{X}^T\mathbf{t}XTt
(3) 使用正规方程求w∗=[w0∗,w1∗]T\mathbf{w}^* = [w_0^*, w_1^*]^Tw=[w0,w1]T

42. 某回归模型在4个测试样本上的预测值和真实值如下:

n 真实值 tnt_ntn 预测值 yny_nyn
1 10 12
2 15 13
3 20 22
4 25 23

(1) 计算MSE。
(2) 计算RMSE。
(3) 已知tˉ=17.5\bar{t}=17.5tˉ=17.5,计算R²并解释其含义。


试卷结束,请认真检查。

第五章:Linear Regression (1) — 单元习题答案


一、单项选择题答案

题号 答案 解析
1 B 线性模型=对参数www线性;ϕj(x)\phi_j(x)ϕj(x)可以是非线性的
2 B x0=1x_0=1x0=1w0w_0w0统一为w0x0w_0 x_0w0x0→向量化y=wTxy=\mathbf{w}^T\mathbf{x}y=wTx
3 C ReLU是NN激活函数;常见基函数:多项式/RBF/Sigmoid/正弦
4 B DL之前手工设计特征→线性模型+好的特征=成功
5 B 多项式更灵活→更好地拟合数据→MSE更低
6 B ∂∂w12(t−y)2=(t−y)⋅(−1)⋅∂y∂w\frac{\partial}{\partial w}\frac{1}{2}(t-y)^2 = (t-y)\cdot(-1)\cdot\frac{\partial y}{\partial w}w21(ty)2=(ty)(1)wy,1/2消除导数中的2
7 B 平方和→www的二次函数→抛物线型→唯一全局最小值
8 B 正规方程:XTXw=XTt\mathbb{X}^T\mathbb{X}\mathbf{w} = \mathbb{X}^T\mathbf{t}XTXw=XTt
9 B w∗=(XTX)−1XTt\mathbf{w}^*=(\mathbb{X}^T\mathbb{X})^{-1}\mathbb{X}^T\mathbf{t}w=(XTX)1XTt(闭式解,需XTX\mathbb{X}^T\mathbb{X}XTX可逆)
10 B 最优预测=t\mathbf{t}tspan(X)\text{span}(\mathbb{X})span(X)上的正交投影
11 B 正交条件:XTe⃗=0\mathbb{X}^T\vec{e}=0XTe =0→残差与X\mathbb{X}X所有列正交
12 C MSE=1N∑(tn−yn)2\frac{1}{N}\sum(t_n-y_n)^2N1(tnyn)2
13 B RMSE=MSE\sqrt{\text{MSE}}MSE ,恢复到原始数据单位
14 B R²=相比均值基线减少的误差比例→0.85=减少85%误差
15 B MAE用绝对值→异常值不会被平方放大→更鲁棒
16 C 好残差图=随机散布0附近、方差恒定、无趋势
17 C x0=1x_0=1x0=1列→N×(D+1)N\times(D+1)N×(D+1)
18 B XTX\mathbb{X}^T\mathbb{X}XTX可逆→有唯一解;不可逆→无穷多解
19 A 完美多重共线性→XTX\mathbb{X}^T\mathbb{X}XTX奇异→不可逆
20 D MAPE=$\frac{1}{N}\sum

二、判断题答案

题号 答案 解析
21 × www线性→y=w0+w1x2y=w_0+w_1x^2y=w0+w1x2仍是线性模型(x2x^2x2可看作基函数ϕ(x)=x2\phi(x)=x^2ϕ(x)=x2
22 基函数可以是非线性的(如高斯RBF、Sigmoid)
23 NN自动学习特征=数据驱动的基函数
24 x0=1x_0=1x0=1使w0=w0⋅1=w0x0w_0 = w_0\cdot 1 = w_0 x_0w0=w01=w0x0
25 二次函数=凸→唯一全局最小值
26 × 正规方程可直接求解(闭式解),不需迭代
27 矩阵求逆O(D3)O(D^3)O(D3)→高维时代价大→需梯度下降
28 最小二乘=正交投影→使残差向量长度最小
29 RMSE=MSE\sqrt{\text{MSE}}MSE ,信息相同,单位不同
30 模型比均值预测还差→R²<0
31 × MSE平方惩罚→对大误差更重;MAE线性惩罚→对大误差相对轻
32 × U型趋势=模型欠拟合(有系统偏差未捕捉)
33 BGD求得的解=正规方程解(两者等价,都到全局最优)
34 目标值为0→除以0→MAPE无定义
35 阶数越高→越灵活→训练MSE单调不增(但可能过拟合)

三、简答题参考答案

36. 基函数

参考答案:

定义:基函数ϕj(x)\phi_j(\mathbf{x})ϕj(x)是对输入x\mathbf{x}x的固定非线性变换,将原始特征映射到新空间:
y(x,w)=w0+∑j=1M−1wjϕj(x)y(\mathbf{x},\mathbf{w}) = w_0 + \sum_{j=1}^{M-1} w_j \phi_j(\mathbf{x})y(x,w)=w0+j=1M1wjϕj(x)

深度学习之前的重要性:手工设计好的特征→简单线性模型就能拟合复杂关系。相当于"人工特征工程"。

三种常见基函数

  1. 多项式:ϕj(x)=xj\phi_j(x)=x^jϕj(x)=xj
  2. 高斯RBF:ϕj(x)=exp⁡(−(x−μj)22σ2)\phi_j(x)=\exp(-\frac{(x-\mu_j)^2}{2\sigma^2})ϕj(x)=exp(2σ2(xμj)2)
  3. Sigmoid:ϕj(x)=11+e−(x−μj)/σ\phi_j(x)=\frac{1}{1+e^{-(x-\mu_j)/\sigma}}ϕj(x)=1+e(xμj)/σ1

37. 正规方程推导逻辑

参考答案:

  1. 误差函数E(w)=12∑(tn−wTxn)2E(\mathbf{w})=\frac{1}{2}\sum(t_n-\mathbf{w}^T\mathbf{x}_n)^2E(w)=21(tnwTxn)2(凸二次函数→唯一全局最小)
  2. 求导置零:对w\mathbf{w}w求梯度→∇E(w)=−XT(t−Xw)=0\nabla E(\mathbf{w})=-\mathbb{X}^T(\mathbf{t}-\mathbb{X}\mathbf{w})=0E(w)=XT(tXw)=0
  3. 正规方程XTXw=XTt\mathbb{X}^T\mathbb{X}\mathbf{w}=\mathbb{X}^T\mathbf{t}XTXw=XTt
  4. 闭式解:若XTX\mathbb{X}^T\mathbb{X}XTX可逆→w∗=(XTX)−1XTt\mathbf{w}^*=(\mathbb{X}^T\mathbb{X})^{-1}\mathbb{X}^T\mathbf{t}w=(XTX)1XTt

38. 几何解释

参考答案:

  • 预测Y=Xw\mathbb{Y}=\mathbb{X}\mathbf{w}Y=XwX\mathbb{X}X各列的线性组合→必然在span(X)\text{span}(\mathbb{X})span(X)(列空间)中
  • 真实t\mathbf{t}t通常不在span(X)\text{span}(\mathbb{X})span(X)
  • 最小化∥t−Y∥2\|\mathbf{t}-\mathbb{Y}\|^2tY2等价于在span(X)\text{span}(\mathbb{X})span(X)中找与t\mathbf{t}t最近的点
  • 最短距离=正交投影:残差e⃗=t−Xw∗\vec{e}=\mathbf{t}-\mathbb{X}\mathbf{w}^*e =tXwX\mathbb{X}X所有列正交
  • 正交条件XT(t−Xw∗)=0\mathbb{X}^T(\mathbf{t}-\mathbb{X}\mathbf{w}^*)=0XT(tXw)=0→导出正规方程

39. 四种评估指标对比

参考答案:

指标 公式 特点 适用场景
MSE 1N∑(tn−yn)2\frac{1}{N}\sum(t_n-y_n)^2N1(tnyn)2 平方惩罚→大误差被放大 大误差需重点惩罚
RMSE MSE\sqrt{MSE}MSE 同数据单位→直观解释 需要与目标值直接比较
MAE 1N∑∣tn−yn∣\frac{1}{N}\sum|t_n-y_n|N1tnyn 线性惩罚→对异常值鲁棒 数据含异常值
1−SSresSStot1-\frac{SS_{res}}{SS_{tot}}1SStotSSres 相对均值基线的改进比例 评估模型相对基准的提升

40. 残差图分析

参考答案:

好的残差图:点随机散布在0附近、散布宽度大致恒定(同方差性)、无系统趋势。

模式识别

  • U型趋势:模型欠拟合,存在非线性关系未捕捉→考虑加基函数/更复杂模型
  • 漏斗型(方差递增):异方差性→预测值越大残差方差越大→考虑对数变换或加权最小二乘
  • 明显非零均值:模型有系统性偏差→检查特征是否遗漏

四、计算题参考答案

41. 正规方程求解

(1) 设计矩阵与目标向量

x0=1x_0=1x0=1的增广设计矩阵:
X=[111213],t=[235]\mathbb{X} = \begin{bmatrix} 1 & 1 \\ 1 & 2 \\ 1 & 3 \end{bmatrix}, \quad \mathbf{t} = \begin{bmatrix} 2 \\ 3 \\ 5 \end{bmatrix}X= 111123 ,t= 235

(2) 计算

XTX=[111123][111213]=[36614]\mathbb{X}^T\mathbb{X} = \begin{bmatrix} 1 & 1 & 1 \\ 1 & 2 & 3 \end{bmatrix} \begin{bmatrix} 1 & 1 \\ 1 & 2 \\ 1 & 3 \end{bmatrix} = \begin{bmatrix} 3 & 6 \\ 6 & 14 \end{bmatrix}XTX=[111213] 111123 =[36614]

XTt=[111123][235]=[1023]\mathbb{X}^T\mathbf{t} = \begin{bmatrix} 1 & 1 & 1 \\ 1 & 2 & 3 \end{bmatrix} \begin{bmatrix} 2 \\ 3 \\ 5 \end{bmatrix} = \begin{bmatrix} 10 \\ 23 \end{bmatrix}XTt=[111213] 235 =[1023]

(3) 求解

(XTX)−1=13⋅14−6⋅6[14−6−63]=16[14−6−63](\mathbb{X}^T\mathbb{X})^{-1} = \frac{1}{3\cdot14-6\cdot6}\begin{bmatrix} 14 & -6 \\ -6 & 3 \end{bmatrix} = \frac{1}{6}\begin{bmatrix} 14 & -6 \\ -6 & 3 \end{bmatrix}(XTX)1=314661[14663]=61[14663]

w∗=16[14−6−63][1023]=16[140−138−60+69]=[2696]\mathbf{w}^* = \frac{1}{6}\begin{bmatrix} 14 & -6 \\ -6 & 3 \end{bmatrix}\begin{bmatrix} 10 \\ 23 \end{bmatrix} = \frac{1}{6}\begin{bmatrix} 140-138 \\ -60+69 \end{bmatrix} = \begin{bmatrix} \frac{2}{6} \\ \frac{9}{6} \end{bmatrix}w=61[14663][1023]=61[14013860+69]=[6269]

w0∗=13≈0.333,w1∗=32=1.5w_0^* = \frac{1}{3} \approx 0.333, \quad w_1^* = \frac{3}{2} = 1.5w0=310.333,w1=23=1.5

y=0.333+1.5xy = 0.333 + 1.5xy=0.333+1.5x


42. MSE/RMSE/R²计算

(1) MSE

n tnt_ntn yny_nyn (tn−yn)2(t_n-y_n)^2(tnyn)2
1 10 12 4
2 15 13 4
3 20 22 4
4 25 23 4

MSE=4+4+4+44=4.0\text{MSE} = \frac{4+4+4+4}{4} = \mathbf{4.0}MSE=44+4+4+4=4.0

(2) RMSE

RMSE=4.0=2.0\text{RMSE} = \sqrt{4.0} = \mathbf{2.0}RMSE=4.0 =2.0

(3) R²

SSres=∑(tn−yn)2=16SS_{res} = \sum(t_n-y_n)^2 = 16SSres=(tnyn)2=16

SStot=∑(tn−tˉ)2=(10−17.5)2+(15−17.5)2+(20−17.5)2+(25−17.5)2SS_{tot} = \sum(t_n-\bar{t})^2 = (10-17.5)^2 + (15-17.5)^2 + (20-17.5)^2 + (25-17.5)^2SStot=(tntˉ)2=(1017.5)2+(1517.5)2+(2017.5)2+(2517.5)2 =56.25+6.25+6.25+56.25=125= 56.25 + 6.25 + 6.25 + 56.25 = 125=56.25+6.25+6.25+56.25=125

R2=1−16125=1−0.128=0.872R^2 = 1 - \frac{16}{125} = 1 - 0.128 = \mathbf{0.872}R2=112516=10.128=0.872

含义:模型相比仅用均值(17.5)预测,减少了约87.2%的误差。R²接近1表明模型拟合较好。


答案编制完成时间:2026年6月28日

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐