机器学习 | 2.1 性能度量
·
性能度量是衡量模型泛化能力的评价标准。性能度量反映了任务需求,在对比不同模型的能力时,使用不同得性能度量会得到不同得结果。
1.回归任务的性能度量
给定样例集D = {(x1,y1),(x2,y2),……,(xm,ym)},其中yi是样例xi的真实标记。学习器的预测结果为f(x)。
均方误差:E(f;D) = 1/m Σ (f(xi) -yi)^2
对于数据分布D和概率密度函数p(.),均方误差可描述为:E(f;D) = ∫(f(x)-y)^2p(x)dx
2.分类任务性能度量
错误率:分类错误的样本占样本总数的比例
精度:分类正确的样本占样本总数的比例
混淆矩阵:
| 真实情况 | 预测结果 | |
|---|---|---|
| 正例 | 反例 | |
| 正例 | TP | FN |
| 反例 | FP | TN |
真正例(true positive)
假正例(false positive)
真反例 (true negative)
假反例 (false negative)
conclusion: 真和假是指预测结果是否与真实情况相同,后面的正例/反例是预测结果
查准率:P =TP/TP+FP (所有预测结果为正例的部分,有多少是正例)
查全率:R = TP / TP+FN(所有是真实正例的情况,有多少被查全了)
P-R曲线:对所有样本进行排序,按此顺序逐个把样本作为正例预测,计算当前查全率、查准率
F1度量:F1 = (2 X P X R)/(P+R)
Fβ = (1+β^2)X P X R /(β^2 X P)+R
多个混淆矩阵:宏查全率、宏查准率(对所有的查全率和查准率做平均)
微查全率、微查准率(先对矩阵内部的各对应元素评价,然后再计算查全率和查准率)
更多推荐

所有评论(0)