性能度量是衡量模型泛化能力的评价标准。性能度量反映了任务需求,在对比不同模型的能力时,使用不同得性能度量会得到不同得结果。

1.回归任务的性能度量

给定样例集D = {(x1,y1),(x2,y2),……,(xm,ym)},其中yi是样例xi的真实标记。学习器的预测结果为f(x)。

均方误差:E(f;D) = 1/m Σ (f(xi) -yi)^2

对于数据分布D和概率密度函数p(.),均方误差可描述为:E(f;D) = ∫(f(x)-y)^2p(x)dx

2.分类任务性能度量

错误率:分类错误的样本占样本总数的比例

精度:分类正确的样本占样本总数的比例

混淆矩阵

真实情况 预测结果
正例 反例
正例 TP FN
反例 FP TN

真正例(true positive)

假正例(false positive)

真反例 (true negative)

假反例 (false negative)

conclusion: 真和假是指预测结果是否与真实情况相同,后面的正例/反例是预测结果

查准率P =TP/TP+FP (所有预测结果为正例的部分,有多少是正例)

查全率:R = TP / TP+FN(所有是真实正例的情况,有多少被查全了)

P-R曲线对所有样本进行排序,按此顺序逐个把样本作为正例预测,计算当前查全率、查准率

F1度量F1 = (2 X P X R)/(P+R)

Fβ = (1+β^2)X P X R /(β^2 X P)+R

多个混淆矩阵:宏查全率、宏查准率(对所有的查全率和查准率做平均)

微查全率、微查准率(先对矩阵内部的各对应元素评价,然后再计算查全率和查准率)

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐