[人工智能]机器学习(ML)算法:概念、家族与工程实践
机器学习(ML)算法:概念、家族与工程实践
本文从工程视角介绍经典机器学习(Machine Learning,ML)算法,包括主要学习范式、核心算法家族、评估指标以及在实际系统中使用时的关键考虑。通过示意图和表格说明模型复杂度与泛化误差的权衡、分类结果的混淆矩阵以及回归问题中的线性/非线性拟合差异,可作为学习和工程实践的参考资料。

图1:随着模型复杂度增加,泛化误差先下降后上升的偏差-方差折衷示意图。

图2:三分类任务的混淆矩阵示意,用于总结不同类别之间的预测情况。

图3:回归任务中线性模型与高阶非线性模型相比真实函数的拟合情况示意。
|
学习范式 |
典型算法 |
典型应用 |
说明 |
|
监督学习 |
线性/逻辑回归、SVM、决策树、随机森林、梯度提升、神经网络等。 |
分类、回归、排序、预测。 |
需要带标签数据,标签质量对效果影响很大。 |
|
无监督学习 |
K-means、高斯混合、PCA、自编码器、谱聚类等。 |
聚类、降维、异常检测。 |
在缺乏标签时用于发现结构和模式。 |
|
半监督学习 |
一致性正则化、伪标签、图方法等。 |
在少量标注+大量未标注数据场景中建模。 |
有助于降低标注成本,常见于实际业务。 |
|
强化学习 |
Q-learning、SARSA、策略梯度、actor-critic、深度Q网络等。 |
序列决策与控制、游戏、调度与运营优化等。 |
通过回报信号而非直接标签进行学习。 |
表1:机器学习主要家族及其典型应用场景概览。
|
算法 |
类型 |
关键特性 |
典型场景 |
|
线性回归 |
监督学习、回归 |
结构简单、可解释性好,假设线性关系。 |
基线模型、趋势估计、表格数据。 |
|
逻辑回归 |
监督学习、分类 |
输出概率、线性决策边界。 |
二分类/多分类、风险评分。 |
|
支持向量机 |
监督学习、分类/回归 |
基于间隔最大化,可通过核函数建模非线性。 |
高维文本、小中型表格数据。 |
|
决策树 |
监督学习、分类/回归 |
基于规则,天然支持混合特征类型。 |
可解释模型、快速基线、特征分析。 |
|
随机森林 |
集成学习、袋装树 |
通过集成多棵树降低方差,对噪声较鲁棒。 |
通用表格建模、特征重要性分析。 |
|
梯度提升(如XGBoost) |
集成学习、提升树 |
在结构化数据上表现强,调参空间丰富。 |
比赛、排序、各类生产系统。 |
|
K-means聚类 |
无监督学习、聚类 |
算法简单、计算速度快,适合球形簇。 |
用户分群、向量量化等。 |
|
多层感知机(MLP) |
监督学习、深度学习 |
通用非线性函数逼近器,需较多数据与调参。 |
结合CNN/嵌入用于图像、文本及通用非线性建模。 |
表2:常见机器学习算法、关键特性与典型应用场景。
|
任务类型 |
常用指标 |
反映内容 |
备注 |
|
分类 |
准确率、精确率、召回率、F1、ROC-AUC等。 |
正确分类情况以及错分类型的平衡。 |
类别不平衡时应关注召回率、F1等指标。 |
|
回归 |
MSE、RMSE、MAE、R平方等。 |
预测值与真实值之间的误差。 |
选择与业务损失函数一致的指标。 |
|
排序 |
NDCG、MAP、precision@k等。 |
有序列表的质量(如推荐排序)。 |
搜索与推荐系统中较为常见。 |
|
聚类 |
轮廓系数、Davies-Bouldin、ARI等。 |
簇的紧凑性与分离度。 |
通常与可视化分析结合使用。 |
表3:不同任务类型下常用的机器学习评估指标。
1. 学习范式与问题类型
从监督学习、无监督学习、半监督学习到强化学习,不同学习范式对应不同类型的监督信号和任务设置。监督学习基于带标签样本进行建模,无监督学习则在无标签数据中挖掘结构;半监督学习结合少量标签与大量未标注数据;强化学习通过回报信号刻画时序决策问题。
常见问题类型包括分类、回归、排序、聚类和降维等。许多实际系统往往组合多种任务,例如推荐系统通常包含表示学习、监督预测和在线探索。
2. 线性模型与正则化
线性回归和逻辑回归是机器学习中最经典的模型之一。它们结构简单、易于解释,训练速度快,并具有成熟的统计分析方法。通过L2(岭回归)和L1(LASSO)等正则化手段,可以抑制权重过大,缓解过拟合并实现特征选择。
在高维小样本场景下,正则化线性模型往往能够与更复杂的模型竞争,尤其是在数据噪声较大或可解释性要求较高的行业中。它们也是监控模型漂移、进行对比和审计的重要基线模型。
3. 树模型与集成学习
决策树通过对特征空间的分裂构建规则,天然支持数值与类别特征的混合建模,但单棵深树容易过拟合。集成学习通过组合多棵树来提升泛化能力。
随机森林使用袋装法训练多棵互相独立的树,通过平均降低方差;梯度提升树(如XGBoost、LightGBM)则以逐步拟合残差的方式构建强预测器。在结构化/表格数据上,这类算法往往成为默认选择,能够在较少特征工程的情况下取得优秀性能。
4. 核方法与支持向量机
支持向量机(SVM)通过最大化分类间隔来学习决策边界,并通过核函数在隐式高维特征空间中实现非线性分类或回归。
SVM在高维小样本场景(如文本分类、生物信息学)中表现突出,但在超大规模数据上训练成本较高。随着深度学习的发展,SVM在图像和语音等非结构化数据上的应用有所减少,但在许多传统机器学习场景中仍然非常有价值。
5. 聚类与降维
无监督聚类算法如K-means、高斯混合模型等用于根据相似度对样本进行分组;降维算法如PCA、t-SNE和UMAP则将高维数据映射到低维空间,用于可视化或后续建模。
在业务实践中,聚类结果往往需要结合领域知识进行解释和命名;降维常用于数据探索、异常检测以及降低后续模型的计算复杂度。
6. 神经网络在经典机器学习中的位置
多层感知机(MLP)等神经网络可视为通用的非线性函数逼近器,在足够数据和合理正则化的条件下可以逼近复杂关系。与树模型相比,神经网络通常需要更多调参和更大的数据规模,但与深度表示学习结合后能够进行端到端建模。
在表格数据上,树集成算法仍然非常强大;在图像、语音、文本等非结构化数据上,神经网络则是事实标准。工程实践中常将二者结合,用神经网络进行特征提取,再由经典算法完成下游任务。
7. 评估、验证与模型选择
可靠的评估与验证流程是机器学习成功部署的关键。常用方法包括留出验证、交叉验证以及针对时间序列的滚动回测。指标的选择应反映业务目标,例如在故障检测中通常更关注召回率而非简单准确率。
超参数搜索可以通过网格搜索、随机搜索或贝叶斯优化来完成。在整个过程中需要避免测试集信息泄露到模型选择阶段,否则会导致对模型性能的过于乐观估计。
8. 工程实践与MLOps
将机器学习模型真正应用到生产环境中,需要完整的MLOps体系支撑,包括数据管道、特征存储、在线/离线服务、监控与自动重训练等。随着时间推移,数据分布可能发生漂移,模型性能下降,需要有监控和告警机制及时发现并处理。
在监管要求较高的领域,还需要关注公平性、鲁棒性和可解释性等问题。特征重要性分析、部分依赖图和反事实解释等方法,有助于帮助业务和风控人员理解模型行为,提升信任度。
更多推荐

所有评论(0)