【上海电机学院本科毕业论文】基于机器学习的二手车市场价格预测
注:仅展示部分文档内容和系统截图,需要完整的视频、代码、文章和安装调试环境请私信up主。
学生的技术与实现
摘 要
随着二手车交易市场规模持续扩大,传统人工估价方式存在效率低、主观性强、误差较大等问题,难以满足市场智能化评估需求。为此,本文设计并实现了一种基于机器学习的二手车价格预测系统,以提升二手车估值的精准度与自动化水平。首先,梳理了二手车价格预测与机器学习回归算法的国内外研究现状;其次,对二手车数据集进行探索分析、清洗与特征工程处理,构建适用于模型训练的标准化数据;接着,选用随机森林作为核心预测算法,并结合SVM、决策树构建对比模型,完成模型训练与参数优化;最后,基于Flask前后端分离架构完成预测系统开发,实现数据管理、可视化分析与价格预测等功能。实验结果表明,随机森林模型在二手车价格预测任务中表现稳定,预测精度与泛化能力优于对比模型,所设计的系统能够有效完成二手车价格智能评估,具备实际应用价值。
关键词:价格预测,机器学习,SVM,Flask,随机森林模型
1.1 研究背景
随着我国汽车保有量不断增加和二手车市场快速发展,车辆定价也逐渐成为影响交易的一个重要因素。而传统的手工估价主要是依靠有经验的专业人士,通过观察车辆外观、内部情况以及查阅相关资料来给出一个价格,虽然有一定的权威性但是也有很大的弊端:一是主观性强,完全凭个人感觉决定;二是工作量大,不能做到大批量操作;三是受到很多外界因素的影响,很难保证公平公正。这些问题都阻碍着它向智能化发展。而在这种情况下,机器学习由于能够大量数据分析、对各种复杂情况进行准确判断并且有着非常高的预测能力,所以正在成为解决众多因素影响导致的价格波动的一种有效工具。
1.2 研究目的与意义
二手车交易是汽车产业的重要环节,其健康发展关系到汽车流通效率、资源循环利用与市场消费信心。但是目前二手车评估缺乏一套完整标准,在传统估价方式下由于工作效率较低、人为因素较大并且不够精准而备受质疑。这些弊端既损害买卖双方利益又阻碍行业发展及其潜力发挥。因此利用机器学习建立二手车定价模型研究具有较高理论意义同时也具有良好应用价值。
2.1 数据集
数据集是开展机器学习建模研究的基础支撑,数据样本的规模大小、字段完整性与数据真实程度,直接影响后续模型训练效果与预测精度。本研究以二手车价格预测为研究主题,选用行业通用的瓜子二手车公开交易数据集(https://www.datafountain.cn/datasets/5889)作为研究数据源,该数据集来源于真实二手车交易平台,数据公开合规、无隐私敏感信息,字段覆盖车辆基础属性、使用状况及交易价格等核心内容,适合用于回归预测模型的训练与实验分析。
表2-1 数据集字段信息说明表
|
字段名称 |
字段类型 |
字段含义 |
|
品牌 |
类别型 |
汽车生产品牌 |
|
车系 |
类别型 |
车辆具体车型系列 |
|
新车指导价 |
数值型 |
车辆原厂官方指导价格 |
|
车龄 |
数值型 |
车辆使用年限 |
|
行驶里程 |
数值型 |
车辆累计行驶公里数 |
|
变速箱类型 |
类别型 |
手动挡、自动挡 |
|
燃油类型 |
类别型 |
汽油、柴油、新能源等 |
|
排放标准 |
类别型 |
国三、国四、国五、国六 |
|
车辆级别 |
类别型 |
紧凑型、中型、中大型、SUV等 |
|
交易价格 |
数值型 |
二手车实际成交价格 |
3.1 集成学习概述
集成学习是通过构建并组合多个基础学习器共同完成预测任务的机器学习方法,其核心优势在于能够降低单一模型的过拟合风险,提升整体算法的稳定性与泛化能力。在二手车价格预测这类高维度、非线性、存在数据噪声的回归任务中,单一模型往往难以充分拟合特征与价格之间的复杂关系,而集成学习通过对多个弱学习器进行融合,可显著提升预测精度与鲁棒性。

3.2 随机森林模型
随机森林(Random Forest)是由多棵决策树组成的集成回归模型,其核心思想是通过双重随机化策略降低模型方差,提高泛化性能。在样本层面,采用Bootstrap采样从原始数据集中随机抽取子数据集,分别训练不同的决策树;在特征层面,每棵决策树在节点分裂时仅随机选取部分特征参与最优划分计算[17]。
4.1 决策树模型
决策树是一种经典的非参数监督学习算法,既可以用于分类任务,也可以用于回归任务,在二手车价格预测等连续值预测场景中被广泛作为基准模型使用。决策树以树形结构进行递归决策,从根节点开始,按照特征的取值不断对数据集进行划分,最终在叶节点输出预测结果,具备结构直观、可解释性强、训练速度快、无需数据标准化等显著优势[18]。
4.2 基于二手车价格预测的决策树模型构建
本研究基于Python与Scikit-learn库构建决策树回归(Decision Tree Regression,DTR)模型,使用与随机森林完全一致的预处理数据集、特征集与数据集划分规则,保证多模型对比公平、统一。
表4-1 决策树回归模型核心参数配置表
|
参数名称 |
取值 |
参数说明 |
|
max_depth |
12 |
限制树最大深度,防止过拟合 |
|
min_samples_split |
5 |
节点分裂所需最小样本数 |
|
min_samples_leaf |
2 |
叶节点最小样本数 |
|
random_state |
42 |
固定随机种子,保证实验可复现 |
|
criterion |
squared_error |
分裂准则:均方误差(MSE) |
5.1 支持向量回归模型
支持向量回归(Support Vector Regression,SVR)是支持向量机(SVM)在回归预测任务上的扩展实现,通过引入核函数与间隔最大化机制,在小样本、高维、非线性数据场景中表现出优异的泛化能力与鲁棒性,被广泛应用于金融预测、价格评估、状态识别等工程领域。
5.2 基于二手车价格预测的SVR模型构建
本研究基于Python与Scikit-learn库构建SVR二手车价格预测模型,采用与第三章、第四章完全一致的预处理数据集、特征集合与训练/测试集划分比例,保证多模型对比公平、实验可复现。模型输入特征包括新车指导价、行驶里程、车龄、变速箱类型、排放标准、车辆级别等,输出为二手车交易价格预测值。
表5-1 SVR模型核心参数配置表
|
参数名称 |
取值 |
参数说明 |
|
kernel |
rbf |
核函数类型:高斯核 |
|
C |
100 |
惩罚系数 |
|
gamma |
0.1 |
核函数系数 |
|
epsilon |
0.1 |
不敏感损失区间 |
|
random_state |
42 |
随机种子 |
6.1 模型在测试集上的评估
测试集性能反映模型对未知数据的泛化能力,是评价预测模型的核心依据。本部分采用统一评价指标,对三种模型进行公平对比。
6.1.1 评估指标
本研究采用机器学习回归任务通用的四大指标,公式如下
6.1.2 模型性能分析
三种模型在测试集上的综合性能如表6-3所示。
表6-3 测试集模型性能对比表
|
模型 |
MAE |
MSE |
RMSE |
R² |
|
决策树回归 |
1.246 |
3.862 |
1.965 |
0.762 |
|
SVR |
0.977 |
2.945 |
1.716 |
0.817 |
|
随机森林回归 |
0.628 |
1.146 |
1.070 |
0.934 |

6.2 模型在训练集上的性能对比
本章基于相同的软硬件平台、相同的数据集划分标准、相同的预处理方法,比较了随机森林回归、决策树回归和支持向量回归(SVR)这三种经典机器学习方法对于二手车定价的效果。从模型拟合效果、泛化能力和计算资源消耗这三个方面对不同方法进行了分析与讨论,以期为建立准确可靠的二手车估价系统奠定基础并指明各种方法的应用范围及其改进方向。
6.2.1 时间性能分析
时间性能是模型工程化应用的重要指标,包括模型训练耗时与预测耗时。本研究在相同硬件环境下记录三种模型的运行时间,结果如表6-1所示。
表6-1 模型训练与预测时间对比表
|
模型 |
训练耗时/s |
单条预测耗时/ms |
|
决策树回归 |
0.78 |
1.21 |
|
SVR |
27.54 |
4.66 |
|
随机森林回归 |
3.22 |
2.35 |

参考文献
- 黄文武.基于集成学习的二手车价格预测研究[D].华中师范大学,2022.
- 孙庆.基于机器学习算法的二手车估值模型分析[D].北京林业大学,2022.
- 郭文璐.二手车价格的影响因素研究及预测分析[D].首都经济贸易大学,2022.
- 胡诣文,张天佑,张旭,周才英.基于机器学习的二手车价格预测算法研究[J].信息技术与信息化,2022,(10):52-55.
- 任武彬.基于机器学习方法的二手车价格预测[D].湘潭大学,2023.
- 朱晓叶.基于深度学习二手车的价格预测[D].山东师范大学,2023.
注:仅展示部分文档内容和系统截图,需要完整的视频、代码、文章和安装调试环境请私信up主。
更多推荐





所有评论(0)