登录社区云,与社区用户共同成长
邀请您加入社区
本项目将 Kaggle 电商数据集上传至 HDFS,借助 Hive 映射生成数据表。依托 SparkCore 与 SparkSQL 完成离线数据处理,结合 SparkML 搭建分析模型:通过 KMeans 完成用户分群,逻辑回归预测用户复购倾向,线性回归预估七日 GMV。采用 SparkStreaming 对接 Kafka 实现实时流数据计算,离线与实时共 21 项指标存入 MySQL。后端 Sp
本设计基于 PySpark、SparkML、Kafka、Hive 搭建深圳智慧交通预警可视化平台。依托 Hive+HDFS 搭建数据仓库存储路网 CSV 数据,Kafka 采集实时车流;通过 PySpark Streaming 实时计算、SparkSQL 离线聚合统计拥堵指标,利用 KMeans 聚类完成路段风险分级。后端使用 SpringBoot,Vue+Echarts 实现交通大屏可视化,支持