一、实验概述

1.1 实验目的

本次实验依托助睿 Uniplore一站式数据科学平台,基于已有的学生考勤主题标签表,以迟到、早退、请假、未穿校服次数作为核心特征,使用K-Means 无监督聚类算法完成学生考勤行为自动分群。结合数据可视化解读聚类结果,为不同聚类簇赋予业务含义,划分出多类考勤群体;最后通过 ETL 工具将聚类编号、群体标签回写至原始数据表,完成考勤扩展标签构建,为校园学生行为分析、精细化管理与精准干预提供数据支撑。

1.2 实验环境

  • 实验平台:助睿在线实验平台 https://lab.guilian.cn/
  • 配套官网:助睿数智 https://www.uniplore.com/
  • 核心模块:人工智能 AI Studio、数据集成 ETL、助睿 BI 数据可视化
  • 数据库:MySQL 团队私有数据库
  • 前置数据源:student_attendance_stats 学生考勤主题标签表
  • 运行设备:普通计算机,具备平台访问及数据库连接权限

二、实验数据与建模思路

2.1 数据源介绍

实验数据源为student_attendance_stats,整合了学生基础信息、年级、性别、校区、住校状态以及四类考勤违纪统计数据,字段覆盖文本、分类、连续数值、日期等多种类型。本次仅选用考勤次数类数值字段参与聚类建模,学生基础属性仅用作后续画像辅助分析。

2.2 核心字段说明

表格

字段名称 字段类型 说明 是否参与建模
student_id 整型 学生 ID 是(维度标识)
class_id 整型 班级 ID 是(维度标识)
late_count 整型 迟到次数 是(核心特征)
early_leave_count 整型 早退次数 是(核心特征)
leave_count 整型 请假次数 是(核心特征)
uniform_violate_count 整型 未穿校服次数 是(核心特征)
其余字段 文本 / 日期 姓名、年级、性别、校区等

2.3 建模思路

  1. 特征选择:选取迟到、早退、请假、未穿校服四类次数作为聚类特征,字段业务含义独立、相关性低,无数据冗余,模型解释性强。
  2. 数据适配:考勤次数均为非负连续整数,完全适配 K-Means 算法,无需额外做归一化、哑变量编码等复杂预处理。
  3. 建模规则:固定聚类簇数量为3 类,贴合校园考勤业务场景,划分不同纪律等级的学生群体。
  4. 分工逻辑:数值指标用于聚类分群,学生基础属性仅用于后期群体画像解读,不参与模型训练。

三、完整实验操作步骤(附截图指引)

3.1 AI Studio 完成 K-Means 聚类建模

3.1.1 新建 AI 工作流
  1. 登录平台,左侧菜单栏进入 ** 人工智能(AI Studio)** 模块。
  2. 点击「+」→新建工作流,搭建机器学习流程画布。
3.1.2 数据库加载原始数据
  1. 在组件库搜索并拖拽数据库加载组件至画布。
  2. 双击组件,配置团队私有 MySQL 数据库并完成连接,选择数据表student_attendance_stats
  3. 字段筛选:仅保留student_idclass_idlate_countearly_leave_countleave_countuniform_violate_count,其余字段设置为skip,并区分分类型、数值型字段属性。
  4. 右键运行组件,执行成功后查看输出数据预览。
3.1.3 配置并运行 K-Means 聚类
  1. 拖拽K-Means组件,连线至数据库加载组件输出端。
  2. 双击组件设置参数:簇数量 = 3,其余参数保持默认。
  3. 右键运行组件,模型执行完成后,每条数据会被标记聚类编号C1/C2/C3
3.1.4 聚类结果入库保存
  1. 拖拽数据入库组件,连接 K-Means 输出结果。
  2. 配置数据库连接,选择新建数据表,命名为student_cluster
  3. 运行整条工作流,将聚类编号、轮廓系数、原始特征等数据持久化到数据库。

3.2 助睿 BI 可视化解读聚类群体

单纯的聚类编号不具备业务含义,借助助睿 BI 制作散点图,分析三类簇的行为特征,完成群体定义。

3.2.1 新建数据源与数据集
  1. 进入助睿 BI模块,点击「数据源」→新建 MySQL 连接,填入团队数据库信息,测试连接并保存。📷 截图 5:BI 平台 MySQL 数据源创建与连接测试

  2. 进入「数据集」,新建数据集,选择对应数据源与labs目录,将student_cluster数据表拖拽至画布。

  3. 批量修改字段中文备注,核对表结构后保存并发布数据集。

3.2.2 制作探索器散点图
  1. 进入「工作表」,新建分组统一管理图表,在分组内依次新建工作表。
  2. 图表类型选择探索器(散点图),两两组合四类考勤指标搭建分析图表:
    • 迟到次数 VS 早退次数
    • 迟到次数 VS 请假次数
    • 迟到次数 VS 未穿校服次数
    • 早退次数 VS 请假次数
    • 早退次数 VS 未穿校服次数
    • 请假次数 VS 未穿校服次数
  3. 配置规则:X/Y 轴对应考勤字段,颜色绑定Cluster聚类编号,信息绑定student_id,数据限额设置为 100%,调整主题色区分不同簇,完成后保存发布。
3.2.3 搭建综合分析仪表盘
  1. 进入「仪表盘」模块,新建仪表盘并命名为「聚类簇分析」。
  2. 拖拽文本组件制作标题,再将 6 张散点图依次添加至画布,自由调整布局、大小。
  3. 完成后保存并发布仪表盘,支持集中查看、对比所有聚类分布特征。
3.2.4 聚类群体业务解读

结合六组散点图分布规律,对三类聚类簇进行业务释义:

表格

聚类簇编号 标识颜色 群体名称 核心行为特征
C1 蓝色 自律模范型 各类考勤异常次数极低,数据集中在低位,出勤稳定、纪律意识强
C2 青色 轻微波动型 迟到、早退极少,仅偶发请假或未穿校服行为,整体纪律可控
C3 黄色 纪律高危型 高频违纪,多类异常行为叠加,存在大量离群数据,为重点管控群体

3.3 ETL 工具实现标签回写与字段扩充

通过 ETL 将聚类编号、中文群体标签追加到原始考勤表,完成标签扩充。

3.3.1 为原始表新增扩展字段
  1. 进入数据集成 ETL模块,新建转换流,拖拽执行 SQL 脚本组件。
  2. 连接团队私有数据库,执行以下 SQL 语句,为student_attendance_stats新增两个字段:

sql

ALTER TABLE student_attendance_stats
ADD COLUMN cluster VARCHAR(10) NULL DEFAULT NULL COMMENT '聚类簇编号',
ADD COLUMN attendance_group VARCHAR(30) NULL DEFAULT NULL COMMENT '考勤群体分类';
  1. 运行转换流,完成表结构变更。
3.3.2 读取聚类结果并精简字段
  1. 新建转换流「增加考勤群体分类标签」,拖拽表输入组件,读取student_cluster表数据。
  2. 搭配字段选择组件,仅保留student_idCluster两个关键字段,删除冗余内容,并统一字段数据类型。​​​​​​​
3.3.3 聚类编号映射为中文标签
  1. 拖拽值映射组件,连线至字段选择组件。
  2. 配置映射规则:
    • C1 → 自律模范型
    • C2 → 轻微波动型
    • C3 → 纪律高危型
  3. 生成新字段attendance_group,实现编号到中文标签的转换。
3.3.4 数据更新至原始考勤表
  1. 拖拽更新组件,连接值映射输出端。
  2. 选择目标表student_attendance_stats,设置关联条件:根据 student_id 匹配数据
  3. 配置更新规则:将流中的Clusterattendance_group写入目标表对应新增字段。
3.3.5 运行流程并验证结果
  1. 运行整条 ETL 转换流,查看执行日志确保无报错。
  2. 通过数据探查功能打开student_attendance_stats,校验clusterattendance_group字段数据是否更新成功。

四、实验总结

  1. 技术流程闭环:本次实验串联AI 聚类建模、BI 可视化分析、ETL 数据更新三大模块,完整复现了「特征选取→模型训练→结果解读→标签落地」的标准数据挖掘全流程,全程零代码拖拽操作,大幅降低机器学习落地门槛。
  2. 模型效果与业务结合:基于 K-Means 算法成功将全体学生划分为三类考勤群体,通过散点图完成聚类结果的业务化解读,让机器生成的抽象编号转变为可落地、可理解的用户画像。
  3. 数据价值落地:利用 ETL 工具将聚类标签回写至业务表,扩充学生考勤标签体系,形成标准化数据集。
  4. 应用场景延伸:该方案不仅适用于校园考勤分析,也可迁移至员工行为分群、用户消费聚类、风险人群识别等场景,具备较强的复用性。

整套流程充分体现了零代码数据平台在教学、企业数据加工中的优势,无需深厚编程功底,即可完成从原始数据到智能标签的全链路处理,为校园精细化管理提供了扎实的数据支撑。

文章标签

#助睿数智 #零代码 AI #KMeans 聚类 #数据挖掘 #学生画像 #考勤数据分析 #ETL 数据集成 #数据标签化

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐