一个做了四年Python数据工程的程序员,在团队缩编的那天,发现数据清洗的活儿AI也能干了。

一、四年ETL,流水线上的螺丝钉

2024年底,我在一家做推荐系统的公司当数据工程师,工龄四年。日常工作的画面是这样的:早上到公司,打开Airflow的DAG面板,看看昨晚的定时任务有没有挂。挂了就修,没挂就等下一个需求。

我的技术栈是Python + Airflow + Spark + Hive。每天干的事情概括起来就三个字:抽、洗、载。从各种数据源把数据抽出来,清洗去重格式化,再灌进数仓里。ETL——Extract, Transform, Load——说起来高大上,做起来就是写一堆SQL和Python脚本,跟脏数据较劲。

“这个字段又有空值了,上游又改了表结构。”

这是我那几年说得最多的话。数据质量永远是坨烂摊子,上游业务系统的人改个字段名都不通知你,等你的任务报错了才知道。我维护着六十多个DAG,每个DAG里有十几到几十个Task,像一锅意大利面一样缠在一起。

薪资一万九,不算高但也不低。问题是没有成长空间。我在这个岗位上做了四年,第一年和第四年干的事情区别不大——无非是数据量更大了、表更多了、DAG更复杂了,但本质还是ETL。我跟朋友吐槽:我这个岗位,干两年和干十年,没区别。

2025年初,这种感觉开始变成焦虑。


二、团队缩编,AI开始抢我的活

2025年1月,公司搞了一次组织架构调整。我们数据团队从12个人缩到8个人,走了4个,全是ETL方向。

走的那几个人不是能力不行,是岗位没了。CTO在全员会上说了一句话:

“数据管道的建设已经基本完成,后续以维护为主。同时我们引入了一些AI辅助工具,可以自动化处理大部分数据清洗工作。”

我后来去看了那些"AI辅助工具"。有一款叫dbt+AI的产品,能自动检测数据质量异常,自动生成清洗规则,甚至能根据表结构变化自动适配ETL脚本。以前我要花半天修的表结构变更,它十分钟就搞定了。

还有个开源项目叫Great Expectations,配上大模型,能自动生成数据质量断言规则。以前我写一个数据质量校验脚本要一两个小时,现在AI五分钟出初版,我再调调就行。

那种感觉很难形容。不是被AI直接替代了——我的活还在,但从"需要一个人全职干"变成了"AI干80%,人干20%"。以前12个人的活,现在8个人就够了,而且以后可能5个人就够了。

留下来的8个人里,有4个被调去做算法相关的数据支持——给推荐模型做特征工程、训练数据准备。另外4个继续维护老管道。我被分到了维护组。

说实话那一刻我有点慌。维护组是什么意思?就是公司觉得你们这个方向不值得投入了,先养着,等哪天彻底不需要了就裁掉。

我做了一个决定:不能在ETL这棵树上吊死。


三、发现大模型训练数据这条路

转型的方向不是一下子找到的,是被一个同事点醒的。

2025年3月,算法团队的一个哥们儿在茶水间跟我抱怨:

“我们想做SFT微调,但训练数据太烂了。标注团队给的数据格式乱七八糟,去重都没做好,模型训练出来效果很差。你们数据团队的人能不能帮看看?”

我帮他看了。一看就发现,这些训练数据的问题跟我做了四年ETL遇到的数据质量问题一模一样:格式不统一、有重复数据、有脏数据、字段缺失。只不过以前我处理的是业务数据,现在这帮算法团队处理的是模型训练数据,而他们在这方面的经验几乎为零。

我开始研究大模型训练数据工程到底在干什么。越看越觉得,这就是ETL的高级版本。

SFT训练数据的标准格式是三元组:instruction(指令)、input(输入)、output(输出)。把各种非结构化数据转成这个格式,本质上就是ETL里的Transform阶段。数据去重要用MinHash+LSH算法,这跟我以前做业务数据去重是一个思路,只是算法不同。有害数据过滤、质量评分,这不就是数据质量校验嘛。

我花了两周时间,用我熟悉的Python + Airflow搭了一条SFT数据处理的pipeline。从原始数据采集、格式化、去重、质量过滤到最终输出训练集,全流程自动化。算法团队的人看到以后眼睛都亮了:

“你这套流程比我们手动处理好太多了,以前我们就是写个脚本跑一下,去重都没做。”

那一刻我突然明白了一件事:我做了四年ETL积累的数据清洗和质量管理经验,在大模型训练数据领域是直接可迁移的。脏数据进,脏模型出——这句话在大模型领域一样成立,但很多算法团队的人没有这个意识。


四、从ETL到训练数据流水线,踩过的坑

真正深入进去之后,我发现大模型训练数据工程跟传统ETL有几个关键区别,这些区别刚开始差点把我坑了。

第一个坑是数据去重。传统ETL里去重就是按主键或者hash去重,简单粗暴。但训练数据的去重不能这么干——两条数据如果文字相似度很高但不是完全相同,也得去重,否则模型会过拟合。我一开始用简单的hash去重,算法团队拿去训练后发现模型在某些类型的任务上效果异常好,在另一些上特别差——因为训练数据里有大量近似重复样本,模型"背"住了。

后来我改用MinHash+LSH做模糊去重,设了一个Jaccard相似度阈值0.8,把近似重复的样本也过滤掉。光这一步,训练数据量从120万条降到了83万条,但模型在评测集上的表现反而提升了——少了重复数据,泛化能力上来了。

第二个坑是偏好数据对的构建。做DPO(Direct Preference Optimization)需要偏好数据对——同一个问题,一个"好"回答和一个"差"回答。一开始我以为这就是标注团队的事,后来发现标注团队不知道什么叫"好"。他们标的偏好数据,很多时候是"长的好、短的差",或者"格式好的好、格式差的差",根本不是真正的质量偏好。

我介入之后,设计了一套偏好数据的质检流程:先自动计算chosen和rejected的回答在多个维度上的差异(长度、信息密度、事实准确性),过滤掉差异不明显的数据对,再交给人工复核。这套流程跑下来,偏好数据的有效率从55%提升到了82%。

第三个坑是评测数据集的设计。算法团队让我帮忙搭一个中文评测集,他们想参考MMLU的风格。我一开始觉得这不就是出题嘛,但深入做了才发现,评测集设计的核心不是"出什么题",而是"怎么保证评测的公平性和可重复性"。

我借鉴了做数据质量管理的经验,给评测集加了元数据标注——每道题的难度、领域、题型、是否容易被模型"背"到。还做了个版本管理,每次模型迭代用同一个版本的评测集跑,保证结果可比。这些事情,做ETL的人天然就会想到——数据要有版本、有血缘、有质量指标,但算法团队的人很少从这个角度思考。


五、大模型数据工程师每天在干什么

做了大半年,我对这个岗位的理解逐渐清晰了。大模型数据工程师的日常可以分成四大块。

第一块是SFT训练数据构建。从各种渠道采集原始数据——开源数据集、业务日志、人工标注、合成数据——然后清洗、格式化、去重、质量评分,最终输出成模型能吃的训练集。这跟ETL的Extract-Transform-Load本质上是一回事,只不过Target从数仓变成了训练框架。

第二块是评测数据集设计。维护一套领域评测集,定期更新,跟踪模型在不同版本上的表现变化。我搭了一个自动化评测pipeline:批量推理、自动打分、统计报告生成,跑一次评测从以前的半天缩短到二十分钟。

第三块是RLHF/DPO数据流水线。偏好标注数据的质量管控、偏好对的构建和过滤、人工标注与模型辅助标注的协同。这块的难点不在技术,在于"什么是好什么是差"这个标准怎么量化。

第四块是数据质量监控。训练数据不是一锤子买卖,数据源在变、模型在迭代、评测标准在更新,得有一套持续的质量监控机制。我做了个数据质量大屏,监控训练数据的规模、去重率、质量分布、领域覆盖度,发现异常自动告警。

这些活儿,每一样都跟ETL有对应关系。只不过以前的Target Table变成了训练数据集,以前的SQL脚本变成了Python pipeline,以前的数据质量校验变成了模型效果评测。


六、数据工程的底层能力,比你想的值钱

2025年10月,算法团队的Leader跟我说了一句话:

“以前我们觉得数据工程师就是帮忙搬数据的,现在才发现,模型好不好,一半取决于你们给的数据。”

这句话我记了很久。

大模型领域有个共识叫"Data is all you need"——模型架构大家都差不多,算力大公司都有,真正拉开差距的是训练数据的质量。而训练数据的质量,取决于数据工程的水平。

如果你也是做ETL、做数据工程的,正在焦虑这个方向会不会被AI替代,我的建议是:

别慌,你的核心能力比你以为的值钱得多。数据清洗、去重、质量校验、流水线编排、数据版本管理——这些在大模型训练数据领域全是刚需。算法团队的人懂模型,但不懂数据工程;他们能写出训练代码,但搞不定一条高质量的数据pipeline。

具体怎么做?三步。

第一步,去Hugging Face上找几个开源数据集,自己跑一遍完整的处理流程:加载、清洗、去重、格式化、质量评分、输出。用你熟悉的工具就行,Airflow、dbt、纯Python脚本都行,重点是理解训练数据的格式和标准。

第二步,学几个新东西:MinHash+LSH去重算法、DPO偏好数据对的构建方法、评测集的设计原则。这些是传统ETL里不涉及但大模型数据工程里天天用的。

第三步,找一个开源大模型项目(比如LLaMA-Factory或者OpenRLHF),看它们的训练数据是怎么组织的,试着跑一次微调。你会看到你的数据pipeline输出的数据是怎么喂给模型的,这个闭环理解了,你就从"数据工程师"变成了"大模型数据工程师"。

脏数据进脏模型出——这个道理我做了四年ETL才真正理解,而在大模型时代,它比任何时候都重要。

想入门 AI 大模型却找不到清晰方向?备考大厂 AI 岗还在四处搜集零散资料?别再浪费时间啦!2026 年 AI 大模型全套学习资料已整理完毕,从学习路线到面试真题,从工具教程到行业报告,一站式覆盖你的所有需求,现在全部免费分享

👇👇扫码免费领取全部内容👇👇

一、学习必备:100+本大模型电子书+26 份行业报告 + 600+ 套技术PPT,帮你看透 AI 趋势

想了解大模型的行业动态、商业落地案例?大模型电子书?这份资料帮你站在 “行业高度” 学 AI

1. 100+本大模型方向电子书

在这里插入图片描述

2. 26 份行业研究报告:覆盖多领域实践与趋势

报告包含阿里、DeepSeek 等权威机构发布的核心内容,涵盖:

  • 职业趋势:《AI + 职业趋势报告》《中国 AI 人才粮仓模型解析》;
  • 商业落地:《生成式 AI 商业落地白皮书》《AI Agent 应用落地技术白皮书》;
  • 领域细分:《AGI 在金融领域的应用报告》《AI GC 实践案例集》;
  • 行业监测:《2024 年中国大模型季度监测报告》《2025 年中国技术市场发展趋势》。

3. 600+套技术大会 PPT:听行业大咖讲实战

PPT 整理自 2024-2025 年热门技术大会,包含百度、腾讯、字节等企业的一线实践:

在这里插入图片描述

  • 安全方向:《端侧大模型的安全建设》《大模型驱动安全升级(腾讯代码安全实践)》;
  • 产品与创新:《大模型产品如何创新与创收》《AI 时代的新范式:构建 AI 产品》;
  • 多模态与 Agent:《Step-Video 开源模型(视频生成进展)》《Agentic RAG 的现在与未来》;
  • 工程落地:《从原型到生产:AgentOps 加速字节 AI 应用落地》《智能代码助手 CodeFuse 的架构设计》。

二、求职必看:大厂 AI 岗面试 “弹药库”,300 + 真题 + 107 道面经直接抱走

想冲字节、腾讯、阿里、蔚来等大厂 AI 岗?这份面试资料帮你提前 “押题”,拒绝临场慌!

1. 107 道大厂面经:覆盖 Prompt、RAG、大模型应用工程师等热门岗位

面经整理自 2021-2025 年真实面试场景,包含 TPlink、字节、腾讯、蔚来、虾皮、中兴、科大讯飞、京东等企业的高频考题,每道题都附带思路解析

2. 102 道 AI 大模型真题:直击大模型核心考点

针对大模型专属考题,从概念到实践全面覆盖,帮你理清底层逻辑:

3. 97 道 LLMs 真题:聚焦大型语言模型高频问题

专门拆解 LLMs 的核心痛点与解决方案,比如让很多人头疼的 “复读机问题”:


三、路线必明: AI 大模型学习路线图,1 张图理清核心内容

刚接触 AI 大模型,不知道该从哪学起?这份「AI大模型 学习路线图」直接帮你划重点,不用再盲目摸索!

在这里插入图片描述

路线图涵盖 5 大核心板块,从基础到进阶层层递进:一步步带你从入门到进阶,从理论到实战。

img

L1阶段:启航篇丨极速破界AI新时代

L1阶段:了解大模型的基础知识,以及大模型在各个行业的应用和分析,学习理解大模型的核心原理、关键技术以及大模型应用场景。

img

L2阶段:攻坚篇丨RAG开发实战工坊

L2阶段:AI大模型RAG应用开发工程,主要学习RAG检索增强生成:包括Naive RAG、Advanced-RAG以及RAG性能评估,还有GraphRAG在内的多个RAG热门项目的分析。

img

L3阶段:跃迁篇丨Agent智能体架构设计

L3阶段:大模型Agent应用架构进阶实现,主要学习LangChain、 LIamaIndex框架,也会学习到AutoGPT、 MetaGPT等多Agent系统,打造Agent智能体。

img

L4阶段:精进篇丨模型微调与私有化部署

L4阶段:大模型的微调和私有化部署,更加深入的探讨Transformer架构,学习大模型的微调技术,利用DeepSpeed、Lamam Factory等工具快速进行模型微调,并通过Ollama、vLLM等推理部署框架,实现模型的快速部署。

img

L5阶段:专题集丨特训篇 【录播课】

img
四、资料领取:全套内容免费抱走,学 AI 不用再找第二份

不管你是 0 基础想入门 AI 大模型,还是有基础想冲刺大厂、了解行业趋势,这份资料都能满足你!
现在只需按照提示操作,就能免费领取:

👇👇扫码免费领取全部内容👇👇

2026 年想抓住 AI 大模型的风口?别犹豫,这份免费资料就是你的 “起跑线”!

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐