我写了五年Hive SQL,优化过几十张宽表,处理过上PB的数据,拿过两次季度的“数据治理标兵”。但在公司决定做行业大模型的那天,我被一句话问懵了。

“数据这边你来出SFT数据,两周后给第一批。”

我盯着会议室白板,那上面写的不是分区字段,不是字段血缘,不是缓慢变化维,是三个英文词:instruction、input、output。我张了张嘴,硬是一个都没接得上。

同组的小张——一个才来两年的数据分析师——在旁边说了句:“SFT就是指令微调,格式跟Alpaca一样吧?我们可以把FAQ转成instruction格式。”会议室里好几个人点头。那一刻我清楚地意识到,我做了五年数仓,却成了这个屋里最不懂数据的人。


一、数据仓库的荣耀,在行业大模型面前失效了

我入行那会儿,数据工程师还是很吃香的。Hive、Spark、Kafka、Flink,会一个就能找到工作,会两个算优秀。我的日常工作是这样的:业务提需求,我取数、建表、写ETL、做调度、监控数据质量。晚上偶尔上线,跟业务对口径,跟算法撕字段定义。

我很熟悉这套体系。维度建模、星型模型、缓慢变化维、拉链表、全量增量、数据血缘、主数据管理,这些名词我张口就来。我以为数据工程这件事我已经摸到底了,剩下的只是继续优化效率。

但大模型时代给我的第一课是:数据的形式变了,数据的用途变了,数据的评价标准也变了。

传统数仓里,数据是“事实的记录”。用户下了单,商品改了价,系统留了日志,我们把它们抽出来、洗干净、按主题组织好,供报表和BI使用。数据的正确性,通常是看它和业务事实是否一致。

大模型训练数据不是这样。它不是事实记录,而是“知识和能力的样本”。一条SFT数据不是告诉你“某用户某时买了某物”,而是教模型“遇到这种问题,应该这样回答”。数据的好坏不在于它是否记录了事实,而在于它能否让模型学到正确的行为和语言模式。

这个底层差异,让我过去五年引以为傲的ETL经验 suddenly 不够用了。不是经验没用,是经验需要被重新翻译。


二、第一次拆SFT数据,我像个实习生

我接到的第一个任务,是把公司产品文档转成SFT数据。听起来简单,文档现成的,照着问题答案写不就行了?

真动手才发现坑多得吓人。

首先是格式。标准的Instruction-Following数据格式长这样:

{
  "instruction": "请根据公司产品文档,回答用户关于退货流程的问题。",
  "input": "用户:我想退货,需要什么条件?",
  "output": "您可以申请7天无理由退货。请进入订单详情页,点击‘申请退货’,填写退货原因并上传凭证。审核通过后,我们会在48小时内处理。"
}

instruction是任务描述,input是用户输入,output是期望输出。这三部分的写法直接影响微调效果。instruction写得太泛,模型学不到具体能力;写得太细,又容易过拟合。input要覆盖真实用户的各种问法,output要规范、统一、可复用。

我起初按文档目录自动生成了一批:每个章节标题当instruction,正文当output。结果模型微调后,答出来的东西像说明书,生硬、冗长、不管用户问什么都是一大段。后来我改了策略:让业务同事先列出真实高频问题,再针对问题构造答案,把答案控制在150字以内,答案里必须包含下一步动作。

其次是多样性。同一类问题,用户可能有一百种问法。退货流程可以问“怎么退货”“我想退东西”“退货条件是什么”“你们支持退货吗”。如果SFT数据里只有一两种问法,模型遇到变体就容易答错。我建了一个“问题改写”流程,用开源模型对原始问题做同义改写、口语化改写、缺省主语改写,把一条数据扩展成5到8条。

还有就是边界控制。有些问题文档里没有明确答案,SFT数据里不能瞎编。我设计了一个“可回答性”标签:知识库内能回答的、需要补充信息的、明确不能回答的。不能回答的数据,output要教模型说“根据现有信息无法确认”而不是胡编。

两周后我交了第一批5000条数据。算法同学拿去微调,效果比预期好。我松了口气,也第一次觉得,数据工程师转型大模型数据工程,不是换行,是换脑。


三、清洗与去重:老手艺的新用法

SFT数据量起来之后,质量问题开始暴露。我们攒了几十万条数据,里面混着重复、低质、格式错误、答案不一致的样本。我第一反应是:这不就是数仓里的数据清洗吗?我熟。

但大模型数据的清洗,标准不一样。

传统数仓里,重复数据是坏事,因为它会导致统计指标被重复计算。但大模型训练数据里,重复不一定全是坏事。高频出现的模式,模型会学得更好;但完全重复的样本,又会让模型过拟合。所以我不能简单去重,而要“有策略地降重”。

我先用MinHash + LSH做模糊去重。MinHash把文本转成签名,LSH把相似签名聚到一块,这样能快速找到高度相似的数据对。我们设置Jaccard相似度阈值0.85,超过这个阈值的样本只保留一条。对于稍微重复但表达不同的样本,比如“怎么退货”和“退货怎么弄”,我保留它们,因为模型需要学习语言变体。

低质数据过滤也是一门学问。我定的规则包括:

  • output长度小于20字或大于800字的,剔除;
  • 包含大量乱码、特殊符号、无意义字符的,剔除;
  • instruction和output语义明显不匹配的,剔除;
  • 用困惑度(perplexity)打分, perplexity 过高或过低都可能是异常样本,人工抽检后处理。

我还用了一个数据多样性评估指标:按主题和指令类型做聚类,看数据分布是否均衡。如果80%的数据都是“查询类”,而“生成类”“比较类”很少,微调出来的模型会偏科。我把各类型的占比画成饼图,跟算法团队对齐目标比例,再补数据。

“你这跟做数据治理不是一回事吗?”数仓组的同事看我天天跑数据质量报告,问我。
“是,但治理的目标变了。以前是为了报表准确,现在是为了让模型学得好。”

那一刻我觉得,过去五年的ETL、数据质量、血缘管理经验,在大模型数据工程里全都能用上。只是以前服务对象是BI系统,现在服务对象是模型训练Pipeline。


四、DPO数据:我开始理解“偏好”是什么

SFT之后,我又接到了DPO数据的任务。DPO是直接偏好优化,需要构造chosen/rejected成对数据。比如同一个问题,有两个回答,一个更好,一个更差,模型学习“哪个更好”。

这比SFT难多了。SFT好歹有个“标准答案”,DPO没有。什么是更好的回答?更简洁?更详细?更礼貌?更符合业务规范?不同场景标准不一样。

我先做了一个DPO标注规范。针对客服场景,好回答的标准是:先共情、再解决、最后给下一步动作;坏回答的标准是:只给答案没有温度、答非所问、让用户自己找链接。针对技术文档场景,好回答的标准是:步骤清晰、准确、有代码示例;坏回答的标准是:笼统、遗漏关键参数、把多个问题混为一谈。

标注很痛苦。我们组织了5个业务同事,对同一批2000条问题各写两个答案,然后互相打分。最开始一致性很差,同一条答案有人给5分有人给2分。我们开了三次评审会,逐条对标准答案,最后Cohen’s Kappa系数从0.35提升到0.71,勉强可用。

我深刻体会到,大模型数据工程里,最难的不是写代码,而是定义“什么是好”。这跟数仓里定义“指标口径”一样,是数据工程师的核心能力,只是现在变成了定义“模型行为的口径”。

DPO数据上线后,模型在客服场景的满意度评分提升了一个档位。我们后续还加了RLHF数据,但DPO阶段已经让我脱胎换骨。


五、评测数据:从“能跑”到“能评”

数据工程做到后来,我意识到一个更重要的问题:没有评测数据,你永远不知道数据做得好不好。

我们花了很大精力做SFT和DPO数据,但模型训练出来效果怎么样,不能只看demo。我牵头建了一个评测数据集,覆盖我们业务的核心场景:流程查询、故障排查、产品对比、话术生成。每个场景有100到300条带标准答案的测试题,答案是人工写的,作为golden answer。

评测数据集和训练数据集要严格隔离。我把数据按时间切分,训练用上半年的真实数据,评测用下半年的。如果训练数据和评测数据有重叠,测出来的分数会虚高,没有意义。

评测指标我们也做了区分。客观题用exact match和F1;主观开放题用LLM-as-a-Judge,让GPT-4给两个回答打分,同时加人工抽检。我们还对比了自动评分和人工评分的一致性,确保自动化评测能反映真实水平。

“你现在干的活,像数据QA。”一个测试同事调侃我。
“比QA还复杂。QA验证的是软件行为,我验证的是数据能不能让模型变聪明。”

我慢慢形成了自己的工作流:数据采集→清洗→去重→质量评估→格式转换→版本管理→训练→评测。这个Pipeline就是我转型后的核心产出。


六、数据工程师在大模型时代的不可替代性

做了大半年,我对自己的定位越来越清晰。我不是算法工程师,不是Prompt工程师,我是一个能把“数据”变成“模型能力”的人。

传统数据工程师的优势在这里非常值钱。ETL经验让我能搭稳定的数据Pipeline;数据质量经验让我能定义过滤规则和评估指标;数据血缘经验让我能追溯某条训练数据的来源和版本;元数据管理经验让我能把数据按类型、主题、难度分门别类。这些能力,在大模型数据工程里不是加分项,是基本盘。

但我也补了很多新东西。我学会了Instruction-Following格式、DPO数据构造、MinHash去重、LLM-as-a-Judge评测、数据版本控制(DVC)。我开始关注模型训练 downstream 的效果,而不只是数据本身有没有错。

给想转型的数据工程师几点建议:

第一,不要觉得你的Hive/Spark SQL没用了。数据清洗、去重、质量监控、血缘管理这些能力,在大模型数据工程里直接复用。你的对手不是新工具,是你自己能不能把旧能力翻译到新场景。

第二,从SFT数据开始入手。找一份开源数据比如Alpaca或ShareGPT风格的数据,理解它的格式、构造逻辑、问题类型。然后拿自己公司的FAQ或文档,试着手动构造50条。

第三,学会评估数据质量。不要只追求数据量大,要关注多样性、准确性、边界覆盖。用 perplexity、重复率、主题分布这些指标量化你的数据。

第四,参与DPO或RLHF数据的标注。这件事很枯燥,但能让你理解“模型偏好”是怎么形成的。你会明白,数据工程不只是“准备数据”,而是“塑造模型行为”。

第五,跟算法团队坐近一点。你的Pipeline最终是为训练服务的,理解训练目标、loss曲线、评测指标,能让你做数据时更有方向感。

我现在名片上的title是“大模型数据工程师”。偶尔会怀念当年做数仓时那种“数据尽在掌握”的感觉。但现在我掌握的是另一种东西:让模型真正学会一门业务能力的“知识原料”。

这工作,比我想象中更有意思。

想入门 AI 大模型却找不到清晰方向?备考大厂 AI 岗还在四处搜集零散资料?别再浪费时间啦!2026 年 AI 大模型全套学习资料已整理完毕,从学习路线到面试真题,从工具教程到行业报告,一站式覆盖你的所有需求,现在全部免费分享

👇👇扫码免费领取全部内容👇👇

一、学习必备:100+本大模型电子书+26 份行业报告 + 600+ 套技术PPT,帮你看透 AI 趋势

想了解大模型的行业动态、商业落地案例?大模型电子书?这份资料帮你站在 “行业高度” 学 AI

1. 100+本大模型方向电子书

在这里插入图片描述

2. 26 份行业研究报告:覆盖多领域实践与趋势

报告包含阿里、DeepSeek 等权威机构发布的核心内容,涵盖:

  • 职业趋势:《AI + 职业趋势报告》《中国 AI 人才粮仓模型解析》;
  • 商业落地:《生成式 AI 商业落地白皮书》《AI Agent 应用落地技术白皮书》;
  • 领域细分:《AGI 在金融领域的应用报告》《AI GC 实践案例集》;
  • 行业监测:《2024 年中国大模型季度监测报告》《2025 年中国技术市场发展趋势》。

3. 600+套技术大会 PPT:听行业大咖讲实战

PPT 整理自 2024-2025 年热门技术大会,包含百度、腾讯、字节等企业的一线实践:

在这里插入图片描述

  • 安全方向:《端侧大模型的安全建设》《大模型驱动安全升级(腾讯代码安全实践)》;
  • 产品与创新:《大模型产品如何创新与创收》《AI 时代的新范式:构建 AI 产品》;
  • 多模态与 Agent:《Step-Video 开源模型(视频生成进展)》《Agentic RAG 的现在与未来》;
  • 工程落地:《从原型到生产:AgentOps 加速字节 AI 应用落地》《智能代码助手 CodeFuse 的架构设计》。

二、求职必看:大厂 AI 岗面试 “弹药库”,300 + 真题 + 107 道面经直接抱走

想冲字节、腾讯、阿里、蔚来等大厂 AI 岗?这份面试资料帮你提前 “押题”,拒绝临场慌!

1. 107 道大厂面经:覆盖 Prompt、RAG、大模型应用工程师等热门岗位

面经整理自 2021-2025 年真实面试场景,包含 TPlink、字节、腾讯、蔚来、虾皮、中兴、科大讯飞、京东等企业的高频考题,每道题都附带思路解析

2. 102 道 AI 大模型真题:直击大模型核心考点

针对大模型专属考题,从概念到实践全面覆盖,帮你理清底层逻辑:

3. 97 道 LLMs 真题:聚焦大型语言模型高频问题

专门拆解 LLMs 的核心痛点与解决方案,比如让很多人头疼的 “复读机问题”:


三、路线必明: AI 大模型学习路线图,1 张图理清核心内容

刚接触 AI 大模型,不知道该从哪学起?这份「AI大模型 学习路线图」直接帮你划重点,不用再盲目摸索!

在这里插入图片描述

路线图涵盖 5 大核心板块,从基础到进阶层层递进:一步步带你从入门到进阶,从理论到实战。

img

L1阶段:启航篇丨极速破界AI新时代

L1阶段:了解大模型的基础知识,以及大模型在各个行业的应用和分析,学习理解大模型的核心原理、关键技术以及大模型应用场景。

img

L2阶段:攻坚篇丨RAG开发实战工坊

L2阶段:AI大模型RAG应用开发工程,主要学习RAG检索增强生成:包括Naive RAG、Advanced-RAG以及RAG性能评估,还有GraphRAG在内的多个RAG热门项目的分析。

img

L3阶段:跃迁篇丨Agent智能体架构设计

L3阶段:大模型Agent应用架构进阶实现,主要学习LangChain、 LIamaIndex框架,也会学习到AutoGPT、 MetaGPT等多Agent系统,打造Agent智能体。

img

L4阶段:精进篇丨模型微调与私有化部署

L4阶段:大模型的微调和私有化部署,更加深入的探讨Transformer架构,学习大模型的微调技术,利用DeepSpeed、Lamam Factory等工具快速进行模型微调,并通过Ollama、vLLM等推理部署框架,实现模型的快速部署。

img

L5阶段:专题集丨特训篇 【录播课】

img
四、资料领取:全套内容免费抱走,学 AI 不用再找第二份

不管你是 0 基础想入门 AI 大模型,还是有基础想冲刺大厂、了解行业趋势,这份资料都能满足你!
现在只需按照提示操作,就能免费领取:

👇👇扫码免费领取全部内容👇👇

2026 年想抓住 AI 大模型的风口?别犹豫,这份免费资料就是你的 “起跑线”!

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐