数据仓库工程师:做了五年数仓,我转型做了大模型数据平台
我过去五年最值钱的能力,不是写SQL,不是建维度模型,而是“管数据”。
但这个能力在大模型时代一度让我觉得自己很可笑。因为我发现,公司训练大模型要的数据,根本不能管。它们不是结构化、有主键、有血缘、有分区的“好数据”,而是网页、PDF、图片、代码、语音、对话记录,一堆乱七八糟、格式各异、版权不明的东西。
我越懂数仓,越觉得数仓没用。直到我被派去搭大模型数据平台,才明白一个道理:不是数仓没用,是“管”的对象变了,“管”的方式也得升级。
一、数仓思维,遇到大模型数据时差点崩盘
我做了五年数据仓库。Hive、Spark、Airflow、DBT、Kimball建模,这些构成了我的职业信仰。我相信数据应该分层:ODS、DWD、DWS、ADS。我相信每个表应该有明确的owner、血缘、质量监控。我相信指标口径要对齐,缓慢变化维要处理,拉链表要保留历史。
公司决定训练行业大模型的时候,我一开始满怀信心。管数据?这不就是我的老本行吗?
结果第一次数据需求会就把我打懵了。算法团队要的数据清单包括:
- 公开的网页语料,几百GB,HTML、PDF、Markdown混着;
- 内部产品文档,word、pdf、confluence页面都有;
- 客服对话记录,JSON格式,字段定义不统一;
- 代码仓库,各种语言,有些带注释,有些没有;
- 少量图片和语音数据,用于多模态实验。
我第一反应是:这怎么建表?主键是什么?怎么分区?数据质量怎么衡量?
算法团队看我的眼神,像看一个古董。
“这些数据不需要你数仓那套。你帮我们建立一个平台,能存、能洗、能去重、能版本管理、能按需求输出就行了。”
我回去想了很久。原来我管数据的逻辑,底层假设是“数据是结构化的、目标明确的、用于报表和决策的”。大模型训练数据的底层假设是“数据是原始的、海量的、多模态的、用于学习语言和世界知识的”。两套逻辑,需要两套平台。
二、多模态数据处理:从表到对象
我第一个改造的是数据存储层。数仓时代我习惯用Hive表,按日期分区,按主题分库。大模型数据不适合用表存,更适合用对象存储加元数据库。
我们把原始数据存在S3兼容的对象存储里。文本、图片、音频、代码,都作为对象文件管理。每个对象配一个元数据JSON,记录来源、采集时间、格式、语言、主题、版权状态、处理状态。元数据存在一个MongoDB里,方便灵活查询。
这个设计很像一个数字档案馆,而不是数据库。查询方式不是SQL,而是“找所有英文技术文档、2023年后、关于API设计的、还没清洗的”。我们用Elasticsearch给元数据做索引,支持这种灵活检索。
文本处理我花了最多时间。PDF要解析,有些扫描版还要OCR;HTML要清洗标签和广告;Markdown要统一格式;代码文件要按语言分类、提取注释。我用Apache Tika做通用解析,用PyMuPDF处理PDF,用BeautifulSoup清洗HTML,用tree-sitter解析代码结构。
图片和音频我们起步较晚。图片先做统一格式、缩放、去重(用 perceptual hash),音频做转写、分段、质量评分。这些我以前完全没接触过,但我发现数仓里的“数据血缘”思维同样适用:每个原始文件经过哪些处理步骤、生成哪些派生文件、版本如何变化,都需要追踪。
“你这套不就是ETL吗?”一个老同事说。
“是ETL,但E是爬虫和文件同步,T是解析清洗向量化,L是训练数据集输出。比数仓ETL复杂十倍。”
三、数据版本管理:DVC让数据也能“回滚”
大模型训练数据有一个特别麻烦的地方:数据会变。今天补了一批网页语料,明天去重策略改了,后天发现某个来源有版权风险要整体删除。如果数据没有版本管理,训练出来的模型就不可复现。
我引入了DVC(Data Version Control)。它跟Git配合,代码版本和数据版本一起管。DVC不存大文件本身,而是存哈希指针和远程存储地址。训练脚本提交到Git时,同时记录DVC的.dvc文件,这样任何时间我都能复现那次训练用了哪些数据。
我们给每个数据集打版本标签。比如pretrain-v1.2、sft-zh-v3、dpo-safe-v1。每个版本包含:原始数据版本、处理脚本版本、清洗规则版本、输出文件hash、统计信息。训练实验时,模型效果跟数据版本强绑定,方便做ablation。
数据血缘我们也做了。用Apache Atlas记录数据从原始文件到清洗文件到训练样本的完整链路。哪个原始文件被用到了,哪个处理步骤引入了错误,哪个下游数据集受影响,都能在Atlas里查到。这跟数仓血缘本质上一样,只是节点从表和字段变成了文件和数据集。
有一次,我们发现某个抓取源的数据质量极差,模型训练后幻觉率升高。我通过血缘追踪,找到所有依赖这个源的数据集版本,重新生成了一批清洗后的数据,重训了模型。整个过程可追踪、可复现。那一刻我意识到,数仓的血缘管理思维在大模型数据平台里极其值钱。
四、训练数据Pipeline:从采集到版本管理的完整链路
我把整个流程搭成了一个Pipeline:采集→清洗→去重→质量评分→格式转换→版本管理→输出。
采集层:爬虫、API同步、文件上传、数据库导出。每个来源有独立配置,采集任务用Airflow调度,失败自动重试。
清洗层:格式解析、编码统一、垃圾过滤、敏感信息脱敏。我们用规则加小模型结合。规则处理明显的乱码和广告;小模型识别敏感内容,比如身份证号、内部系统信息。
去重层:文本用MinHash+LSH,代码用AST fingerprint,图片用感知哈希。去重不是一刀切,而是按数据集目标设定阈值。预训练数据去重阈值高,保留多样性;SFT数据去重阈值低,保留重复变体。
质量评分层:我们为每个样本打分。维度包括:语言质量、格式完整性、主题相关性、信息密度、毒性风险。分数低的进入人工复核或丢弃。这一步借鉴了数仓的数据质量监控,但维度完全不同。
格式转换层:预训练数据转成大模型需要的格式,比如JSONL的text字段;SFT数据转成instruction格式;DPO数据转成chosen/rejected对。每种格式有独立模板和校验规则。
版本管理层:DVC打标签,Atlas记录血缘,元数据库记录统计信息。输出给训练平台时,附带数据卡片(data card),说明来源、规模、分布、已知问题。
这个Pipeline跑起来后,算法团队从“到处找数据”变成“在平台上选版本”。我作为数据平台工程师,第一次觉得自己不可替代。
五、数据质量监控:新指标,新逻辑
大模型数据平台的监控指标,跟数仓完全不同。我不再关心“今日订单表记录数是否异常”,而是关心这些:
- 重复率:训练数据里高度相似的样本占比。预训练数据重复率要低于5%,否则模型容易过拟合。
- 分布漂移:新采集数据的主题分布、语言分布、长度分布是否跟历史数据一致。如果突然某类数据暴增,可能是来源异常。
- 标注错误率:人工或自动标注的样本里,错误标注的占比。我们定期抽检,用标注一致性指标监控。
- 毒性/有害内容率:用分类模型扫描数据中的有害内容,超过阈值就拦截。
- 版权风险率:对抓取数据做域名和版权状态标记,高风险来源单独管理。
我把这些指标接进Grafana,每天上班先看数据质量看板。跟数仓监控不同的是,这些指标往往没有“绝对正确”的阈值,需要跟算法团队持续对齐。
比如主题分布,我们监控到某个新抓取的编程问答网站数据里,90%都是Python问题。算法团队说这不一定是坏事,因为Python是我们重点支持的语言。但另一个来源里,70%是低质量广告页面,就必须剔除。质量判断需要业务理解,这正是数仓工程师最擅长的。
六、数仓工程师在大模型数据平台里的不可替代性
做了大半年,我终于敢说:数仓工程师的底层能力,在大模型数据平台里非常有价值。
我们会管数据:不是简单的存储,是治理、血缘、版本、质量、生命周期。我们会建Pipeline:ETL经验让我们能把复杂的数据处理流程模块化、可调度、可监控。我们会跟业务对齐:口径定义、质量评估、数据卡片,这些都需要沟通和抽象能力。
但我们也必须升级。大模型数据平台需要理解多模态、非结构化、数据版本控制、数据卡片、模型训练流程。技术栈从Hive/Spark扩展到DVC、Atlas、MongoDB、对象存储、向量检索、数据质量分类模型。
给想转型的数仓工程师几点建议:
第一,接受“数据不一定是结构化的”。大模型数据里有大量文本、图片、音频、代码。先从文本开始,再逐步扩展到其他模态。
第二,学习DVC。数据版本控制是大模型可复现训练的基础。会用DVC管理数据集版本,是数据平台工程师的必修课。
第三,理解训练数据Pipeline。不是简单的ETL,是采集→清洗→去重→质量评分→格式转换→版本管理。每个环节都有独特的挑战。
第四,建立数据血缘思维。用Atlas或类似工具,追踪数据从原始文件到训练样本的完整链路。模型出了问题,能快速定位到数据。
第五,跟算法团队绑定。数据平台是为训练服务的,理解训练目标、数据对模型效果的影响,才能设计出有用的平台。
我现在名片上是“大模型数据平台工程师”。偶尔还会想念数仓里那种整齐的星型模型,但更多时候,我觉得现在的工作更有生命力。因为我在管理的不是一张张表,而是一个能让模型变聪明的数据生态系统。
这个系统越乱,越需要有人把它管明白。
而我,恰好就是干这个的。
想入门 AI 大模型却找不到清晰方向?备考大厂 AI 岗还在四处搜集零散资料?别再浪费时间啦!2026 年 AI 大模型全套学习资料已整理完毕,从学习路线到面试真题,从工具教程到行业报告,一站式覆盖你的所有需求,现在全部免费分享!
👇👇扫码免费领取全部内容👇👇

一、学习必备:100+本大模型电子书+26 份行业报告 + 600+ 套技术PPT,帮你看透 AI 趋势
想了解大模型的行业动态、商业落地案例?大模型电子书?这份资料帮你站在 “行业高度” 学 AI:
1. 100+本大模型方向电子书

2. 26 份行业研究报告:覆盖多领域实践与趋势
报告包含阿里、DeepSeek 等权威机构发布的核心内容,涵盖:
- 职业趋势:《AI + 职业趋势报告》《中国 AI 人才粮仓模型解析》;
- 商业落地:《生成式 AI 商业落地白皮书》《AI Agent 应用落地技术白皮书》;
- 领域细分:《AGI 在金融领域的应用报告》《AI GC 实践案例集》;
- 行业监测:《2024 年中国大模型季度监测报告》《2025 年中国技术市场发展趋势》。
3. 600+套技术大会 PPT:听行业大咖讲实战
PPT 整理自 2024-2025 年热门技术大会,包含百度、腾讯、字节等企业的一线实践:

- 安全方向:《端侧大模型的安全建设》《大模型驱动安全升级(腾讯代码安全实践)》;
- 产品与创新:《大模型产品如何创新与创收》《AI 时代的新范式:构建 AI 产品》;
- 多模态与 Agent:《Step-Video 开源模型(视频生成进展)》《Agentic RAG 的现在与未来》;
- 工程落地:《从原型到生产:AgentOps 加速字节 AI 应用落地》《智能代码助手 CodeFuse 的架构设计》。
二、求职必看:大厂 AI 岗面试 “弹药库”,300 + 真题 + 107 道面经直接抱走
想冲字节、腾讯、阿里、蔚来等大厂 AI 岗?这份面试资料帮你提前 “押题”,拒绝临场慌!

1. 107 道大厂面经:覆盖 Prompt、RAG、大模型应用工程师等热门岗位
面经整理自 2021-2025 年真实面试场景,包含 TPlink、字节、腾讯、蔚来、虾皮、中兴、科大讯飞、京东等企业的高频考题,每道题都附带思路解析:

2. 102 道 AI 大模型真题:直击大模型核心考点
针对大模型专属考题,从概念到实践全面覆盖,帮你理清底层逻辑:

3. 97 道 LLMs 真题:聚焦大型语言模型高频问题
专门拆解 LLMs 的核心痛点与解决方案,比如让很多人头疼的 “复读机问题”:

三、路线必明: AI 大模型学习路线图,1 张图理清核心内容
刚接触 AI 大模型,不知道该从哪学起?这份「AI大模型 学习路线图」直接帮你划重点,不用再盲目摸索!

路线图涵盖 5 大核心板块,从基础到进阶层层递进:一步步带你从入门到进阶,从理论到实战。

L1阶段:启航篇丨极速破界AI新时代
L1阶段:了解大模型的基础知识,以及大模型在各个行业的应用和分析,学习理解大模型的核心原理、关键技术以及大模型应用场景。

L2阶段:攻坚篇丨RAG开发实战工坊
L2阶段:AI大模型RAG应用开发工程,主要学习RAG检索增强生成:包括Naive RAG、Advanced-RAG以及RAG性能评估,还有GraphRAG在内的多个RAG热门项目的分析。

L3阶段:跃迁篇丨Agent智能体架构设计
L3阶段:大模型Agent应用架构进阶实现,主要学习LangChain、 LIamaIndex框架,也会学习到AutoGPT、 MetaGPT等多Agent系统,打造Agent智能体。

L4阶段:精进篇丨模型微调与私有化部署
L4阶段:大模型的微调和私有化部署,更加深入的探讨Transformer架构,学习大模型的微调技术,利用DeepSpeed、Lamam Factory等工具快速进行模型微调,并通过Ollama、vLLM等推理部署框架,实现模型的快速部署。

L5阶段:专题集丨特训篇 【录播课】

四、资料领取:全套内容免费抱走,学 AI 不用再找第二份
不管你是 0 基础想入门 AI 大模型,还是有基础想冲刺大厂、了解行业趋势,这份资料都能满足你!
现在只需按照提示操作,就能免费领取:
👇👇扫码免费领取全部内容👇👇

2026 年想抓住 AI 大模型的风口?别犹豫,这份免费资料就是你的 “起跑线”!
更多推荐




所有评论(0)