核心定位概览

三者是企业数据架构中定位不同、互为补充的三层数据系统,而非替代关系:

  • 数据仓库(Data Warehouse):面向业务决策的结构化分析系统,核心服务BI报表与业务分析。
  • 数据湖(Data Lake):面向全量数据的原始存储池,支持多类型数据的低成本存储与探索式分析。
  • 特征存储(Feature Store):面向机器学习的专用数据系统,标准化管理ML特征的全生命周期,解决训练-服务一致性问题。

多维度详细对比

对比维度 数据仓库 (Data Warehouse) 数据湖 (Data Lake) 特征存储 (Feature Store)
核心目标 支撑业务决策、BI报表、可视化分析 全量数据统一存储、探索性分析、ML原始数据供给 机器学习特征的复用、一致性管理与高效服务
核心用户 业务分析师、数据分析师、运营人员 数据科学家、数据工程师、算法工程师 算法工程师、ML工程师、MLOps团队
数据类型 仅结构化、表格化数据(多为维度建模) 全类型:结构化、半结构化(JSON/日志)、非结构化(图片/音视频) 结构化特征值(标量、向量、序列),具备明确业务语义
Schema 策略 Schema-on-write:写入前定义schema,数据严格校验 Schema-on-read:写入不约束结构,读取时按需解析 特征Schema预定义,支持版本管理与血缘追踪
数据形态 清洗、聚合、标准化后的加工数据 原始、细粒度、未加工的原生数据 经特征工程处理、可直接输入模型的成品特征
核心能力 高性能OLAP查询、事务一致性、数据治理 低成本海量存储、开放格式、计算存储分离 训练-服务一致性、双存储架构、点时间回溯、特征血缘
访问方式 SQL查询、BI工具直连 SQL/批处理引擎、数据科学工具 SDK调用、在线API、批量特征导出
延迟特性 秒级~分钟级查询延迟,T+1/小时级更新 高延迟批处理,适配离线场景 离线:高吞吐批量训练;在线:毫秒级推理调用
典型产品 Snowflake、BigQuery、Redshift、Hive AWS S3、ADLS Gen2、Iceberg/Delta/Hudi Feast、Tecton、SageMaker Feature Store
成本特性 存储+计算耦合,大规模下成本较高 存储成本极低,计算按需付费 基于现有湖仓搭建,额外增加ML专用服务成本

三者的协作关系

在现代企业数据架构中,三者形成上下游流转的互补体系,而非互斥:

  1. 数据湖是底层底座:承接所有业务系统、日志、非结构化的原始数据,作为企业统一数据源,为上层所有场景提供原始数据供给。
  2. 数据仓库是业务分析层:从数据湖抽取结构化数据,经ETL/ELT清洗建模后,面向业务侧提供标准化的分析与报表能力。
  3. 特征存储是ML专用层:通常不独立存储原始数据,而是从数据湖/数仓中抽取数据完成特征工程,以离线+在线双模式分别供给模型训练与推理;同时将特征元数据回流到数据治理体系中。

简单总结:数据湖存“所有原始数据”,数仓存“业务能用的分析数据”,特征存储存“模型能用的特征数据”。

选型参考

  • 仅做业务报表、经营分析:优先数据仓库
  • 需要存储全量多类型数据、开展数据探索与算法研发:优先数据湖(或湖仓一体架构)
  • 机器学习模型规模化落地、存在特征复用困难、训练-服务偏差等问题:补充搭建特征存储
Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐