
DataHub 是 LinkedIn 2019 年开源的企业级元数据平台,2026 年升级为 “AI Stack 的 Context Platform”(Context Platform for your Data and AI Stack)。11 年间凭借 3 层元数据存储 (MySQL + Elasticsearch + Kafka)+ 数据血缘自动追踪 + 80+ 数据源 ingestion + AI Agent 上下文层,成为数据目录与治理领域的龙头。本文带你深入 DataHub 的核心能力、架构、AI 方向,以及它跟 OpenMetadata / Unity Catalog / Apache Atlas / Amundsen 的对比选型。
写在前面
“ 我有什么数据 / 数据从哪来 / 谁在用 / 数据准不准 ”——这 4 个问题是任何数据团队的 灵魂拷问。
老的做法是 Excel 表格 + Confluence 文档——但数据规模一大就崩。
新一代是 元数据管理平台(Metadata Platform / Data Catalog)——但选型比 OLAP 更乱:
- 开源老牌:Apache Atlas(2015,Hadoop 时代)
- 开源新锐:DataHub(LinkedIn 2019)/ OpenMetadata(2021)
- 闭源商业:Alation / Collibra / Informatica / Atlan / Unity Catalog(Databricks)
- 云厂商自带:AWS Glue Catalog / GCP Data Catalog / Azure Purview
DataHub 是这个赛道的 事实标准之一——LinkedIn 自家用了 7 年、Uber / Lyft / Airbnb / Netflix 都在用、Acryl Data 提供商业版。
2026 年 DataHub 又升级了定位:从 ”Metadata Platform” → “Context Platform for AI Stack”——把元数据变成 AI Agent 的上下文层,跟 Airbyte Agents (326) 是同一波方向。
一、它解决什么问题
一句话 :DataHub 让你在一个平台 统一管理所有数据的元数据 + 血缘 + 所有权 + 质量 + AI Agent 上下文,让数据团队和 AI Agent 都能 ” 找数据 / 信任数据 / 理解数据 ”。
| 场景 | 例子 | DataHub 表现 |
|---|---|---|
| 数据发现 | 分析师找 ” 上个月 GMV” 在哪个表里 | 全文搜索 + 标签 + 业务术语 |
| 数据血缘 | 改了一列影响下游哪些报表? | 自动追踪 column-level lineage |
| 数据所有权 | 谁负责这张表?找谁批准变更? | 所有权 / 域 / 团队管理 |
| 数据质量 | 这张表准吗?何时坏过? | 数据可观测性 + Great Expectations 集成 |
| 数据治理 | GDPR / CCPA 合规:哪些字段含 PII? | Glossary + Classification + 标记 |
| 变更影响 | 改了 dbt 模型影响哪些下游? | dbt ingestion + 自动血缘 |
| AI Agent 上下文 | LLM 查 ” 上个月销售数据 ” 找到正确表 | Context Graph + Agent Context Platform |
基本信息:
| 维度 | 数据 |
|---|---|
| GitHub | datahub-project/datahub |
| Stars | 12,534(比池子里标的 10K 多 25%) |
| Forks | 3,663 |
| Open Issues | 1,226(健康) |
| License | Apache-2.0 ✅(无任何商用风险) |
| 首次 commit | 2015-11-18(前身 WhereHows 已 11 年,DataHub Project 重构于 2020) |
| 最近 commit | 2026-08-16(今天还在推代码) |
| 仓库大小 | 543 MB |
| 主语言 | Python 66% + Java 25% + TypeScript |
| 最新版本 | v1.0+(2024 起 v1.0 稳定,持续滚动 v1.x 系列) |
| 项目状态 | LF Data 治理项目 + Acryl Data 商业公司运营 |
| Commits | 15,445 commits(极活跃) |
二、核心能力全景:5 大模块
DataHub 是 模块化单体架构——一个 GitHub 仓库包含所有模块,但每个模块可独立演进。
1. Metadata Ingestion(数据采集)
80+ 内置 connector,覆盖几乎所有主流数据源:
| 类别 | connector |
|---|---|
| 数仓 | Snowflake / BigQuery / Redshift / Databricks / Hive / Trino / ClickHouse / Doris / Druid |
| 数据库 | MySQL / PostgreSQL / Oracle / SQL Server / MongoDB |
| BI 工具 | Tableau / Power BI / Looker / Superset / Metabase / Mode |
| 数据转换 | dbt / Great Expectations / Soda Core |
| 编排 | Airflow / Dagster / Prefect |
| ETL | Airbyte / Fivetran / Stitch |
| 消息队列 | Kafka / Pulsar |
| Lakehouse | Iceberg / Delta Lake / Hudi |
| 其他 | GitHub / Slack / Notion / Linear / Looker / Mode |
跟 Airbyte (326) 完美互补:Airbyte 拉数据,DataHub 采元数据
Ingestion 方式:
–
Pull-based:Python CLI(datahub ingest -c recipe.yml)
–
Push-based:Kafka topic(MetadataChangeEvent)
–
Webhook:实时接收变更
–
REST API:手动触发
2. Metadata Storage(元数据存储)⭐ 3 层架构
┌──────────────────────────────────────┐
│ Metadata Storage │
│ │
│ ┌─────────┐ ┌─────────┐ ┌────────┐ │
│ │ MySQL │ │ ES │ │ Kafka │ │
│ │ (关系) │ │(搜索) │ │(流式) │ │
│ └─────────┘ └─────────┘ └────────┘ │
│ │ │ │ │
└─────┼────────────┼────────────┼──────┘
↓ ↓ ↓
元数据定义 全文搜索索引 变更事件流
| 层 | 存储 | 用途 |
|---|---|---|
| MySQL / PostgreSQL | 关系型 | 元数据定义、所有权、标签、版本 |
| Elasticsearch | 搜索引擎 | 全文搜索、聚合查询、推荐 |
| Kafka | 消息队列 | 变更事件流(MetadataChangeEvent / MCE) |
关键设计 : 变更通过 Kafka 流式传播——所有元数据修改走 Kafka,下游所有模块(搜索、血缘、可观测性)实时消费。
3. Metadata Serving(元数据服务)
- GraphQL API(
/api/graphql)—— 前端主要接口 - REST API(
/openapi/)—— 自动化集成 - Java 服务(datahub-graphql-core / metadata-dao-impl)—— 高性能
- 支持 SDK:Python / Java / Go
4. Frontend(前端)
- React + TypeScript(datahub-web-react)
- 自服务数据门户:搜索 / 浏览 / 标签 / 血缘 / 团队
- 业务术语表(Glossary)—— 业务 + 技术团队对齐
- 数据图谱(Lineage Graph)—— 可视化上下游依赖
5. Actions Framework(变更响应)
- Webhook 触发:元数据变更时调用外部 API
- Slack / Teams 通知:表 owner 自动收到通知
- 数据契约(Data Contracts):Schema 变更时强制检查
- 可观测性集成:跟 Great Expectations / Soda Core / Monte Carlo 对接
三、差异化能力:图模型 + 实时血缘 + AI Context Platform
1. 图模型元数据(Graph-based Metadata Model)
DataHub 用 通用图模型 描述元数据,核心实体:
- Dataset(数据集 / 表)
- DataJob(数据处理任务 / dbt 模型 / Airflow DAG)
- DataFlow(数据流 / ETL pipeline)
- Dashboard(仪表盘 / Chart)
- MLModel(机器学习模型)
- GlossaryTerm(业务术语)
- Tag(标签)
- Owner(所有者 / 团队)
实体之间的关系:ownership / lineage / contains / produced by / input of …
对比 OpenMetadata 用 JSON Schema,Apache Atlas 用 Type System——DataHub 的图模型 最灵活。
2. Column-Level Lineage(列级血缘)⭐ 核心
DataHub 自动追踪 列级别 的血缘关系——精确到 ” 哪一列从哪里来 ”:
[Source Table A] [Source Table B]
column: user_id column: country
↓ ↓
[Transform SQL: JOIN] → [Intermediate Table C]
column: user_country
↓
[Dashboard Chart X]
uses: user_country
血缘来源:
–
SQL 解析(datahub-sql-parser)—— 解析 INSERT / CREATE TABLE / CREATE VIEW
–
dbt manifest.json—— dbt 模型血缘
–
Airflow DAG—— 任务血缘
–
OpenLineage(2026 新)—— 跨工具血缘标准
3. Real-time Updates(实时更新)
所有元数据变更走 Kafka——从 ingestion 到 serving 全链路实时:
- 改了一个标签 → 1 秒内出现在前端
- 新建了一个表 → 1 秒内出现在搜索结果
- 血缘变更 → 1 秒内更新 graph
对比 Apache Atlas(批量更新,延迟 5-15 分钟)—— DataHub 实时性更强
4. Context Platform for AI Stack(2026 新定位)⭐ 重磅
DataHub 2026 年从 ”Metadata Platform” 升级为 “Context Platform”:
核心思想:元数据不只是给 ” 人 ” 看的,更是给 AI Agent 用的——
你的 LLM / Agent 在查 ” 上个月销售数据 ” 时,DataHub 提供:
1.
正确的表(不是模糊匹配的 SQL)
2.
列含义(glossary / 业务术语)
3.
数据质量分(哪个表最新最准)
4.
所有权(错了找谁)
5.
血缘(改了影响哪些下游)
6.
PII 标记(合规检查)
集成方式:
–
MCP Server(datahub-mcp)—— AI Agent 通过 Model Context Protocol 查询元数据
–
Agent Skills(.claude/ .agent-skills/ .cursor/rules/)—— AI Coding 工具自动加载 DataHub 上下文
–
AI 集成:原生支持 Claude / Cursor / OpenAI Agents
对应 GitHub Topics:
–
agent-platform ⭐
–
context-management ⭐
–
data-observability ⭐
DataHub 是 AI Stack 的 Context Layer——跟 Airbyte Agents (326)(AI Stack 的 Data Layer)配合,形成 AI Stack 的完整叙事
5. 80+ 数据源 ingestion(生态广度)
对比 OpenMetadata(50+)和 Apache Atlas(30+),DataHub 的 connector 数最多(80+)—— 因为 LinkedIn 自家要用,生态是 生产驱动 的。
四、生态系统:LinkedIn 出品 + Acryl Data 商业 + LF Data 治理
1. 出身体系
2015 - LinkedIn 内部 WhereHows(DM/ETL 血缘 + 数据目录)↓
2019 - DataHub 开源(v0.x,吸收 WhereHows 经验)↓
2020 - DataHub Project 重构(从 LinkedIn 仓库迁出到 datahub-project 组织)↓
2021 - 加入 **LF Data 治理项目 **(Linux Foundation 旗下)↓
2023 - Acryl Data 成立(DataHub 商业化公司)↓
2024 - DataHub v1.0 发布(API 稳定)↓
2025-2026 - 升级为 "Context Platform for AI Stack"
2. 商业化:Acryl Data
| 产品 | 模式 |
|---|---|
| Acryl Observe | SaaS 元数据平台(基于 DataHub) |
| Acryl Cloud | 托管 DataHub 服务 |
| Enterprise Support | 商业 SLA + 培训 |
Acryl Data 创始人:Maggie Hu(虎研)+ Shirshanka Das(DataHub 创始人)—— LinkedIn 出身
3. 用户案例(生产级)
| 公司 | 规模 | 用途 |
|---|---|---|
| 自家 7+ 年 | 7000+ 数据集 / 10000+ 字段 / 业务核心 | |
| Uber | 内部 | 数据发现 + 血缘 |
| Lyft | 内部 | 数据目录 |
| Airbnb | 内部 | 治理 + 质量 |
| Netflix | 内部 | 元数据 + 大数据生态 |
| Notion | 内部 | 数据发现 |
| Wolt | 内部 | 数据目录 |
4. 工具链集成
| 工具 | 集成方式 |
|---|---|
| dbt (290) | dbt ingestion recipe(直接对接) |
| Airflow (306) | Airflow lineage + DAG ingestion |
| Great Expectations (262) | GE 校验结果 ingestion |
| Soda Core (276) | Soda 校验结果 ingestion |
| Airbyte (326) | Airbyte ingestion recipe |
| dbt-core (290) | manifest.json 解析 |
| Snowflake / BigQuery / Redshift | 原生 ingestion connector |
| Tableau / Power BI / Looker / Superset (270) | BI ingestion |
| MLflow | MLModel ingestion |
五、对比 OpenMetadata / Unity Catalog / Apache Atlas / Amundsen
| 维度 | DataHub | OpenMetadata | Unity Catalog | Apache Atlas | Amundsen |
|---|---|---|---|---|---|
| Stars | 12,534 | ~5K | 闭源 | ~1.9K | ~4.5K |
| 协议 | Apache-2.0 ✅ | Apache-2.0 ✅ | 闭源(Databricks) | Apache-2.0 ✅ | Apache-2.0 ✅ |
| 出身 | 开源社区 | Databricks | Apache / Hadoop | Lyft | |
| 数据存储 | MySQL + ES + Kafka 三层 | MySQL + ES + OpenSearch | Databricks 平台 | HBase + Solr | Neo4j + ES + Druid |
| Connector | 80+ ⭐ | ~50 | 主要 Databricks 生态 | ~30 | ~25 |
| 血缘粒度 | ✅ column-level | ✅ column-level | ✅ column-level | ✅ column-level | ⚠️ table-level |
| 实时更新 | ✅ Kafka 流式 | ⚠️ 准实时 | ✅ Databricks 实时 | ❌ 批量 | ❌ 批量 |
| AI Context | ✅ 2026 新定位 | ⚠️ 早期 | ⚠️ Unity AI 集成 | ❌ | ❌ |
| MCP 集成 | ✅ datahub-mcp | ❌ | ❌ | ❌ | ❌ |
| 商业支持 | ✅ Acryl Data | ✅ Collate | ✅ Databricks | ✅ AWS / Hortonworks | ❌ 社区 |
| 学习曲线 | ⚠️ 中(部署复杂) | ✅ 低 | ✅ 低(Databricks 用户) | ⚠️ 中 | ⚠️ 中 |
| 部署 | Docker / K8s / Helm | Docker / K8s | SaaS | Hadoop 生态 | Docker / K8s |
| 活跃度 | 15,445 commits ⭐ | ~7K commits | 闭源 | ~5K commits | ~3K commits |
| LF 治理 | ✅ LF Data | ❌ 独立 | ❌ 商业 | ✅ Apache | ❌ 独立 |
结论怎么选:
| 你的场景 | 选谁 |
|---|---|
| 生产级元数据平台 + 80+ connector + 实时血缘 + AI 上下文 | DataHub ✅ |
| 快速上手 + 简化部署 + 现代 UI | OpenMetadata |
| Databricks 生态 + Unity Catalog 集成 | Unity Catalog |
| Hadoop 生态 + HBase + Solr + Ranger 集成 | Apache Atlas |
| 图数据库血缘 + Lyft 风格 | Amundsen |
| AI Agent 上下文层(MCP / Agent Skills) | DataHub ✅ |
| 要商业支持 / SaaS / 培训 | Acryl Data / Collate / Databricks |
对比已调研的飞熊 8 月 BI 栈:
| 已调研项目 | 跟 DataHub 的关系 |
|---|---|
| dbt-core (290) | 完美集成——DataHub 直接 ingestion dbt manifest.json,自动追踪 dbt 模型血缘 |
| Airflow (306) | 完美集成——DataHub ingestion Airflow DAG,自动追踪任务血缘 |
| Great Expectations (262) | 完美集成——DataHub ingestion GE 校验结果,数据质量分入元数据 |
| Soda Core (276) | 完美集成——DataHub ingestion Soda 校验结果 |
| Airbyte (326) | 完美集成——DataHub ingestion Airbyte pipeline,血缘自动追踪 |
| Apache Superset (270) / Metabase (274) / Lightdash (272) | 完美集成——DataHub ingestion BI 工具的血缘和元数据 |
| ClickHouse (322) | 完美集成——DataHub ingestion ClickHouse 的表和 schema |
| Trino (328) | 完美集成——DataHub ingestion Trino 的 catalog |
| Apache Iceberg (296 提过) | 完美集成——DataHub ingestion Iceberg 的表和 partition |
| WrenAI (316) / DB-GPT (318) / Evidence (314) | 完美集成——DataHub 给这些 GenBI 工具提供 Context Layer |
DataHub 在飞熊 BI 栈的位置:
数据源(API/DB/Files)↓
Airbyte (326) ── ETL ──► 数据湖(Iceberg / Delta Lake / Hive)↓
Trino (328) 联邦查询
↓
dbt (290) ── 转换 ──► 数仓
↓
ClickHouse (322) ── 加速热查询
↓
Superset (270) / Metabase (274) / Lightdash (272) / Evidence (314)
↓
ECharts (324) [渲染]
↓
**DataHub(贯穿全栈)** ◄── dbt / Airflow / GE / Soda ingestion
↓
**AI Agent (Context Layer)** ── 给 LLM 喂上下文
DataHub 是 ” 贯穿全栈的元数据 + 上下文层 ”——它不出现在数据流水线里,但 所有数据的元数据都流过它 **。
六、实战:3 步跑通 DataHub
Step 1:本地安装(Docker Compose)
# 1. 克隆仓库
git clone https://github.com/datahub-project/datahub.git
cd datahub
# 2. 启动(首次启动会下载镜像,约 10-15 分钟)./docker/quickstart.sh
# 3. 访问 UI
open http://localhost:9002
# 默认账号
# username: datahub
# password: datahub
Step 2:Ingestion 配置(Snowflake + dbt + GE 三源)
# snowflake_ingestion.yml
source:
type: snowflake
config:
account_id: abc12345.us-east-1
warehouse: ANALYTICS_WH
role: DATABOT_DEV
username: datahub_user
password: ${SNOWFLAKE_PASSWORD}
sink:
type: datahub-rest
config:
server: http://localhost:8080
token: ${DATAHUB_TOKEN}
# 运行
datahub ingest -c snowflake_ingestion.yml
# dbt_ingestion.yml
source:
type: dbt
config:
manifest_path: ./dbt_project/target/manifest.json
catalog_path: ./dbt_project/target/catalog.json
target_platform: snowflake
sink:
type: datahub-rest
config:
server: http://localhost:8080
# great_expectations_ingestion.yml
source:
type: great-expectations
config:
checkpoint_results_file_path: ./ge/checkpoints/results.json
sink:
type: datahub-rest
config:
server: http://localhost:8080
Step 3:AI Agent 集成(datahub-mcp)
# 安装
# pip install datahub-mcp
# 启动 MCP Server
datahub mcp serve --server http://localhost:8080 --token ${DATAHUB_TOKEN}
# 在 Claude / Cursor 里配置 MCP:# {
# "mcpServers": {
# "datahub": {
# "command": "datahub",
# "args": ["mcp", "serve", "--server", "http://localhost:8080"]
# }
# }
# }
# AI Agent 现在可以问:# " 我们公司有哪些表含 PII 数据?"
# → DataHub 查 Glossary + Tag 自动返回 PII 表列表
#
# " 上个月 GMV 数据用哪个表?"
# → DataHub 查业务术语 + 血缘 + 质量分,返回最佳匹配
#
# " 改了 dbt 模型 X 影响哪些下游?"
# → DataHub 查 column-level 血缘,返回下游所有 Dashboard / 报表
七、风险与坑
1. 部署复杂度高
DataHub 是Java + Python + ES + Kafka + MySQL 的复杂单体——初次部署需要 10-15 分钟下载镜像 + 调通网络。
缓解:用 Acryl Cloud(托管)/ 单节点 quickstart 模式
2. 543 MB 巨型仓库
源码接近 1 GB(包含 metadata-models / ingestion / frontend / actions 所有模块),clone 慢、CI 慢。
3. 实时性依赖 Kafka 集群
流式更新需要 Kafka 集群——单机 Kafka 不够稳定,生产需要 Kafka 集群。
4. 1,226 open issues(健康但量大)
主要是 feature request(新的 connector / UI 改进),不是 P0 阻塞。
5. dbt ingestion 性能
大型 dbt 项目(>1000 模型)ingestion 可能耗时 10-30 分钟。
缓解:增量 ingestion(只处理变更)
6. UI 响应速度
大数据量(>50K datasets)下 UI 可能卡顿。
缓解:分域管理 / 虚拟化(virtual datasets)
7. 商业版 vs 开源版功能差异
Acryl Data 商业版有一些高级功能(AI 推荐 / 自动分类)——开源版正在补齐中。
8. 中文文档相对薄弱
虽然项目是 LinkedIn 出品 + 国际项目,但中文教程和案例不如 Apache Doris / ECharts 丰富。
缓解:看官方英文 docs + Slack 社区 + GitHub Discussions
八、总结
DataHub 不是 ” 又一个元数据目录 ”——它是 “AI 时代的 Context Platform”——把元数据从 ” 人用的工具 ” 升级为 “AI Agent 用的上下文层 ”。
3 个最值得用的理由:
- 生产级元数据平台 :LinkedIn 7 年自家使用 + Uber / Lyft / Airbnb / Netflix 都在用 + 15,445 commits + 80+ connector—— 经得起生产检验
- column-level 血缘 + 实时更新:3 层存储(MySQL + ES + Kafka)+ Kafka 流式更新——比 Apache Atlas(批量)实时性更强
- AI Context Platform(2026 新定位):MCP Server + Agent Skills + AI Agent 上下文——跟 Airbyte Agents(326) 是同一波 AI Stack 方向
1 句建议:
如果你的数据团队超过 10 人 + 有 100+ 数据集 + 想要 column-level 血缘 + 想给 AI Agent 提供数据上下文——用 DataHub(Apache 2.0 ✅ / 12.5K stars / LF Data 治理 / Acryl 商业支持)。
如果你已经在 Databricks 生态 + 想要 Unity Catalog 集成——看 Unity Catalog。
如果你要 Hadoop 生态 + Atlas + Ranger 集成——看 Apache Atlas。
如果你要快速上手 + 简化部署——看 OpenMetadata。
在飞熊 BI 栈里,DataHub 是 贯穿全栈的元数据 + 上下文层 ——它不直接出现在数据流水线里,但 所有数据的元数据都流过它,给数据团队和 AI Agent 提供 ” 找数据 / 信任数据 / 理解数据 ” 的统一入口。
参考
- DataHub GitHub · 12.5K stars / Apache-2.0 / Python + Java
- DataHub 官方文档 · 完整 setup + 架构
- DataHub 官网 · 商业公司 Acryl Data
- Acryl Data · DataHub 商业化公司
- DataHub Project History · LinkedIn WhereHows → DataHub 演化史
- DataHub Slack · 官方社区
- LF Data · Linux Foundation Data 治理项目
- OpenMetadata 对比 · DataHub vs OpenMetadata 深度分析
- Column-Level Lineage · DataHub 血缘引擎
- datahub-mcp · AI Agent MCP 集成
- Unity Catalog · Databricks 元数据
- Apache Atlas · Hadoop 时代元数据
- Amundsen · Lyft 元数据