DataHub 调研:12K stars 的数据目录与治理龙头,LinkedIn 出品 + AI 时代 Context Platform,从元数据到 AI Agent 上下文一站式

30次阅读
DataHub 调研:12K stars 的数据目录与治理龙头,LinkedIn 出品 + AI 时代 Context Platform,从元数据到 AI Agent 上下文一站式

DataHub 是 LinkedIn 2019 年开源的企业级元数据平台,2026 年升级为 “AI Stack 的 Context Platform”(Context Platform for your Data and AI Stack)。11 年间凭借 3 层元数据存储 (MySQL + Elasticsearch + Kafka)+ 数据血缘自动追踪 + 80+ 数据源 ingestion + AI Agent 上下文层,成为数据目录与治理领域的龙头。本文带你深入 DataHub 的核心能力、架构、AI 方向,以及它跟 OpenMetadata / Unity Catalog / Apache Atlas / Amundsen 的对比选型。

写在前面

“ 我有什么数据 / 数据从哪来 / 谁在用 / 数据准不准 ”——这 4 个问题是任何数据团队的 灵魂拷问

老的做法是 Excel 表格 + Confluence 文档——但数据规模一大就崩。

新一代是 元数据管理平台(Metadata Platform / Data Catalog)——但选型比 OLAP 更乱:

  • 开源老牌:Apache Atlas(2015,Hadoop 时代)
  • 开源新锐:DataHub(LinkedIn 2019)/ OpenMetadata(2021)
  • 闭源商业:Alation / Collibra / Informatica / Atlan / Unity Catalog(Databricks)
  • 云厂商自带:AWS Glue Catalog / GCP Data Catalog / Azure Purview

DataHub 是这个赛道的 事实标准之一——LinkedIn 自家用了 7 年Uber / Lyft / Airbnb / Netflix 都在用Acryl Data 提供商业版

2026 年 DataHub 又升级了定位:从 ”Metadata Platform” → “Context Platform for AI Stack”——把元数据变成 AI Agent 的上下文层,跟 Airbyte Agents (326) 是同一波方向。

一、它解决什么问题

一句话 :DataHub 让你在一个平台 统一管理所有数据的元数据 + 血缘 + 所有权 + 质量 + AI Agent 上下文,让数据团队和 AI Agent 都能 ” 找数据 / 信任数据 / 理解数据 ”。

场景 例子 DataHub 表现
数据发现 分析师找 ” 上个月 GMV” 在哪个表里 全文搜索 + 标签 + 业务术语
数据血缘 改了一列影响下游哪些报表? 自动追踪 column-level lineage
数据所有权 谁负责这张表?找谁批准变更? 所有权 / 域 / 团队管理
数据质量 这张表准吗?何时坏过? 数据可观测性 + Great Expectations 集成
数据治理 GDPR / CCPA 合规:哪些字段含 PII? Glossary + Classification + 标记
变更影响 改了 dbt 模型影响哪些下游? dbt ingestion + 自动血缘
AI Agent 上下文 LLM 查 ” 上个月销售数据 ” 找到正确表 Context Graph + Agent Context Platform

基本信息

维度 数据
GitHub datahub-project/datahub
Stars 12,534(比池子里标的 10K 多 25%)
Forks 3,663
Open Issues 1,226(健康)
License Apache-2.0 ✅(无任何商用风险
首次 commit 2015-11-18(前身 WhereHows 已 11 年,DataHub Project 重构于 2020)
最近 commit 2026-08-16(今天还在推代码
仓库大小 543 MB
主语言 Python 66% + Java 25% + TypeScript
最新版本 v1.0+(2024 起 v1.0 稳定,持续滚动 v1.x 系列)
项目状态 LF Data 治理项目 + Acryl Data 商业公司运营
Commits 15,445 commits(极活跃)

二、核心能力全景:5 大模块

DataHub 是 模块化单体架构——一个 GitHub 仓库包含所有模块,但每个模块可独立演进。

1. Metadata Ingestion(数据采集)

80+ 内置 connector,覆盖几乎所有主流数据源:

类别 connector
数仓 Snowflake / BigQuery / Redshift / Databricks / Hive / Trino / ClickHouse / Doris / Druid
数据库 MySQL / PostgreSQL / Oracle / SQL Server / MongoDB
BI 工具 Tableau / Power BI / Looker / Superset / Metabase / Mode
数据转换 dbt / Great Expectations / Soda Core
编排 Airflow / Dagster / Prefect
ETL Airbyte / Fivetran / Stitch
消息队列 Kafka / Pulsar
Lakehouse Iceberg / Delta Lake / Hudi
其他 GitHub / Slack / Notion / Linear / Looker / Mode

Airbyte (326) 完美互补:Airbyte 拉数据,DataHub 采元数据

Ingestion 方式

Pull-based:Python CLI(datahub ingest -c recipe.yml

Push-based:Kafka topic(MetadataChangeEvent

Webhook:实时接收变更

REST API:手动触发

2. Metadata Storage(元数据存储)⭐ 3 层架构

┌──────────────────────────────────────┐
│         Metadata Storage             │
│                                      │
│  ┌─────────┐ ┌─────────┐ ┌────────┐  │
│  │  MySQL  │ │   ES    │ │  Kafka │  │
│  │ (关系)  │ │(搜索)   │ │(流式)  │  │
│  └─────────┘ └─────────┘ └────────┘  │
│     │            │            │      │
└─────┼────────────┼────────────┼──────┘
      ↓            ↓            ↓
   元数据定义   全文搜索索引   变更事件流
存储 用途
MySQL / PostgreSQL 关系型 元数据定义、所有权、标签、版本
Elasticsearch 搜索引擎 全文搜索、聚合查询、推荐
Kafka 消息队列 变更事件流(MetadataChangeEvent / MCE)

关键设计 变更通过 Kafka 流式传播——所有元数据修改走 Kafka,下游所有模块(搜索、血缘、可观测性)实时消费。

3. Metadata Serving(元数据服务)

  • GraphQL API/api/graphql)—— 前端主要接口
  • REST API/openapi/)—— 自动化集成
  • Java 服务(datahub-graphql-core / metadata-dao-impl)—— 高性能
  • 支持 SDK:Python / Java / Go

4. Frontend(前端)

  • React + TypeScript(datahub-web-react)
  • 自服务数据门户:搜索 / 浏览 / 标签 / 血缘 / 团队
  • 业务术语表(Glossary)—— 业务 + 技术团队对齐
  • 数据图谱(Lineage Graph)—— 可视化上下游依赖

5. Actions Framework(变更响应)

  • Webhook 触发:元数据变更时调用外部 API
  • Slack / Teams 通知:表 owner 自动收到通知
  • 数据契约(Data Contracts):Schema 变更时强制检查
  • 可观测性集成:跟 Great Expectations / Soda Core / Monte Carlo 对接

三、差异化能力:图模型 + 实时血缘 + AI Context Platform

1. 图模型元数据(Graph-based Metadata Model)

DataHub 用 通用图模型 描述元数据,核心实体:

  • Dataset(数据集 / 表)
  • DataJob(数据处理任务 / dbt 模型 / Airflow DAG)
  • DataFlow(数据流 / ETL pipeline)
  • Dashboard(仪表盘 / Chart)
  • MLModel(机器学习模型)
  • GlossaryTerm(业务术语)
  • Tag(标签)
  • Owner(所有者 / 团队)

实体之间的关系:ownership / lineage / contains / produced by / input of …

对比 OpenMetadata 用 JSON Schema,Apache Atlas 用 Type System——DataHub 的图模型 最灵活

2. Column-Level Lineage(列级血缘)⭐ 核心

DataHub 自动追踪 列级别 的血缘关系——精确到 ” 哪一列从哪里来 ”:

[Source Table A]              [Source Table B]
    column: user_id              column: country
        ↓                            ↓
    [Transform SQL: JOIN]  →  [Intermediate Table C]
                                  column: user_country
                                       ↓
                                  [Dashboard Chart X]
                                      uses: user_country

血缘来源

SQL 解析(datahub-sql-parser)—— 解析 INSERT / CREATE TABLE / CREATE VIEW

dbt manifest.json—— dbt 模型血缘

Airflow DAG—— 任务血缘

OpenLineage(2026 新)—— 跨工具血缘标准

3. Real-time Updates(实时更新)

所有元数据变更走 Kafka——从 ingestion 到 serving 全链路实时:

  • 改了一个标签 → 1 秒内出现在前端
  • 新建了一个表 → 1 秒内出现在搜索结果
  • 血缘变更 → 1 秒内更新 graph

对比 Apache Atlas(批量更新,延迟 5-15 分钟)—— DataHub 实时性更强

4. Context Platform for AI Stack(2026 新定位)⭐ 重磅

DataHub 2026 年从 ”Metadata Platform” 升级为 “Context Platform”

核心思想:元数据不只是给 ” 人 ” 看的,更是给 AI Agent 用的——

你的 LLM / Agent 在查 ” 上个月销售数据 ” 时,DataHub 提供:
1.
正确的表(不是模糊匹配的 SQL)
2.
列含义(glossary / 业务术语)
3.
数据质量分(哪个表最新最准)
4.
所有权(错了找谁)
5.
血缘(改了影响哪些下游)
6.
PII 标记(合规检查)

集成方式

MCP Serverdatahub-mcp)—— AI Agent 通过 Model Context Protocol 查询元数据

Agent Skills.claude/ .agent-skills/ .cursor/rules/)—— AI Coding 工具自动加载 DataHub 上下文

AI 集成:原生支持 Claude / Cursor / OpenAI Agents

对应 GitHub Topics

agent-platform

context-management

data-observability

DataHub 是 AI Stack 的 Context Layer——跟 Airbyte Agents (326)(AI Stack 的 Data Layer)配合,形成 AI Stack 的完整叙事

5. 80+ 数据源 ingestion(生态广度)

对比 OpenMetadata(50+)和 Apache Atlas(30+),DataHub 的 connector 数最多(80+)—— 因为 LinkedIn 自家要用,生态是 生产驱动 的。

四、生态系统:LinkedIn 出品 + Acryl Data 商业 + LF Data 治理

1. 出身体系

2015 - LinkedIn 内部 WhereHows(DM/ETL 血缘 + 数据目录)↓
2019 - DataHub 开源(v0.x,吸收 WhereHows 经验)↓
2020 - DataHub Project 重构(从 LinkedIn 仓库迁出到 datahub-project 组织)↓
2021 - 加入 **LF Data 治理项目 **(Linux Foundation 旗下)↓
2023 - Acryl Data 成立(DataHub 商业化公司)↓
2024 - DataHub v1.0 发布(API 稳定)↓
2025-2026 - 升级为 "Context Platform for AI Stack"

2. 商业化:Acryl Data

产品 模式
Acryl Observe SaaS 元数据平台(基于 DataHub)
Acryl Cloud 托管 DataHub 服务
Enterprise Support 商业 SLA + 培训

Acryl Data 创始人:Maggie Hu(虎研)+ Shirshanka Das(DataHub 创始人)—— LinkedIn 出身

3. 用户案例(生产级)

公司 规模 用途
LinkedIn 自家 7+ 年 7000+ 数据集 / 10000+ 字段 / 业务核心
Uber 内部 数据发现 + 血缘
Lyft 内部 数据目录
Airbnb 内部 治理 + 质量
Netflix 内部 元数据 + 大数据生态
Notion 内部 数据发现
Wolt 内部 数据目录

4. 工具链集成

工具 集成方式
dbt (290) dbt ingestion recipe(直接对接
Airflow (306) Airflow lineage + DAG ingestion
Great Expectations (262) GE 校验结果 ingestion
Soda Core (276) Soda 校验结果 ingestion
Airbyte (326) Airbyte ingestion recipe
dbt-core (290) manifest.json 解析
Snowflake / BigQuery / Redshift 原生 ingestion connector
Tableau / Power BI / Looker / Superset (270) BI ingestion
MLflow MLModel ingestion

五、对比 OpenMetadata / Unity Catalog / Apache Atlas / Amundsen

维度 DataHub OpenMetadata Unity Catalog Apache Atlas Amundsen
Stars 12,534 ~5K 闭源 ~1.9K ~4.5K
协议 Apache-2.0 ✅ Apache-2.0 ✅ 闭源(Databricks) Apache-2.0 ✅ Apache-2.0 ✅
出身 LinkedIn 开源社区 Databricks Apache / Hadoop Lyft
数据存储 MySQL + ES + Kafka 三层 MySQL + ES + OpenSearch Databricks 平台 HBase + Solr Neo4j + ES + Druid
Connector 80+ ⭐ ~50 主要 Databricks 生态 ~30 ~25
血缘粒度 column-level ✅ column-level ✅ column-level ✅ column-level ⚠️ table-level
实时更新 ✅ Kafka 流式 ⚠️ 准实时 ✅ Databricks 实时 ❌ 批量 ❌ 批量
AI Context 2026 新定位 ⚠️ 早期 ⚠️ Unity AI 集成
MCP 集成 ✅ datahub-mcp
商业支持 ✅ Acryl Data ✅ Collate ✅ Databricks ✅ AWS / Hortonworks ❌ 社区
学习曲线 ⚠️ 中(部署复杂) ✅ 低 ✅ 低(Databricks 用户) ⚠️ 中 ⚠️ 中
部署 Docker / K8s / Helm Docker / K8s SaaS Hadoop 生态 Docker / K8s
活跃度 15,445 commits ~7K commits 闭源 ~5K commits ~3K commits
LF 治理 ✅ LF Data ❌ 独立 ❌ 商业 ✅ Apache ❌ 独立

结论怎么选

你的场景 选谁
生产级元数据平台 + 80+ connector + 实时血缘 + AI 上下文 DataHub
快速上手 + 简化部署 + 现代 UI OpenMetadata
Databricks 生态 + Unity Catalog 集成 Unity Catalog
Hadoop 生态 + HBase + Solr + Ranger 集成 Apache Atlas
图数据库血缘 + Lyft 风格 Amundsen
AI Agent 上下文层(MCP / Agent Skills) DataHub
要商业支持 / SaaS / 培训 Acryl Data / Collate / Databricks

对比已调研的飞熊 8 月 BI 栈

已调研项目 跟 DataHub 的关系
dbt-core (290) 完美集成——DataHub 直接 ingestion dbt manifest.json,自动追踪 dbt 模型血缘
Airflow (306) 完美集成——DataHub ingestion Airflow DAG,自动追踪任务血缘
Great Expectations (262) 完美集成——DataHub ingestion GE 校验结果,数据质量分入元数据
Soda Core (276) 完美集成——DataHub ingestion Soda 校验结果
Airbyte (326) 完美集成——DataHub ingestion Airbyte pipeline,血缘自动追踪
Apache Superset (270) / Metabase (274) / Lightdash (272) 完美集成——DataHub ingestion BI 工具的血缘和元数据
ClickHouse (322) 完美集成——DataHub ingestion ClickHouse 的表和 schema
Trino (328) 完美集成——DataHub ingestion Trino 的 catalog
Apache Iceberg (296 提过) 完美集成——DataHub ingestion Iceberg 的表和 partition
WrenAI (316) / DB-GPT (318) / Evidence (314) 完美集成——DataHub 给这些 GenBI 工具提供 Context Layer

DataHub 在飞熊 BI 栈的位置

数据源(API/DB/Files)↓
Airbyte (326)  ── ETL ──►  数据湖(Iceberg / Delta Lake / Hive)↓
                          Trino (328) 联邦查询
                              ↓
                    dbt (290) ── 转换 ──►  数仓
                              ↓
                ClickHouse (322) ── 加速热查询
                              ↓
                   Superset (270) / Metabase (274) / Lightdash (272) / Evidence (314)
                              ↓
                          ECharts (324) [渲染]
                              ↓
                   **DataHub(贯穿全栈)**  ◄── dbt / Airflow / GE / Soda ingestion
                              ↓
                   **AI Agent (Context Layer)**  ── 给 LLM 喂上下文

DataHub 是 ” 贯穿全栈的元数据 + 上下文层 ”——它不出现在数据流水线里,但 所有数据的元数据都流过它 **。

六、实战:3 步跑通 DataHub

Step 1:本地安装(Docker Compose)

# 1. 克隆仓库
git clone https://github.com/datahub-project/datahub.git
cd datahub

# 2. 启动(首次启动会下载镜像,约 10-15 分钟)./docker/quickstart.sh

# 3. 访问 UI
open http://localhost:9002
# 默认账号
# username: datahub
# password: datahub

Step 2:Ingestion 配置(Snowflake + dbt + GE 三源)

# snowflake_ingestion.yml
source:
  type: snowflake
  config:
    account_id: abc12345.us-east-1
    warehouse: ANALYTICS_WH
    role: DATABOT_DEV
    username: datahub_user
    password: ${SNOWFLAKE_PASSWORD}

sink:
  type: datahub-rest
  config:
    server: http://localhost:8080
    token: ${DATAHUB_TOKEN}

# 运行
datahub ingest -c snowflake_ingestion.yml
# dbt_ingestion.yml
source:
  type: dbt
  config:
    manifest_path: ./dbt_project/target/manifest.json
    catalog_path: ./dbt_project/target/catalog.json
    target_platform: snowflake

sink:
  type: datahub-rest
  config:
    server: http://localhost:8080
# great_expectations_ingestion.yml
source:
  type: great-expectations
  config:
    checkpoint_results_file_path: ./ge/checkpoints/results.json

sink:
  type: datahub-rest
  config:
    server: http://localhost:8080

Step 3:AI Agent 集成(datahub-mcp)

# 安装
# pip install datahub-mcp

# 启动 MCP Server
datahub mcp serve --server http://localhost:8080 --token ${DATAHUB_TOKEN}

# 在 Claude / Cursor 里配置 MCP:# {
#   "mcpServers": {
#     "datahub": {
#       "command": "datahub",
#       "args": ["mcp", "serve", "--server", "http://localhost:8080"]
#     }
#   }
# }

# AI Agent 现在可以问:# " 我们公司有哪些表含 PII 数据?"
# → DataHub 查 Glossary + Tag 自动返回 PII 表列表
#
# " 上个月 GMV 数据用哪个表?"
# → DataHub 查业务术语 + 血缘 + 质量分,返回最佳匹配
#
# " 改了 dbt 模型 X 影响哪些下游?"
# → DataHub 查 column-level 血缘,返回下游所有 Dashboard / 报表

七、风险与坑

1. 部署复杂度高

DataHub 是Java + Python + ES + Kafka + MySQL 的复杂单体——初次部署需要 10-15 分钟下载镜像 + 调通网络。

缓解:用 Acryl Cloud(托管)/ 单节点 quickstart 模式

2. 543 MB 巨型仓库

源码接近 1 GB(包含 metadata-models / ingestion / frontend / actions 所有模块),clone 慢、CI 慢。

3. 实时性依赖 Kafka 集群

流式更新需要 Kafka 集群——单机 Kafka 不够稳定,生产需要 Kafka 集群。

4. 1,226 open issues(健康但量大)

主要是 feature request(新的 connector / UI 改进),不是 P0 阻塞。

5. dbt ingestion 性能

大型 dbt 项目(>1000 模型)ingestion 可能耗时 10-30 分钟。

缓解:增量 ingestion(只处理变更)

6. UI 响应速度

大数据量(>50K datasets)下 UI 可能卡顿。

缓解:分域管理 / 虚拟化(virtual datasets)

7. 商业版 vs 开源版功能差异

Acryl Data 商业版有一些高级功能(AI 推荐 / 自动分类)——开源版正在补齐中。

8. 中文文档相对薄弱

虽然项目是 LinkedIn 出品 + 国际项目,但中文教程和案例不如 Apache Doris / ECharts 丰富。

缓解:看官方英文 docs + Slack 社区 + GitHub Discussions

八、总结

DataHub 不是 ” 又一个元数据目录 ”——它是 “AI 时代的 Context Platform”——把元数据从 ” 人用的工具 ” 升级为 “AI Agent 用的上下文层 ”

3 个最值得用的理由

  1. 生产级元数据平台 :LinkedIn 7 年自家使用 + Uber / Lyft / Airbnb / Netflix 都在用 + 15,445 commits + 80+ connector—— 经得起生产检验
  2. column-level 血缘 + 实时更新:3 层存储(MySQL + ES + Kafka)+ Kafka 流式更新——比 Apache Atlas(批量)实时性更强
  3. AI Context Platform(2026 新定位):MCP Server + Agent Skills + AI Agent 上下文——跟 Airbyte Agents(326) 是同一波 AI Stack 方向

1 句建议

如果你的数据团队超过 10 人 + 有 100+ 数据集 + 想要 column-level 血缘 + 想给 AI Agent 提供数据上下文——用 DataHub(Apache 2.0 ✅ / 12.5K stars / LF Data 治理 / Acryl 商业支持)。

如果你已经在 Databricks 生态 + 想要 Unity Catalog 集成——看 Unity Catalog

如果你要 Hadoop 生态 + Atlas + Ranger 集成——看 Apache Atlas

如果你要快速上手 + 简化部署——看 OpenMetadata

在飞熊 BI 栈里,DataHub 是 贯穿全栈的元数据 + 上下文层 ——它不直接出现在数据流水线里,但 所有数据的元数据都流过它,给数据团队和 AI Agent 提供 ” 找数据 / 信任数据 / 理解数据 ” 的统一入口。


参考

正文完