2026 BI 全景终极版:60+ 开源项目拼齐数据栈 12 层地形图

73次阅读
2026 BI 全景终极版:60+ 开源项目拼齐数据栈 12 层地形图

一张图 + 12 段把 2026 年开源 BI/ 数据栈的 60+ 个项目全部串起来,从数据摄取到 AI Agent 助手, 每层都告诉你有哪些主流项目、怎么选、为什么这样选。


写在前面:为什么 2026 年的 BI 栈这么乱

过去三年开源数据栈发生了三件大事:

  1. AI Agent 全面进场 —— WrenAI/DB-GPT/Vanna/MindsDB/PandasAI 把 ” 问数据 ” 从 SQL 工程师手里抢到了产品经理手里
  2. 语义层成为新瓶颈 —— dbt-core 290 + sqlmesh 292 + Cube.js 282 + MetricFlow 372 + DPROD 368 在争 ” 同一个指标只有一个数 ” 这件事
  3. OLAP 三强对决 —— ClickHouse 322 vs Doris 296 vs StarRocks 332 把亚秒级查询打成白菜价

但随之而来的问题是:项目太多, 选不动。一个想搭数据栈的工程师, 光看存储层就有 7 个候选:

ClickHouse / DuckDB / Doris / StarRocks / Druid / Pinot / Materialize 加上 Iceberg 做湖仓一体, 光 OLAP + 数据湖就 8 个名字。

这篇文章的目的就是 用 12 层架构把 60+ 项目全部串起来, 让你选型的时候不用再翻 60 篇博客。


L1 数据摄取层(ETL / CDC / 反向 ETL)

核心职责: 把数据从业务系统搬到数仓 / 数据湖。2026 年的关键词是 CDC(Change Data Capture)Python-first

3 大开源代表 + 1 篇横评:

项目 WP 定位 2026 关键词
Airbyte 326 ETL 龙头,600+ 连接器, 自托管 + Cloud 双模式 NOASSERTION 商用要小心,2026 主打 AI Agents 方向
dlt 407 Python-first ELT 库,5.8K stars 跟 Airbyte 同台对比中 ” 轻量派 ” 胜出
Meltano 409 Singer Spec 标准 ETL 引擎 老牌但社区分裂,GitLab 原生但增速放缓
横评 3 件套 411 Airbyte / dlt / Meltano 全方位对比 5 大决策矩阵告诉你谁适合谁

选型结论:Python 团队首选 dlt, 平台需求首选 Airbyte。Meltano 只在你必须用 Singer 规范时才考虑。


L2 数据存储层(数仓 / OLAP / 数据湖)

核心职责: 把数据存起来, 支持亚秒级查询。2026 年的格局是 OLAP 三强 + 嵌入式 OLAP + 实时流式

7 个代表项目:

项目 WP 定位 关键卖点
ClickHouse 322 OLAP 王座,49K stars 向量化执行 + MergeTree 引擎,10 年沉淀
DuckDB 294 嵌入式 OLAP 神兽 MIT 协议,Quack 协议让本地分析告别 ETL
Apache Doris 296 百度出身 Apache 顶级 MPP 4.0 AI-Ready, 跟大模型原生打通
StarRocks 332 亚秒级 MPP,12K stars Doris fork 后完全重构,SSB 跑分 2.1× ClickHouse
Druid + Pinot 336 实时 OLAP 双雄横评 Lambda 架构 vs Star-Tree, 事件流式分析
Materialize 415 6.4K stars 实时流式 SQL BSL 1.1 转 Apache-2.0 的 4 年窗口
Apache Iceberg 379 9K stars 数据湖事实标准 6 大特性让湖仓一体落地

选型结论:

PB 级离线分析ClickHouse


单机 / 笔记本分析DuckDB


湖仓一体Iceberg + 任意 OLAP

亚秒级实时查询StarRocksDoris


事件流式分析Druid + Pinot 横评


L3 转换与编排层(ELT / DAG / Workflow)

核心职责 : 把数据转换、清洗、连接、建模。2026 年的关键词是 从 DAG 到 Asset持久执行 vs 批处理调度

6 个代表项目 + 1 篇全景横评:

项目 WP 范式 关键差异
dbt-core 290 ELT 转换 SQL + Python 9K+ stars, 从 Python 重写到 Rust
sqlmesh 292 dbt 替代,LF 接管 开发环境搬出数仓
Apache Airflow 306 DAG 调度事实标准 46K stars,3.x 让 DAG 不再是配置地狱
Dagster 390 Asset-centric 编排 16K stars Apache-2.0, 新范式
Prefect 432 Python workflow orchestration 23K stars,8 年老牌, 装饰器范式
Temporal 430 持久执行 workflow 22K stars, 跟 Airflow 范式冲突
横评 5 件套 413 数据集成全景 3 大层职责分明

范式决策:

DAG 批处理 → Airflow 306

Asset-centric → Dagster 390

Python 装饰器 → Prefect 432

持久执行 → Temporal 430

SQL 转换 → dbt-core 290 / sqlmesh 292

实战三件套:dlt + Prefect + dbt 40 分钟跑通 GitHub ETL


L4 数据质量层(Data Quality / Observability)

核心职责: 发现数据里的异常、空值、漂移、契约违反。

3 个代表项目:

项目 WP 定位 关键差异
Great Expectations 262 数据质量事实标准 从 ” 半夜报警 ” 升级到 ” 声明式契约 ”
Soda Core 276 现代数据栈 Data Contracts 引擎 2.4K stars,ELv2 许可比你想的细
Elementary 424 dbt-native 数据可观测性 2.4K stars,5 年老牌, 把 anomaly detection 装进 dbt

选型结论:dbt 用户直接用 Elementary, 独立部署用 Great Expectations,Data Contracts 选 Soda Core


L5 数据治理层(Catalog / 血缘 / Contract)

核心职责: 管好元数据、血缘、访问权限、数据契约。2026 年的关键词是 AI Context Layer

6 个代表项目 + 2 篇实战:

项目 WP 定位 关键差异
2026 数据治理横评 352 6 大 OSS 谁是 AI 时代 Context Layer 46K stars 总和
OpenLineage 358 跨工具血缘 LF AI 毕业标准 2.6K ⭐ 不是产品是规则
Marquez 360 OpenLineage 官方参考后端 2.3K ⭐ 纯血缘图可视化
OpenMetadata 366 一站式 AI Context Layer 14K ⭐,4 步让客户看到数据全景图
DPROD 368 数据产品本体的 OMG 标准 让 AI Agent 终于能 ” 读懂 ” 数据
DataHub 330 LinkedIn 出品 12K stars 元数据到 AI Agent 上下文一站式
OpenLineage + Marquez 实战 364 5 步搭端到端血缘 标准 + 后端组合拳
OpenMetadata 实战 366 4 步部署 AI Context Layer 客户场景实战

关键发现 :DPROD 368 + MetricFlow 372 + Cube.js 282 三件套 形成语义层闭环,AI Agent 真正能用统一指标查数据


L6 语义层(Headless BI / Metric / Ontology)

核心职责 : 让 ” 营收 ” 在所有 BI 工具里都是同一个数。2026 年的核心战场。

5 个代表项目 + 2 篇实战:

项目 WP 定位 关键差异
Cube.js 282 语义层龙头,20.5K stars 给 AI Agent 喂 ” 统一指标 ” 的中间件
MetricFlow 372 dbt Labs 语义层执行引擎 License 三段史:AGPL → BSL → Apache-2.0
DPROD 368 OMG 标准数据产品本体 L3 Ontology 层, 跟 L2 Metric 互补
语义层四层模型横评 370 L1 Discovery + L2 Metric + L3 Ontology + L4 Governance AI 时代数据栈的 ” 分层真相 ”
Trino 328 联邦查询事实标准 13K stars,30+ connector,PrestoSQL 续作
语义层端到端实战 374 DPROD + MetricFlow + Cube.js 三件套 AI Agent 真实查询示例

关键结论 : 语义层是 BI 栈的新瓶颈。没有语义层的 BI 工具, 指标会到处打架,AI Agent 也查不到一致的数据。


L7 BI 看板层(可视化平台)

核心职责: 给业务方看仪表盘、做临时查询。

6 个代表项目:

项目 WP 定位 关键差异
Apache Superset 270 74K stars Apache 顶级 50+ 数据库,AI 原生 LLM Context, 云原生 SQL IDE
Lightdash 272 6K stars “Agentic BI” dbt 团队的下一代选择
Metabase 274 48K stars 业务自助 BI 之王 AGPL 商用陷阱比你想的深
Redash 304 28K stars SQL 协作 BI 35+ 数据源 + 告警一把梭
Evidence.dev 314 BI 新范式 SQL+MD+Agent 把 BI 装进代码仓库
Preset 420 AI-Native BI 商业版 Superset 74K ⭐ 上游 + $48.4M 融资

选型结论:Superset 270 / Metabase 274 / Evidence.dev 314 三选一。代码化 BI 趋势下 Evidence.dev 增长最快。


L8 可视化基础设施层

核心职责: 图表库、可视化组件、交互能力。

5 个代表项目:

项目 WP 定位 关键差异
Apache ECharts 324 67K stars 可视化基础设施 Canvas+SVG 双引擎, 千万级数据
D3.js 426 113K stars 可视化鼻祖 15 年传奇,Observable Plot 接班
AntV 422 蚂蚁全家桶 G2/G6/L7/G2Plot 国内生态必讲
plotly 298 18K stars 开源交互可视化 Dash 让它从图变成应用
Dash 299 24K stars Python 数据应用 零前端写出 ML 后台
next-ai-draw-io 297 34K Stars AI 图表利器 MCP Server 让 Agent 画架构图

选型结论:Web 产品选 ECharts / AntV, 数据应用选 Dash / Streamlit。AI 时代多一个 MCP Server 集成选项。


L9 AI 增强层(GenBI / Text-to-SQL / ChatBI)⭐

核心职责 : 让用户用 自然语言查数据。2026 年最热的赛道。

9 个代表项目 + 1 篇横评:

项目 WP 定位 关键差异
GenBI 9 件套横评 396 193K stars 全景地图 4 大类怎么选不踩坑
WrenAI 316 GenBI 范式开创者 17K stars,Text-to-SQL + 语义层 + MCP
DB-GPT 318 19.7K stars MIT AI 原生数据应用框架,AWEL 工作流
Rill 320 快 BI + Agent Go + DuckDB + SvelteKit
Vanna 384 23.8K stars MIT Text-to-SQL 任意 LLM + 11+ 数据库,2.0 维护模式
MindsDB 386 39K stars MIT 重磅升级到 MindsHub,AI Agent 真正能查数据库
PandasAI 388 23K stars DataFrame 对话库 跟 Vanna 形成 SQL + Python 双栈
Supersonic 392 5K stars 腾讯音乐开源 统一 Chat BI + Headless BI
Chat2DB 394 27K stars 阿里出品 40+ 数据库 + MCP 全栈支持

关键发现:GenBI 已经从 ” 玩具 ” 变成 ” 生产工具 ”DB-GPT 318MindsDB 386 是两个最值得跟的项目。


L10 AI Agent 框架层

核心职责 : 让 AI 不只是查数据, 还能 自动完成任务(写报告、改 dbt 模型、监控告警)。

6 个代表项目 + 1 篇横评:

项目 WP 定位 关键差异
AI Agent 框架对比横评 342 5 大框架选型指南 393K stars 总和,5/6 MIT
LangChain 344 184K stars Python AI Agent 龙头 LCEL + LangGraph + LangSmith + LangServe 四件套
DeepSeek Harness (DSH) 340 3 天 13 万 stars “ 一切皆插件 ”Agent 框架
Cordis 350 DSH 插件框架基石 Koishi Chatbot 生态的 Service / Context / Plugin
LoopX 403 长程 Agent 控制面 让 Codex / Claude Code 跑 200+ 小时不失控
Pi 434 98K stars AI Agent 工具链 5 个 npm package monorepo

附加生态:
Vibe Coding 横评 —— 5 大 AI 编程工具对决
Open Design —— 把 AI Coding Agent 变成设计引擎
AI Agent 框架实战 —— LangGraph + CrewAI + AutoGen 35 分钟对比


L11 AI Agent 可观测性层

核心职责: 追踪 AI Agent 的 token、tool call、错误率。

1 个代表项目 + 1 篇横评:

项目 WP 定位 关键差异
AI Agent 可观测性横评 405 5 大开源工具对比 12 维决策矩阵,Langfuse 33K stars 坐稳 Trace 王座

代表项目:Langfuse / Phoenix / AgentOps / Helicone(横评中详述)。


L12 实战篇(端到端集成)

核心职责: 把上面 11 层串起来, 跑通真实业务场景。

5 个实战代表:

实战 WP 涉及层 时长
dlt + Prefect + dbt 三件套 417 L1 + L3 + L3 40 分钟跑通 GitHub ETL
Cube.js 实战 375 L6 三件套 Docker Compose 一键起
AI Agent 框架实战 377 L10 LangGraph + CrewAI + AutoGen 35 分钟对比
OpenLineage + Marquez 实战 364 L5 5 步搭端到端血缘系统
OpenMetadata 实战 366 L5 14K ⭐ 4 步部署 AI Context Layer
语义层端到端实战 374 L6 DPROD + MetricFlow + Cube.js 一次跑通

总结:12 层决策矩阵 + 推荐组合

2026 BI 栈的 3 大流派

流派 典型用户 推荐组合
传统派(BI 优先) 大型企业、传统数仓 Airbyte 326 + ClickHouse 322 + dbt 290 + Cube.js 282 + Superset 270
AI 派(GenBI 优先) 创业团队、AI 原生公司 dlt 407 + DuckDB 294 + MetricFlow 372 + WrenAI 316 + MindsDB 386
湖仓派(数据湖优先) 跨云、PB 级 Iceberg 379 + StarRocks 332 + OpenLineage 358 + Trino 328 + Evidence.dev 314

4 大决策矩阵

你最关心 … 选这条路
开源 + 商业可用的 BI 平台 Superset 270 + MetricFlow 372 + DuckDB 294
Python 团队 + 快速落地 dlt 407 + Prefect 432 + dbt-core 290 + Streamlit 334
AI Agent 能查一致的数据 Cube.js 282 + MetricFlow 372 + DPROD 368 + DB-GPT 318
实时流式 + 亚秒级查询 Materialize 415 + Druid 336 + StarRocks 332 + Evidence.dev 314

3 个 ” 最值得装的理由 ”

  1. 语义层是新瓶颈 —— 没装 Cube.js 282 / MetricFlow 372 的 BI 栈, 指标一定会到处打架
  2. AI Agent 已经在生产可用 —— MindsDB 386 / DB-GPT 318 / WrenAI 316 任选一个, 业务方就能自助查数
  3. 横评文章就是决策入口 —— 396 GenBI 横评 / 413 集成全景 / 352 治理横评 三篇就能 cover 80% 选型决策

一句话价值

BI 栈不是装出来的, 是演化出来的。从 ETL 到 AI Agent 的 12 层里, 先装你业务最痛的那一层, 其他 11 层可以慢慢补。


参考


by 飞熊 · yunying(增长运营官)

正文完