
一张图 + 12 段把 2026 年开源 BI/ 数据栈的 60+ 个项目全部串起来,从数据摄取到 AI Agent 助手, 每层都告诉你有哪些主流项目、怎么选、为什么这样选。
写在前面:为什么 2026 年的 BI 栈这么乱
过去三年开源数据栈发生了三件大事:
- AI Agent 全面进场 —— WrenAI/DB-GPT/Vanna/MindsDB/PandasAI 把 ” 问数据 ” 从 SQL 工程师手里抢到了产品经理手里
- 语义层成为新瓶颈 —— dbt-core 290 + sqlmesh 292 + Cube.js 282 + MetricFlow 372 + DPROD 368 在争 ” 同一个指标只有一个数 ” 这件事
- OLAP 三强对决 —— ClickHouse 322 vs Doris 296 vs StarRocks 332 把亚秒级查询打成白菜价
但随之而来的问题是:项目太多, 选不动。一个想搭数据栈的工程师, 光看存储层就有 7 个候选:
ClickHouse / DuckDB / Doris / StarRocks / Druid / Pinot / Materialize 加上 Iceberg 做湖仓一体, 光 OLAP + 数据湖就 8 个名字。
这篇文章的目的就是 用 12 层架构把 60+ 项目全部串起来, 让你选型的时候不用再翻 60 篇博客。
L1 数据摄取层(ETL / CDC / 反向 ETL)
核心职责: 把数据从业务系统搬到数仓 / 数据湖。2026 年的关键词是 CDC(Change Data Capture) 和 Python-first。
3 大开源代表 + 1 篇横评:
| 项目 | WP | 定位 | 2026 关键词 |
|---|---|---|---|
| Airbyte | 326 | ETL 龙头,600+ 连接器, 自托管 + Cloud 双模式 | NOASSERTION 商用要小心,2026 主打 AI Agents 方向 |
| dlt | 407 | Python-first ELT 库,5.8K stars | 跟 Airbyte 同台对比中 ” 轻量派 ” 胜出 |
| Meltano | 409 | Singer Spec 标准 ETL 引擎 | 老牌但社区分裂,GitLab 原生但增速放缓 |
| 横评 3 件套 | 411 | Airbyte / dlt / Meltano 全方位对比 | 5 大决策矩阵告诉你谁适合谁 |
选型结论:Python 团队首选 dlt, 平台需求首选 Airbyte。Meltano 只在你必须用 Singer 规范时才考虑。
L2 数据存储层(数仓 / OLAP / 数据湖)
核心职责: 把数据存起来, 支持亚秒级查询。2026 年的格局是 OLAP 三强 + 嵌入式 OLAP + 实时流式。
7 个代表项目:
| 项目 | WP | 定位 | 关键卖点 |
|---|---|---|---|
| ClickHouse | 322 | OLAP 王座,49K stars | 向量化执行 + MergeTree 引擎,10 年沉淀 |
| DuckDB | 294 | 嵌入式 OLAP 神兽 | MIT 协议,Quack 协议让本地分析告别 ETL |
| Apache Doris | 296 | 百度出身 Apache 顶级 MPP | 4.0 AI-Ready, 跟大模型原生打通 |
| StarRocks | 332 | 亚秒级 MPP,12K stars | Doris fork 后完全重构,SSB 跑分 2.1× ClickHouse |
| Druid + Pinot | 336 | 实时 OLAP 双雄横评 | Lambda 架构 vs Star-Tree, 事件流式分析 |
| Materialize | 415 | 6.4K stars 实时流式 SQL | BSL 1.1 转 Apache-2.0 的 4 年窗口 |
| Apache Iceberg | 379 | 9K stars 数据湖事实标准 | 6 大特性让湖仓一体落地 |
选型结论:
–
PB 级离线分析 → ClickHouse
–
单机 / 笔记本分析 → DuckDB
–
湖仓一体 → Iceberg + 任意 OLAP
–
亚秒级实时查询 → StarRocks 或 Doris
–
事件流式分析 → Druid + Pinot 横评
L3 转换与编排层(ELT / DAG / Workflow)
核心职责 : 把数据转换、清洗、连接、建模。2026 年的关键词是 从 DAG 到 Asset 和 持久执行 vs 批处理调度。
6 个代表项目 + 1 篇全景横评:
| 项目 | WP | 范式 | 关键差异 |
|---|---|---|---|
| dbt-core | 290 | ELT 转换 SQL + Python | 9K+ stars, 从 Python 重写到 Rust |
| sqlmesh | 292 | dbt 替代,LF 接管 | 开发环境搬出数仓 |
| Apache Airflow | 306 | DAG 调度事实标准 | 46K stars,3.x 让 DAG 不再是配置地狱 |
| Dagster | 390 | Asset-centric 编排 | 16K stars Apache-2.0, 新范式 |
| Prefect | 432 | Python workflow orchestration | 23K stars,8 年老牌, 装饰器范式 |
| Temporal | 430 | 持久执行 workflow | 22K stars, 跟 Airflow 范式冲突 |
| 横评 5 件套 | 413 | 数据集成全景 | 3 大层职责分明 |
范式决策:
–
DAG 批处理 → Airflow 306
–
Asset-centric → Dagster 390
–
Python 装饰器 → Prefect 432
–
持久执行 → Temporal 430
–
SQL 转换 → dbt-core 290 / sqlmesh 292
实战三件套:dlt + Prefect + dbt 40 分钟跑通 GitHub ETL。
L4 数据质量层(Data Quality / Observability)
核心职责: 发现数据里的异常、空值、漂移、契约违反。
3 个代表项目:
| 项目 | WP | 定位 | 关键差异 |
|---|---|---|---|
| Great Expectations | 262 | 数据质量事实标准 | 从 ” 半夜报警 ” 升级到 ” 声明式契约 ” |
| Soda Core | 276 | 现代数据栈 Data Contracts 引擎 | 2.4K stars,ELv2 许可比你想的细 |
| Elementary | 424 | dbt-native 数据可观测性 | 2.4K stars,5 年老牌, 把 anomaly detection 装进 dbt |
选型结论:dbt 用户直接用 Elementary, 独立部署用 Great Expectations,Data Contracts 选 Soda Core。
L5 数据治理层(Catalog / 血缘 / Contract)
核心职责: 管好元数据、血缘、访问权限、数据契约。2026 年的关键词是 AI Context Layer。
6 个代表项目 + 2 篇实战:
| 项目 | WP | 定位 | 关键差异 |
|---|---|---|---|
| 2026 数据治理横评 | 352 | 6 大 OSS 谁是 AI 时代 Context Layer | 46K stars 总和 |
| OpenLineage | 358 | 跨工具血缘 LF AI 毕业标准 | 2.6K ⭐ 不是产品是规则 |
| Marquez | 360 | OpenLineage 官方参考后端 | 2.3K ⭐ 纯血缘图可视化 |
| OpenMetadata | 366 | 一站式 AI Context Layer | 14K ⭐,4 步让客户看到数据全景图 |
| DPROD | 368 | 数据产品本体的 OMG 标准 | 让 AI Agent 终于能 ” 读懂 ” 数据 |
| DataHub | 330 | LinkedIn 出品 12K stars | 元数据到 AI Agent 上下文一站式 |
| OpenLineage + Marquez 实战 | 364 | 5 步搭端到端血缘 | 标准 + 后端组合拳 |
| OpenMetadata 实战 | 366 | 4 步部署 AI Context Layer | 客户场景实战 |
关键发现 :DPROD 368 + MetricFlow 372 + Cube.js 282 三件套 形成语义层闭环,AI Agent 真正能用统一指标查数据。
L6 语义层(Headless BI / Metric / Ontology)
核心职责 : 让 ” 营收 ” 在所有 BI 工具里都是同一个数。2026 年的核心战场。
5 个代表项目 + 2 篇实战:
| 项目 | WP | 定位 | 关键差异 |
|---|---|---|---|
| Cube.js | 282 | 语义层龙头,20.5K stars | 给 AI Agent 喂 ” 统一指标 ” 的中间件 |
| MetricFlow | 372 | dbt Labs 语义层执行引擎 | License 三段史:AGPL → BSL → Apache-2.0 |
| DPROD | 368 | OMG 标准数据产品本体 | L3 Ontology 层, 跟 L2 Metric 互补 |
| 语义层四层模型横评 | 370 | L1 Discovery + L2 Metric + L3 Ontology + L4 Governance | AI 时代数据栈的 ” 分层真相 ” |
| Trino | 328 | 联邦查询事实标准 | 13K stars,30+ connector,PrestoSQL 续作 |
| 语义层端到端实战 | 374 | DPROD + MetricFlow + Cube.js 三件套 | AI Agent 真实查询示例 |
关键结论 : 语义层是 BI 栈的新瓶颈。没有语义层的 BI 工具, 指标会到处打架,AI Agent 也查不到一致的数据。
L7 BI 看板层(可视化平台)
核心职责: 给业务方看仪表盘、做临时查询。
6 个代表项目:
| 项目 | WP | 定位 | 关键差异 |
|---|---|---|---|
| Apache Superset | 270 | 74K stars Apache 顶级 | 50+ 数据库,AI 原生 LLM Context, 云原生 SQL IDE |
| Lightdash | 272 | 6K stars “Agentic BI” | dbt 团队的下一代选择 |
| Metabase | 274 | 48K stars 业务自助 BI 之王 | AGPL 商用陷阱比你想的深 |
| Redash | 304 | 28K stars SQL 协作 BI | 35+ 数据源 + 告警一把梭 |
| Evidence.dev | 314 | BI 新范式 SQL+MD+Agent | 把 BI 装进代码仓库 |
| Preset | 420 | AI-Native BI 商业版 Superset | 74K ⭐ 上游 + $48.4M 融资 |
选型结论:Superset 270 / Metabase 274 / Evidence.dev 314 三选一。代码化 BI 趋势下 Evidence.dev 增长最快。
L8 可视化基础设施层
核心职责: 图表库、可视化组件、交互能力。
5 个代表项目:
| 项目 | WP | 定位 | 关键差异 |
|---|---|---|---|
| Apache ECharts | 324 | 67K stars 可视化基础设施 | Canvas+SVG 双引擎, 千万级数据 |
| D3.js | 426 | 113K stars 可视化鼻祖 | 15 年传奇,Observable Plot 接班 |
| AntV | 422 | 蚂蚁全家桶 G2/G6/L7/G2Plot | 国内生态必讲 |
| plotly | 298 | 18K stars 开源交互可视化 | Dash 让它从图变成应用 |
| Dash | 299 | 24K stars Python 数据应用 | 零前端写出 ML 后台 |
| next-ai-draw-io | 297 | 34K Stars AI 图表利器 | MCP Server 让 Agent 画架构图 |
选型结论:Web 产品选 ECharts / AntV, 数据应用选 Dash / Streamlit。AI 时代多一个 MCP Server 集成选项。
L9 AI 增强层(GenBI / Text-to-SQL / ChatBI)⭐
核心职责 : 让用户用 自然语言查数据。2026 年最热的赛道。
9 个代表项目 + 1 篇横评:
| 项目 | WP | 定位 | 关键差异 |
|---|---|---|---|
| GenBI 9 件套横评 | 396 | 193K stars 全景地图 | 4 大类怎么选不踩坑 |
| WrenAI | 316 | GenBI 范式开创者 | 17K stars,Text-to-SQL + 语义层 + MCP |
| DB-GPT | 318 | 19.7K stars MIT | AI 原生数据应用框架,AWEL 工作流 |
| Rill | 320 | 快 BI + Agent | Go + DuckDB + SvelteKit |
| Vanna | 384 | 23.8K stars MIT Text-to-SQL | 任意 LLM + 11+ 数据库,2.0 维护模式 |
| MindsDB | 386 | 39K stars MIT | 重磅升级到 MindsHub,AI Agent 真正能查数据库 |
| PandasAI | 388 | 23K stars DataFrame 对话库 | 跟 Vanna 形成 SQL + Python 双栈 |
| Supersonic | 392 | 5K stars 腾讯音乐开源 | 统一 Chat BI + Headless BI |
| Chat2DB | 394 | 27K stars 阿里出品 | 40+ 数据库 + MCP 全栈支持 |
关键发现:GenBI 已经从 ” 玩具 ” 变成 ” 生产工具 ”。DB-GPT 318 和 MindsDB 386 是两个最值得跟的项目。
L10 AI Agent 框架层
核心职责 : 让 AI 不只是查数据, 还能 自动完成任务(写报告、改 dbt 模型、监控告警)。
6 个代表项目 + 1 篇横评:
| 项目 | WP | 定位 | 关键差异 |
|---|---|---|---|
| AI Agent 框架对比横评 | 342 | 5 大框架选型指南 | 393K stars 总和,5/6 MIT |
| LangChain | 344 | 184K stars Python AI Agent 龙头 | LCEL + LangGraph + LangSmith + LangServe 四件套 |
| DeepSeek Harness (DSH) | 340 | 3 天 13 万 stars | “ 一切皆插件 ”Agent 框架 |
| Cordis | 350 | DSH 插件框架基石 | Koishi Chatbot 生态的 Service / Context / Plugin |
| LoopX | 403 | 长程 Agent 控制面 | 让 Codex / Claude Code 跑 200+ 小时不失控 |
| Pi | 434 | 98K stars AI Agent 工具链 | 5 个 npm package monorepo |
附加生态:
– Vibe Coding 横评 —— 5 大 AI 编程工具对决
– Open Design —— 把 AI Coding Agent 变成设计引擎
– AI Agent 框架实战 —— LangGraph + CrewAI + AutoGen 35 分钟对比
L11 AI Agent 可观测性层
核心职责: 追踪 AI Agent 的 token、tool call、错误率。
1 个代表项目 + 1 篇横评:
| 项目 | WP | 定位 | 关键差异 |
|---|---|---|---|
| AI Agent 可观测性横评 | 405 | 5 大开源工具对比 | 12 维决策矩阵,Langfuse 33K stars 坐稳 Trace 王座 |
代表项目:Langfuse / Phoenix / AgentOps / Helicone(横评中详述)。
L12 实战篇(端到端集成)
核心职责: 把上面 11 层串起来, 跑通真实业务场景。
5 个实战代表:
| 实战 | WP | 涉及层 | 时长 |
|---|---|---|---|
| dlt + Prefect + dbt 三件套 | 417 | L1 + L3 + L3 | 40 分钟跑通 GitHub ETL |
| Cube.js 实战 | 375 | L6 | 三件套 Docker Compose 一键起 |
| AI Agent 框架实战 | 377 | L10 | LangGraph + CrewAI + AutoGen 35 分钟对比 |
| OpenLineage + Marquez 实战 | 364 | L5 | 5 步搭端到端血缘系统 |
| OpenMetadata 实战 | 366 | L5 | 14K ⭐ 4 步部署 AI Context Layer |
| 语义层端到端实战 | 374 | L6 | DPROD + MetricFlow + Cube.js 一次跑通 |
总结:12 层决策矩阵 + 推荐组合
2026 BI 栈的 3 大流派
| 流派 | 典型用户 | 推荐组合 |
|---|---|---|
| 传统派(BI 优先) | 大型企业、传统数仓 | Airbyte 326 + ClickHouse 322 + dbt 290 + Cube.js 282 + Superset 270 |
| AI 派(GenBI 优先) | 创业团队、AI 原生公司 | dlt 407 + DuckDB 294 + MetricFlow 372 + WrenAI 316 + MindsDB 386 |
| 湖仓派(数据湖优先) | 跨云、PB 级 | Iceberg 379 + StarRocks 332 + OpenLineage 358 + Trino 328 + Evidence.dev 314 |
4 大决策矩阵
| 你最关心 … | 选这条路 |
|---|---|
| 开源 + 商业可用的 BI 平台 | Superset 270 + MetricFlow 372 + DuckDB 294 |
| Python 团队 + 快速落地 | dlt 407 + Prefect 432 + dbt-core 290 + Streamlit 334 |
| AI Agent 能查一致的数据 | Cube.js 282 + MetricFlow 372 + DPROD 368 + DB-GPT 318 |
| 实时流式 + 亚秒级查询 | Materialize 415 + Druid 336 + StarRocks 332 + Evidence.dev 314 |
3 个 ” 最值得装的理由 ”
- 语义层是新瓶颈 —— 没装 Cube.js 282 / MetricFlow 372 的 BI 栈, 指标一定会到处打架
- AI Agent 已经在生产可用 —— MindsDB 386 / DB-GPT 318 / WrenAI 316 任选一个, 业务方就能自助查数
- 横评文章就是决策入口 —— 396 GenBI 横评 / 413 集成全景 / 352 治理横评 三篇就能 cover 80% 选型决策
一句话价值
BI 栈不是装出来的, 是演化出来的。从 ETL 到 AI Agent 的 12 层里, 先装你业务最痛的那一层, 其他 11 层可以慢慢补。
参考
- 60+ 篇调研原文:https://east196.cn 上对应 WP ID
- 已发布 5 篇全景横评 :GenBI 396 / 数据集成 413 / 数据治理 352 / 语义层 370 / AI Agent 342
- 5 篇实战:417 / 375 / 377 / 364 / 374
- 本系列调研池: 见 bi-research-pool.md(工作区根目录)
by 飞熊 · yunying(增长运营官)