这是 BI / 数据栈系列调研的 收官文 。过去 1 个月,我们调研了 28 个项目(覆盖 OLAP / BI 平台 / ETL / 数据治理 / 数据可视化 / AI 原生数据应用 / Python 数据应用等 6 大维度),拼成了 从 Kafka 事件流到 AI Agent 应用 的完整数据流水线。本文给你一张 可落地的技术选型矩阵 + 技术咨询变现路径 + 2026+ 趋势预测——帮你把 ” 知识 ” 转化为 ” 高客单价技术咨询项目 ”。
写在前面
过去 30 天,BI 栈系列调研 发了 28 篇深度向文章(WordPress 总数 142 篇 / 池子覆盖 28 / 调研字数 198 KB),覆盖了 BI / 数据栈的全部核心赛道:
v2 补丁(2026-08-19):本节末尾追加 4 篇语义层新调研(DPROD 368 + 语义层四层 370 + MetricFlow 372 + 语义层 E2E 374),覆盖池子升级到 32 篇,WP 总数升级到 159 篇。详见「二·补·1 4 层语义层架构」和「决策 8 语义层选型」。
- OLAP 引擎 4 篇:ClickHouse / Apache Doris / StarRocks / Apache Druid + Pinot 横评
- BI 平台 4 篇:Apache Superset / Metabase / Lightdash / Evidence.dev
- 数据集成 2 篇:Airbyte ETL / dbt-core + sqlmesh 转换
- 数据治理 2 篇:DataHub / Trino 联邦查询
- 数据可视化 4 篇:Apache ECharts / Plotly / Dash / next-ai-draw-io
- AI 原生 2 篇:WrenAI / DB-GPT
- Code-based BI 1 篇:Rill
- Python 数据应用 1 篇:Streamlit
- 质量 + 监控 2 篇:Great Expectations / Grafana
- 数据合同 1 篇:Soda Core
- 协作 BI 1 篇:Redash
- 编排 1 篇:Apache Airflow
- 嵌入式 OLAP 1 篇:DuckDB
- 可视化补充 1 篇:Plotly
但28 篇调研是知识,不是资产。
把这 28 篇调研 拼成一张全景图 + 给技术咨询提供 可落地的选型矩阵 ——这才是 把影响力变现 的关键资产。
本文就是这张全景图。
一、为什么需要全景图?
做技术咨询时,80% 的客户问题不是 ” 选什么 ”,而是 ” 为什么选 A 不选 B”:
- � “ 我们用 ClickHouse 还是 StarRocks?”
- ❌ “ 我们要不要上 Apache Superset?Metabase 够用吗?”
- ❌ “ 实时数仓怎么做?需要 Lambda 架构吗?”
- ❌ “AI Agent 怎么查数据库?用 WrenAI 还是 DB-GPT?”
- ❌ “ 数据治理要不要做?DataHub 复杂吗?”
28 篇单独调研 答不全这些问题——客户要的是 “ 一站式全景图 + 选型决策矩阵 ”。
本文给你 一张全景图 + 7 大决策矩阵 + 技术咨询变现路径。
二、完整 BI 数据流水线(28 篇调研拼图)
┌──────────────────────────────────────────────────────────────────┐
│ 2026 BI 栈全景图 │
│ 28 篇调研 · 6 大维度 · 4 大场景 │
└──────────────────────────────────────────────────────────────────┘
[事件源] [应用层]
│ │
├── IoT 传感器 (ClickHouse 强) ├── AI Demo (Streamlit + AI 原生)
├── App 行为 (Druid/Pinot 强) ├── 高 QPS API (Pinot + Streamlit)
├── 数据库 CDC ├── 内部工具 (Streamlit + Dash)
├── SaaS API (Airbyte 拉) ├── BI 仪表盘 (Superset/Metabase)
└── 文件 (S3/HDFS) └── Chatbot (Streamlit + WrenAI/DB-GPT)
│ │
▼ ▲
[摄取层] │
│ │
├── Apache Druid (336) ──► Lambda │
├── Apache Pinot (336) ──► Star-Tree│
└── Airbyte (326) ──► ETL │
│ │
▼ │
[数据湖层] │
│ │
├── Apache Iceberg (296 提过) │
├── Delta Lake │
└── Apache Hudi │
│ │
▼ │
[联邦查询层] │
│ │
└── Trino (328) ──► 30+ connector │
│ │
▼ │
[转换层] │
│ │
├── dbt-core (290) ──► ELT │
└── sqlmesh (292) ──► dbt 替代 │
│ │
▼ │
[存储查询层] ⭐ BI 栈核心 │
│ │
├── ClickHouse (322) ──► 通用 OLAP │
├── Apache Doris (296) ──► MPP 数仓 │
├── StarRocks (332) ──► 亚秒级 MPP │
└── DuckDB (294) ──► 嵌入式 OLAP │
│ │
▼ │
[可视化层] │
│ │
├── Apache ECharts (324) ──► Web 端 │
├── Plotly (298) ──► Python 端 │
├── Dash (299) ──► Plotly 官方 app│
└── next-ai-draw-io (297) ──► AI 图表│
│ │
▼ │
[BI 仪表盘层] │
│ │
├── Apache Superset (270) ──► Apache │
├── Metabase (274) ──► 易用 │
├── Lightdash (272) ──► dbt 原生 │
└── Redash (304) ──► SQL 协作 │
│ │
▼ │
[AI 原生 BI 层] ⭐ 2026 新方向 │
│ │
├── Evidence.dev (314) ──► BI-as-code │
├── WrenAI (316) ──► GenBI 开创 │
├── DB-GPT (318) ──► AI 框架 │
└── Rill (320) ──► 快 BI + Agent│
│ │
▼ │
[数据应用层] │
│ │
└── Streamlit (334) ──► 数据应用 / AI demo│
│ │
▼ │
[数据治理层] ⭐ 贯穿全栈 │
│ │
├── DataHub (330) ──► 元数据 + AI 上下文│
├── Great Expectations (262) ──► 质量│
├── Soda Core (276) ──► Data Contracts│
└── Grafana (312) ──► 可观测性 │
│ │
▼ │
[编排层] │
│ │
└── Apache Airflow (306) ──► 调度 │
一句话总结:
从 Kafka / 数据库 (事件源)→ Druid / Pinot(实时 OLAP)或 Airbyte(ETL)→ 数据湖(Iceberg / Delta)→ Trino(联邦查询)→ dbt(转换)→ ClickHouse / Doris / StarRocks / DuckDB(存储查询)→ ECharts / Plotly / Dash(可视化)→ Superset / Metabase / Lightdash / Redash(BI 仪表盘)→ Evidence / WrenAI / DB-GPT / Rill(AI 原生 BI)→ Streamlit(数据应用)→ DataHub / Great Expectations / Soda Core / Grafana(数据治理)→ Airflow(编排)。
二·补·1、语义层 4 层架构(v2 · 2026-08-19 补丁)⭐
洞察 :业内把 ” 语义层 ” 这个筐装得太满了——dbt Labs 说 MetricFlow 是语义层,DataHub 说自己是语义层,DPROD 也说语义层,Cube.js 也说语义层。 真相是:「语义层」实际是 4 层,每个项目只做自己那一段,必须配合用。
┌──────────────────────────────────────────────────────────────────┐
│ 语义层 4 层架构(v2 · 2026-08-19 补丁)│
│ L4 Governance / L3 Ontology / L2 Metric / L1 Discovery │
└──────────────────────────────────────────────────────────────────┘
┌─ L4 Governance Layer(治理层)────────────────────────────────────┐
│ " 谁能用、怎么用、违反怎么办 " │
│ • ODRL(W3C Recommendation 2.2 · 政策表达语言 · 2018-02)│
│ • Soda Core(Data Contracts · 2.4K stars · ⚠️ ELv2)│
│ • Great Expectations(质量校验 · 11K stars · Apache-2.0)│
│ • Unity Catalog(Databricks · 商业化)│
└────────────────────────────────────────────────────────────────┘
▼ 描述 " 产品本体 "
┌─ L3 Ontology Layer(本体层)──────────────────────────────────────┐
│ " 这数据产品是啥,谁负责,能干啥 " │
│ • DPROD(OMG · EKGF · 1.0 beta · CC BY 4.0 · 36 commits)│
│ • RDF/OWL(W3C 知识图谱基础)│
│ • Solid LWS(Tim Berners-Lee · 去中心化数据保管)│
└────────────────────────────────────────────────────────────────┘
▼ 描述 " 指标怎么算 "
┌─ L2 Metric Layer(指标层)─────────────────────────────────────────┐
│ " 营收到底是多少,每个工具算出来都一样 " │
│ • MetricFlow(dbt Labs · Apache-2.0 ✅ · OSI 创始)│
│ • Cube.js(20K stars · Apache-2.0+MIT ✅ · 嵌入式 BI 强)│
│ • Looker(Google · 闭源商业 · L2 祖师爷)│
│ • AtScale(商业闭源 · Snowflake 深度集成)│
│ ⭐ L2 双雄:MetricFlow + Cube.js │
└────────────────────────────────────────────────────────────────┘
▼ 暴露 " 数据在哪里 "
┌─ L1 Discovery Layer(发现层)──────────────────────────────────────┐
│ " 数据在哪,谁有,跟我什么关系 " │
│ • DataHub(LinkedIn · 12K stars · LF Data · 80+ connector)│
│ • OpenMetadata(14K stars · Apache-2.0 · MCP 原生集成)│
│ • Apache Atlas(Apache 顶级 · 老牌)│
└────────────────────────────────────────────────────────────────┘
关键判断:
–
必须配合用:单一项目解决不了 ” 让 AI Agent 真正能查数据 ”
–
OSI(Open Semantic Interchange):Snowflake 牵头 16 家联盟,2025 dbt Coalesce 发起,MetricFlow + Cube 都是创始成员
–
4 层缺一不可:缺 L1 → 找不到数据;缺 L3 → 不知道数据产品怎么交付;缺 L2 → 同一个指标数字不一致;缺 L4 → 合规与权限失控
–
DPROD 的核心定位:DataHub 是 ” 有什么数据 ”,DPROD 是 ” 这数据产品怎么交付 + 怎么消费 ”
二·补·2、语义层端到端实战链路(v2 · 2026-08-19 补丁)⭐
实战场景:让 AI Agent 通过 MCP 真正查 ” 上个季度华东区客户复购率 ”
35 分钟 Docker Compose 一键起 4 容器
┌──────────────────────────────────────────────────────────────────┐
│ 语义层 E2E 实战链路(v2 · 2026-08-19 补丁)│
│ AI Agent → MCP → L1/L3/L2 → 数据仓库 → 返回 │
└──────────────────────────────────────────────────────────────────┘
[1] 🤖 AI Agent(Claude / Cursor / 自研)│
│ 问题:" 上个季度华东区客户复购率是多少?"
▼
[2] 🔌 MCP 适配层(JSON-RPC 2.0 协议)│
├─→ OpenMetadata MCP Server(查 catalog 入口)├─→ MetricFlow GraphQL API(查 metric SQL)└─→ ODRL Validator(合规校验)▼
[3] 4 层语义层协作
│
├─ L1 OpenMetadata → 找到 " 客户复购率 " 这个 Data Product
├─ L3 DPROD → 拿到 Data Product 的 Owner / SLA / 接口
└─ L2 MetricFlow + Cube.js → 编译 SQL 查 4 个方言
▼
[4] 数据仓库执行 SQL
│
├─ PostgreSQL 16(演示用)├─ Snowflake
├─ BigQuery
└─ Databricks
▼
[5] 🎁 返回 AI Agent
│
└─ 数值 + DPROD 元数据 + Cube.js 嵌入可视化
实战清单:
| 资源 | 最低 | 推荐 |
|---|---|---|
| CPU | 4 核 | 8 核 |
| 内存 | 8 GB | 16 GB(4 个 Docker 容器并行) |
| Docker | 20.10+ | 24+ |
| 总耗时 | 60 分钟 | 35 分钟 |
4 容器清单:
–
postgres:16-alpine —— 数据仓库(演示)
–
openmetadata/server:1.5 —— L1 Discovery(含 MCP Server)
–
dbt-labs/dbt-semantic-layer:latest —— L2 MetricFlow(GraphQL API: 8080)
–
cubejs/cube:latest —— L2 Cube.js(REST API: 4000 / Playground: 3001)
完整实战:《语义层端到端实战》?p=374
三、8 大决策矩阵(v2 升级:从 7 大 → 8 大,新增决策 8 语义层选型)
决策 1:OLAP 引擎怎么选?
| 你的场景 | 推荐 | WP | 实测 stars |
|---|---|---|---|
| 极致单表聚合 + 时序数据 + IoT | ClickHouse | 322 | 49,269 |
| Apache 顶级 + 中文社区 + 简单运维 + 完整生态 | Apache Doris | 296 | ~30K |
| 湖仓原生 + 多表 JOIN + MySQL 兼容 + 高并发点查 | StarRocks | 332 | 12,013 |
| 事件流式 + Lambda 架构 + 批流一体 | Apache Druid | 336 | 14,042 |
| 用户导向实时分析 + 高 QPS API + Star-Tree | Apache Pinot | 336 | 6,121 |
| 本地 Python / 数据科学 / 单机分析 / 嵌入式 | DuckDB | 294 | ~24K |
决策原则:
–
数据量 TB 级 → ClickHouse / Doris / StarRocks
–
数据量 PB 级 + 数据湖 → StarRocks / Trino + Iceberg
–
事件流式 → Druid / Pinot
–
嵌入式 / 单机 → DuckDB
决策 2:BI 仪表盘怎么选?
| 你的场景 | 推荐 | WP | 实测 stars |
|---|---|---|---|
| Apache 顶级 + 自托管 + Druid 原生 | Apache Superset | 270 | ~60K |
| 易用 + 自托管 + 团队协作 | Metabase | 274 | ~42K |
| dbt 原生 + 现代化 UI + 商业化 | Lightdash | 272 | ~3K |
| SQL 协作 + 自托管 + 轻量 | Redash | 304 | ~28K |
| BI-as-code + 静态站点 + Markdown | Evidence.dev | 314 | ~7K |
决策原则:
–
Druid / Pinot 用户 → Apache Superset(原生集成)
–
dbt 用户 → Lightdash(dbt 原生集成)
–
团队小白用户 → Metabase(最易用)
–
BI-as-code(程序员向)→ Evidence.dev
–
轻量 + 自托管 + SQL → Redash
决策 3:数据集成 / ETL 怎么选?
| 你的场景 | 推荐 | WP | 实测 stars |
|---|---|---|---|
| 快速 + 自托管 + 连接器最全 + 想加自定义 | Airbyte | 326 | 21,902 |
| Python 数据应用 + 嵌入式 ETL + 不想上 Docker | dlt | — | ~3K |
| 老牌 + Singer 规范 + 自定义 ETL + Python 重度 | Meltano | — | ~3K |
| 商业 SaaS + 不想运维 | Fivetran(闭源) | — | — |
| 预算紧 + 商业 SaaS | Stitch(闭源) | — | — |
决策原则:
–
连接器 > 5 + 自托管 + 自定义 → Airbyte
–
Python 进程内 + 不想上 Docker → dlt
–
完全开源 + 自定义 ETL → Meltano
–
商业 + 不想运维 → Fivetran
决策 4:数据转换怎么选?
| 你的场景 | 推荐 | WP | 实测 stars |
|---|---|---|---|
| 行业标准 + dbt 原生 + Apache-2.0 | dbt-core | 290 | ~9K |
| dbt 替代品 + Linux Foundation 接管 + 增量更新 | sqlmesh | 292 | ~3K |
决策原则:
–
标准选型 + 团队熟悉 dbt → dbt-core
–
增量更新 + dbt 太慢 + 想换 → sqlmesh
决策 5:数据可视化怎么选?
| 你的场景 | 推荐 | WP | 实测 stars |
|---|---|---|---|
| 国内项目 + 中文文档 + Dashboard + 地理可视化 | Apache ECharts | 324 | 67,081 ⭐池子最高 |
| 科学计算 + Jupyter + 学术 | Plotly.js / Dash | 298/299 | 18K / 21K |
| Python 数据应用 + 不写 JS | Dash | 299 | 21K |
| 国内 + 蚂蚁生态 / 关系图谱(最强 G6) | AntV | — | ~20K |
| 底层自定义 / 数据驱动文档 / 极致灵活 | D3.js | — | ~110K |
| 极简 / 快速原型 / 移动端 H5 | Chart.js | — | ~65K |
决策原则:
–
国内项目 → ECharts(默认)
–
Python 科学家 → Dash / Plotly
–
关系图 → AntV (G6)
–
底层自定义 → D3.js
决策 6:数据治理怎么选?
| 你的场景 | 推荐 | WP | 实测 stars |
|---|---|---|---|
| 生产级 + 80+ connector + column-level 血缘 + AI Context | DataHub | 330 | 12,534 |
| 快速上手 + 简化部署 + 现代 UI | OpenMetadata | — | ~5K |
| Databricks 生态 + Unity Catalog 集成 | Unity Catalog(闭源) | — | — |
| Hadoop 生态 + Atlas + Ranger 集成 | Apache Atlas | — | ~1.9K |
| 图数据库血缘 + Lyft 风格 | Amundsen | — | ~4.5K |
| dbt 可观测性 | Elementary | — | ~1.7K |
| 数据质量校验 | Great Expectations | 262 | ~10K |
| Data Contracts | Soda Core | 276 | ~2.4K |
决策原则:
–
生产级 + 80+ connector + AI Context → DataHub
–
Apache 生态 → Apache Atlas
–
Databricks 生态 → Unity Catalog
–
快速上手 → OpenMetadata
–
质量校验 → Great Expectations
–
Data Contracts → Soda Core
决策 7:AI 原生数据应用怎么选?
| 你的场景 | 推荐 | WP | 实测 stars |
|---|---|---|---|
| 自然语言问数据 + GenBI 开创者 + 语义层 | WrenAI | 316 | ~17K |
| AI 原生数据应用框架 + Multi-Agents + 私有化 | DB-GPT | 318 | ~20K |
| BI-as-code + SQL+MD+MCP + 静态站点 | Evidence.dev | 314 | ~7K |
| 快 BI + Agent + Go + DuckDB + SvelteKit | Rill | 320 | ~3K |
| AI demo + HuggingFace Spaces + 极简 API | Gradio | — | ~10K |
| 数据应用 + 自动重载 + AI chat 原生 + 7 年沉淀 | Streamlit | 334 | 45,555 |
决策原则:
–
自然语言问数据 → WrenAI
–
AI 数据应用框架 + 私有化 → DB-GPT
–
BI-as-code + 程序员向 → Evidence.dev
–
快 BI + Agent → Rill
–
ML 模型 demo → Gradio
–
Python 数据应用 + AI chat → Streamlit
决策 8:语义层怎么选?(v2 · 2026-08-19 补丁·L1-L4 全栈)⭐
决策 8 是 v2 新增的决策矩阵,对应 4 层语义层架构。每个场景需要选择 L1 / L3 / L2 三层组合。
| 你的场景 | L1 Discovery | L3 Ontology | L2 Metric | 备注 |
|---|---|---|---|---|
| Apache 顶级 + 80+ connector + 11 年沉淀 | DataHub | DPROD | MetricFlow | LF Data 全治理组合 |
| MCP 原生 + 14K stars + 现代 UI | OpenMetadata | DPROD | MetricFlow | 最强 AI 集成 |
| 嵌入式 BI + React 组件 + for AI | DataHub | DPROD | Cube.js | BI 前端一体 |
| 最小起步(单机可起) | DataHub(社区版) | DPROD(规范) | Cube.js | 个人 / 小团队 |
| 商业一站式 | Unity Catalog | Unity Catalog | AtScale | Databricks 用户 |
| 老牌 Hadoop 生态 | Apache Atlas | RDF/OWL | Looker | 传统企业 |
决策原则:
–
AI Agent 优先 → OpenMetadata + DPROD + MetricFlow(MCP 集成最强)
–
BI 前端 + 嵌入式 → DataHub + DPROD + Cube.js( 前端组件库最丰富)
–
Databricks 用户 → Unity Catalog + AtScale( 一站式商业方案)
–
个人 / 小团队 → DataHub(社区版)+ Cube.js( 单机可起)
决策 8·细分 · L2 双雄选谁?(MetricFlow vs Cube.js)
| 维度 | MetricFlow | Cube.js |
|---|---|---|
| License | Apache-2.0 ✅(0.209+) | Apache-2.0 + MIT ✅ 双协议 |
| 学习曲线 | 中(要会 dbt) | 中(JS/TS 友好) |
| AI 友好度 | 中(OSI 推动中) | 高(README 第一句话:for AI) |
| 嵌入式 BI | 弱(仅 GraphQL) | 强(React 组件库) |
| dbt 生态 | 强(dbt Labs 同一团队) | 中 |
| JS/TS 生态 | 弱 | 强(10,710 commits) |
| OSI 联盟 | 创始成员 ✅ | 创始成员 ✅ |
| 可视化内置 | 无 | 有(Cube.js Playground) |
关键判断:
–
数据团队首选 → MetricFlow(dbt 原生,跟 dbt-core 是同一团队,Apache-2.0)
–
前端团队 / 嵌入式 BI → Cube.js(TS 生态,React 组件库,Playground 开箱即用)
–
AI Agent 场景 → 两个都行(都是 OSI 创始成员,都支持 MCP)
四、技术咨询变现路径 ⭐ 实战
核心洞察 :28 篇调研是 技术品牌资产——技术咨询客户最关心的不是 ” 你用什么工具 ”,而是 ” 你懂不懂技术选型 ”。
变现路径 4 步:
1. 内容营销(已经在做)
- 持续产出深度向调研(每周 1-2 篇)→ 建立 ” 技术大牛 ” 人设
- 公众号 / 知乎同步 → 扩大影响力
- GEO 优化 → 让 AI 搜索引擎(Perplexity / Claude)推荐该调研
2. 免费咨询 → 高客单价项目
免费咨询(1 小时)↓
识别客户痛点(" 用 ClickHouse 还是 StarRocks?")↓
推荐深度向调研文章(精准命中)↓
客户建立信任(" 这位懂技术 ")↓
高客单价项目(5-50 万)
关键 :每次客户问技术选型问题, 先发对应的调研文章 + 解释 ” 为什么选 A 不选 B”。
3. 案例沉淀(最关键)
每做完一个项目 → 写 复盘文章(不要写技术细节,写 ” 我们遇到了什么问题 + 最终选了什么 + 为什么 ”):
- “ 某电商公司 OLAP 选型:从 ClickHouse 到 StarRocks 的踩坑实录 ”
- “ 某金融机构数据治理:从 Excel 到 DataHub 的 6 个月 ”
- “ 某 AI 公司数据栈:Trino + Iceberg + StarRocks 三件套落地 ”
这些案例文章 = 技术品牌的最高价值资产。
4. 培训 / 咨询包
高客单价技术咨询包(5-20 万):
- 数据栈选型咨询(1-2 周)
- 数据治理落地咨询(4-8 周)
- AI Agent + 数据集成咨询(4-12 周)
每包都有 28 篇调研作为 参考资产 支撑。
五、AI Stack 新方向 ⭐ 2026+ 重点
2026 年 BI 栈的 最大变化 是 AI Agent 跟数据栈深度融合:
| 方向 | 代表项目 | WP | 关键能力 |
|---|---|---|---|
| AI 原生 BI | WrenAI (316) / DB-GPT (318) / Evidence (314) / Rill (320) | 8/15 | 自然语言查数据 / BI-as-code / 快 BI + Agent |
| AI 数据集成 | Airbyte Agents (326) | 326 | 600+ 数据源变 LLM tools |
| AI 数据上下文 | DataHub Context Platform (330) | 330 | 元数据 + 血缘 + AI Context |
| AI 数据应用 | Streamlit + chat_message (334) | 334 | LLM Chatbot 10 分钟 |
AI Agent 跟数据栈的 3 层关系:
┌─────────────────────────────────────────────┐
│ Layer 3 · AI 数据上下文(DataHub 330)│
│ 给 LLM 提供正确表 / 列 / 质量分 │
├─────────────────────────────────────────────┤
│ Layer 2 · AI 数据集成(Airbyte Agents 326)│
│ 让 LLM 主动拉业务数据(CRM / 订单)│
├─────────────────────────────────────────────┤
│ Layer 1 · AI 数据应用(Streamlit 334)│
│ LLM Chatbot / RAG / Agent demo │
└─────────────────────────────────────────────┘
AI 技术咨询的黄金组合:
–
Streamlit (334) 提供 AI 应用前端
–
Airbyte Agents (326) 提供数据拉取
–
DataHub (330) 提供数据上下文
–
WrenAI / DB-GPT (316/318) 提供 GenBI 查询
六、2026+ 趋势预测
趋势 1:湖仓一体成主流(2026-2028)
- Apache Iceberg / Delta Lake 成为事实标准
- StarRocks / Trino + Iceberg 是湖仓查询黄金组合
- Doris / ClickHouse 也跟进湖仓集成
趋势 2:AI Agent 原生集成(2026+)
- 每个数据栈组件都在加 MCP / Agent 集成
- Airbyte Agents / DataHub Context / Streamlit chat 是先行者
- 2027+ 预计所有 BI 工具都有 AI 原生界面
趋势 3:实时 OLAP + AI 推理结合(2026-2027)
- Druid / Pinot + LLM 实时查询增强
- 流式 SQL(Materialize / Flink)成为 AI 推理的数据层
趋势 4:Apache 治理成为主流(持续)
- LF Data 治理项目(Trino / DataHub / StarRocks)越来越多
- 商业 License(ELv2 / BSL)虽然能赚钱但被开源社区警惕
趋势 5:国产数据栈崛起(持续)
- Apache Doris / StarRocks / DB-GPT 主导国内市场
- 国内客户 首推 这 3 个 + ECharts
七、行动清单 ⭐ 立即执行
立即(本周)
- [] 把 28 篇调研整理成 1 张可下载全景图(PNG / PDF)
- [] 公众号 / 知乎 / CSDN 同步发布全景图文章
- [] 给 5-10 个老客户发全景图 + 收集反馈
短期(本月)
- [] 写 3 个客户案例复盘(已有项目)
- [] 设计 3 个技术咨询包(5/10/20 万)
- [] GEO 优化(让 AI 搜索引擎推荐该调研)
中期(3 个月)
- [] 持续产出调研(每周 1-2 篇)→ 池子剩余 13 个项目
- [] 案例 → 培训 → 课程的转化路径
- [] 行业垂直研究(金融 / 电商 / 制造)
七·补、8 月补丁更新清单(v2 · 2026-08-19)⭐
本次新增调研 4 篇(v1 → v2 增量)
| # | 项目 | WP | 调研日期 | 核心定位 | License |
|---|---|---|---|---|---|
| 1 | DPROD | ?p=368 | 2026-08-18 | L3 Ontology · OMG · Data Product 本体 | CC BY 4.0 |
| 2 | 语义层四层模型 | ?p=370 | 2026-08-19 | L1-L4 全拆 + OSI + 横评 | — |
| 3 | MetricFlow | ?p=372 | 2026-08-19 | L2 Metric · dbt Labs · OSI 创始 | Apache-2.0 ✅ |
| 4 | 语义层端到端实战 | ?p=374 | 2026-08-19 | 4 容器 E2E + MCP + 35 分钟跑通 | — |
数据治理赛道全套(v2 体系化)
| # | 项目 | WP | 赛道 | License |
|---|---|---|---|---|
| 1 | DataHub(330) | L1 Discovery | Apache-2.0 ✅ | |
| 2 | OpenMetadata(366) | L1 Discovery | Apache-2.0 ✅ | |
| 3 | OpenLineage(358) | L4 血缘标准 | Apache-2.0 ✅ | |
| 4 | Marquez(360) | L4 血缘后端 | Apache-2.0 ✅ | |
| 5 | DPROD(368) | L3 Ontology | CC BY 4.0 | |
| 6 | 语义层四层(370) | 横评 | — | |
| 7 | MetricFlow(372) | L2 Metric | Apache-2.0 ✅ | |
| 8 | 语义层 E2E(374) | 实战 | — |
v2 关键升级(全景图 338 → 338 v2)
| 维度 | v1(2026-08-16) | v2(2026-08-19) | 变化 |
|---|---|---|---|
| WP 总数 | 142 | 159 | +17(8 月新增 17 篇) |
| 覆盖池子 | 28 | 32 | +4(语义层 4 篇) |
| 决策矩阵 | 7 大 | 8 大 | +1(决策 8 语义层选型) |
| 架构图 | 流水线 ASCII | + 4 层语义层 + E2E 链路 | +2 张图 |
| AI Stack | 3 层关系 | 升级到 4 层语义层 | OSI 标准联盟 |
行动清单更新(v1 → v2)
- [] 本周:把 v2 全景图 PDF 重新生成(含 4 层语义层 + E2E 链路图)
- [] 本周:把 4 篇语义层新文(368/370/372/374)交叉链接到全景图
- [] 下月:Cube.js 实战向(L2 双雄另一角,30 天内)
- [] Q3:OSI 跟进文(规范稳定后发)
- [] Q3:录制 35 分钟实战视频(Docker + 4 容器,给客户培训用)
一句话总结 v2 增量
v1 是 28 篇调研拼图 → v2 是 32 篇调研 + 4 层语义层架构 + E2E 实战链路
让客户 5 分钟看清 BI 数据栈 + 让 AI Agent 真正能查数据 = 技术咨询变现的两大核心资产。
八、总结
28 篇调研不是终点,是 技术咨询的起点。
这张全景图的价值:
–
客户角度 → 一站式看清 BI 数据栈全景
–
全景图角度 → 把知识转化为可变现的技术咨询资产
–
行业角度 → 沉淀个人技术品牌
3 个最关键的资产:
- 这张全景图 :28 篇调研拼成 1 张图——客户看到的是对 BI 数据栈的 整体掌控力
- 决策矩阵 :7/8 大决策场景——客户看到的是 实战选型经验
- 案例复盘 :未来 3 个月最关键的产出——客户看到的是 真实落地能力
1 句建议:
把 28 篇调研从 ” 文章 ” 变成 ” 资产 ”——全景图是入口,决策矩阵是工具,案例复盘是信任。
技术咨询的终极形态:用这张全景图让客户 5 分钟看懂 BI 数据栈全貌 → 用决策矩阵让客户知道为什么选 A 不选 B → 用案例复盘让客户建立 ” 这位懂技术 ” 的信任 → 接到 5-50 万的高客单价项目。
BI 栈全景图系列收官文到此结束——但 BI 技术品牌建设才刚刚开始。
参考
- v2 调研文章清单(32 篇 · 2026-08-19 更新)(按调研顺序):
| # | 项目 | WP | 实测 stars | 协议 |
|---|---|---|---|---|
| 1 | ClickHouse | 322 | 49,269 | Apache-2.0 ✅ |
| 2 | Apache ECharts | 324 | 67,081 ⭐ | Apache-2.0 ✅ |
| 3 | Airbyte | 326 | 21,902 | NOASSERTION ⚠️ |
| 4 | Trino | 328 | 13,148 | Apache-2.0 ✅ + LF |
| 5 | DataHub | 330 | 12,534 | Apache-2.0 ✅ + LF Data |
| 6 | StarRocks | 332 | 12,013 | Apache-2.0 ✅ + LF 2024 |
| 7 | Streamlit | 334 | 45,555 | Apache-2.0 ✅ + Snowflake |
| 8 | Druid + Pinot 横评 | 336 | 14K + 6K | Apache-2.0 ✅ + Apache 2018 |
| 9 | 全景图收官文(本篇)v2 | 338 | — | — |
| v2 增量 | ||||
| 10 | DPROD | 368 | 36 commits | CC BY 4.0 |
| 11 | 语义层四层模型横评 | 370 | — | — |
| 12 | MetricFlow | 372 | — | Apache-2.0 ✅ |
| 13 | 语义层端到端实战 | 374 | — | — |
加上历史 19 篇(270/272/274/276/282/290/292/294/296/297/298/299/304/306/262/312/314/316/318/320/340/342/344/346/348/350/352/354/356/358/360/362/364/366),WP 总数 159 篇(v1 142 → v2 159)。
- bi-research-pool 调研池:
/home/east/.openclaw/workspace-yunying/bi-research-pool.md - MEMORY 工作记录:
/home/east/.openclaw/workspace-yunying/MEMORY.md - BI 栈系列:全部在 https://east196.cn 上按 ID 查询
后续行动
- 下载全景图 → 公众号同步
- 客户案例复盘 → 5 个客户项目写案例
- 技术咨询包 → 5/10/20 万定价
- GEO 优化 → 让 AI 推荐该调研
BI 栈系列 收官,但不结束——继续产出案例 + 调研 + 培训 = 高客单价技术咨询的核心资产。