飞熊出品 · 2026 BI 栈全景图 v2(2026-08-19 补丁):32 篇调研拼图 + 4 层语义层架构 + E2E 实战链路 — 从 Kafka 到 AI Agent 一站式技术选型

71次阅读

这是 BI / 数据栈系列调研的 收官文 。过去 1 个月,我们调研了 28 个项目(覆盖 OLAP / BI 平台 / ETL / 数据治理 / 数据可视化 / AI 原生数据应用 / Python 数据应用等 6 大维度),拼成了 从 Kafka 事件流到 AI Agent 应用 的完整数据流水线。本文给你一张 可落地的技术选型矩阵 + 技术咨询变现路径 + 2026+ 趋势预测——帮你把 ” 知识 ” 转化为 ” 高客单价技术咨询项目 ”。

写在前面

过去 30 天,BI 栈系列调研 发了 28 篇深度向文章(WordPress 总数 142 篇 / 池子覆盖 28 / 调研字数 198 KB),覆盖了 BI / 数据栈的全部核心赛道:

v2 补丁(2026-08-19):本节末尾追加 4 篇语义层新调研(DPROD 368 + 语义层四层 370 + MetricFlow 372 + 语义层 E2E 374),覆盖池子升级到 32 篇,WP 总数升级到 159 篇。详见「二·补·1 4 层语义层架构」和「决策 8 语义层选型」。

  • OLAP 引擎 4 篇:ClickHouse / Apache Doris / StarRocks / Apache Druid + Pinot 横评
  • BI 平台 4 篇:Apache Superset / Metabase / Lightdash / Evidence.dev
  • 数据集成 2 篇:Airbyte ETL / dbt-core + sqlmesh 转换
  • 数据治理 2 篇:DataHub / Trino 联邦查询
  • 数据可视化 4 篇:Apache ECharts / Plotly / Dash / next-ai-draw-io
  • AI 原生 2 篇:WrenAI / DB-GPT
  • Code-based BI 1 篇:Rill
  • Python 数据应用 1 篇:Streamlit
  • 质量 + 监控 2 篇:Great Expectations / Grafana
  • 数据合同 1 篇:Soda Core
  • 协作 BI 1 篇:Redash
  • 编排 1 篇:Apache Airflow
  • 嵌入式 OLAP 1 篇:DuckDB
  • 可视化补充 1 篇:Plotly

28 篇调研是知识,不是资产

把这 28 篇调研 拼成一张全景图 + 给技术咨询提供 可落地的选型矩阵 ——这才是 把影响力变现 的关键资产。

本文就是这张全景图。

一、为什么需要全景图?

做技术咨询时,80% 的客户问题不是 ” 选什么 ”,而是 ” 为什么选 A 不选 B”

  • � “ 我们用 ClickHouse 还是 StarRocks?”
  • ❌ “ 我们要不要上 Apache Superset?Metabase 够用吗?”
  • ❌ “ 实时数仓怎么做?需要 Lambda 架构吗?”
  • ❌ “AI Agent 怎么查数据库?用 WrenAI 还是 DB-GPT?”
  • ❌ “ 数据治理要不要做?DataHub 复杂吗?”

28 篇单独调研 答不全这些问题——客户要的是 “ 一站式全景图 + 选型决策矩阵 ”

本文给你 一张全景图 + 7 大决策矩阵 + 技术咨询变现路径

二、完整 BI 数据流水线(28 篇调研拼图)

┌──────────────────────────────────────────────────────────────────┐
│                     2026 BI 栈全景图                          │
│                28 篇调研 · 6 大维度 · 4 大场景                      │
└──────────────────────────────────────────────────────────────────┘

[事件源]                          [应用层]
   │                                   │
   ├── IoT 传感器 (ClickHouse 强)      ├── AI Demo (Streamlit + AI 原生)
   ├── App 行为 (Druid/Pinot 强)       ├── 高 QPS API (Pinot + Streamlit)
   ├── 数据库 CDC                       ├── 内部工具 (Streamlit + Dash)
   ├── SaaS API (Airbyte 拉)            ├── BI 仪表盘 (Superset/Metabase)
   └── 文件 (S3/HDFS)                   └── Chatbot (Streamlit + WrenAI/DB-GPT)
   │                                   │
   ▼                                   ▲
[摄取层]                              │
   │                                   │
   ├── Apache Druid (336)  ──► Lambda  │
   ├── Apache Pinot (336) ──► Star-Tree│
   └── Airbyte (326)      ──► ETL     │
   │                                   │
   ▼                                   │
[数据湖层]                             │
   │                                   │
   ├── Apache Iceberg (296 提过)        │
   ├── Delta Lake                       │
   └── Apache Hudi                      │
   │                                   │
   ▼                                   │
[联邦查询层]                           │
   │                                   │
   └── Trino (328)  ──► 30+ connector │
   │                                   │
   ▼                                   │
[转换层]                               │
   │                                   │
   ├── dbt-core (290)  ──► ELT         │
   └── sqlmesh (292)   ──► dbt 替代    │
   │                                   │
   ▼                                   │
[存储查询层]   ⭐ BI 栈核心       │
   │                                   │
   ├── ClickHouse (322) ──► 通用 OLAP │
   ├── Apache Doris (296) ──► MPP 数仓 │
   ├── StarRocks (332) ──► 亚秒级 MPP │
   └── DuckDB (294)    ──► 嵌入式 OLAP │
   │                                   │
   ▼                                   │
[可视化层]                             │
   │                                   │
   ├── Apache ECharts (324) ──► Web 端 │
   ├── Plotly (298) ──► Python 端    │
   ├── Dash (299)  ──► Plotly 官方 app│
   └── next-ai-draw-io (297) ──► AI 图表│
   │                                   │
   ▼                                   │
[BI 仪表盘层]                          │
   │                                   │
   ├── Apache Superset (270) ──► Apache │
   ├── Metabase (274)    ──► 易用      │
   ├── Lightdash (272)   ──► dbt 原生 │
   └── Redash (304)      ──► SQL 协作 │
   │                                   │
   ▼                                   │
[AI 原生 BI 层]   ⭐ 2026 新方向       │
   │                                   │
   ├── Evidence.dev (314) ──► BI-as-code │
   ├── WrenAI (316)     ──► GenBI 开创 │
   ├── DB-GPT (318)     ──► AI 框架    │
   └── Rill (320)       ──► 快 BI + Agent│
   │                                   │
   ▼                                   │
[数据应用层]                           │
   │                                   │
   └── Streamlit (334) ──► 数据应用 / AI demo│
   │                                   │
   ▼                                   │
[数据治理层]   ⭐ 贯穿全栈              │
   │                                   │
   ├── DataHub (330) ──► 元数据 + AI 上下文│
   ├── Great Expectations (262) ──► 质量│
   ├── Soda Core (276) ──► Data Contracts│
   └── Grafana (312) ──► 可观测性    │
   │                                   │
   ▼                                   │
[编排层]                               │
   │                                   │
   └── Apache Airflow (306) ──► 调度  │

一句话总结

从 Kafka / 数据库 (事件源)→ Druid / Pinot(实时 OLAP)或 Airbyte(ETL)→ 数据湖(Iceberg / Delta)→ Trino(联邦查询)→ dbt(转换)→ ClickHouse / Doris / StarRocks / DuckDB(存储查询)→ ECharts / Plotly / Dash(可视化)→ Superset / Metabase / Lightdash / Redash(BI 仪表盘)→ Evidence / WrenAI / DB-GPT / Rill(AI 原生 BI)→ Streamlit(数据应用)→ DataHub / Great Expectations / Soda Core / Grafana(数据治理)→ Airflow(编排)。

二·补·1、语义层 4 层架构(v2 · 2026-08-19 补丁)⭐

洞察 :业内把 ” 语义层 ” 这个筐装得太满了——dbt Labs 说 MetricFlow 是语义层,DataHub 说自己是语义层,DPROD 也说语义层,Cube.js 也说语义层。 真相是:「语义层」实际是 4 层,每个项目只做自己那一段,必须配合用。

┌──────────────────────────────────────────────────────────────────┐
│         语义层 4 层架构(v2 · 2026-08-19 补丁)│
│      L4 Governance / L3 Ontology / L2 Metric / L1 Discovery      │
└──────────────────────────────────────────────────────────────────┘

┌─ L4 Governance Layer(治理层)────────────────────────────────────┐
│  " 谁能用、怎么用、违反怎么办 "                                        │
│  • ODRL(W3C Recommendation 2.2 · 政策表达语言 · 2018-02)│
│  • Soda Core(Data Contracts · 2.4K stars · ⚠️ ELv2)│
│  • Great Expectations(质量校验 · 11K stars · Apache-2.0)│
│  • Unity Catalog(Databricks · 商业化)│
└────────────────────────────────────────────────────────────────┘
                              ▼ 描述 " 产品本体 "
┌─ L3 Ontology Layer(本体层)──────────────────────────────────────┐
│  " 这数据产品是啥,谁负责,能干啥 "                                    │
│  • DPROD(OMG · EKGF · 1.0 beta · CC BY 4.0 · 36 commits)│
│  • RDF/OWL(W3C 知识图谱基础)│
│  • Solid LWS(Tim Berners-Lee · 去中心化数据保管)│
└────────────────────────────────────────────────────────────────┘
                              ▼ 描述 " 指标怎么算 "
┌─ L2 Metric Layer(指标层)─────────────────────────────────────────┐
│  " 营收到底是多少,每个工具算出来都一样 "                               │
│  • MetricFlow(dbt Labs · Apache-2.0 ✅ · OSI 创始)│
│  • Cube.js(20K stars · Apache-2.0+MIT ✅ · 嵌入式 BI 强)│
│  • Looker(Google · 闭源商业 · L2 祖师爷)│
│  • AtScale(商业闭源 · Snowflake 深度集成)│
│  ⭐ L2 双雄:MetricFlow + Cube.js                                 │
└────────────────────────────────────────────────────────────────┘
                              ▼ 暴露 " 数据在哪里 "
┌─ L1 Discovery Layer(发现层)──────────────────────────────────────┐
│  " 数据在哪,谁有,跟我什么关系 "                                      │
│  • DataHub(LinkedIn · 12K stars · LF Data · 80+ connector)│
│  • OpenMetadata(14K stars · Apache-2.0 · MCP 原生集成)│
│  • Apache Atlas(Apache 顶级 · 老牌)│
└────────────────────────────────────────────────────────────────┘

关键判断

必须配合用:单一项目解决不了 ” 让 AI Agent 真正能查数据 ”

OSI(Open Semantic Interchange):Snowflake 牵头 16 家联盟,2025 dbt Coalesce 发起,MetricFlow + Cube 都是创始成员

4 层缺一不可:缺 L1 → 找不到数据;缺 L3 → 不知道数据产品怎么交付;缺 L2 → 同一个指标数字不一致;缺 L4 → 合规与权限失控

DPROD 的核心定位DataHub 是 ” 有什么数据 ”,DPROD 是 ” 这数据产品怎么交付 + 怎么消费 ”


二·补·2、语义层端到端实战链路(v2 · 2026-08-19 补丁)⭐

实战场景:让 AI Agent 通过 MCP 真正查 ” 上个季度华东区客户复购率 ”
35 分钟 Docker Compose 一键起 4 容器

┌──────────────────────────────────────────────────────────────────┐
│       语义层 E2E 实战链路(v2 · 2026-08-19 补丁)│
│            AI Agent → MCP → L1/L3/L2 → 数据仓库 → 返回            │
└──────────────────────────────────────────────────────────────────┘

[1] 🤖 AI Agent(Claude / Cursor / 自研)│
        │ 问题:" 上个季度华东区客户复购率是多少?"
        ▼
[2] 🔌 MCP 适配层(JSON-RPC 2.0 协议)│
        ├─→ OpenMetadata MCP Server(查 catalog 入口)├─→ MetricFlow GraphQL API(查 metric SQL)└─→ ODRL Validator(合规校验)▼
[3] 4 层语义层协作
        │
        ├─ L1 OpenMetadata → 找到 " 客户复购率 " 这个 Data Product
        ├─ L3 DPROD → 拿到 Data Product 的 Owner / SLA / 接口
        └─ L2 MetricFlow + Cube.js → 编译 SQL 查 4 个方言
        ▼
[4] 数据仓库执行 SQL
        │
        ├─ PostgreSQL 16(演示用)├─ Snowflake
        ├─ BigQuery
        └─ Databricks
        ▼
[5] 🎁 返回 AI Agent
        │
        └─ 数值 + DPROD 元数据 + Cube.js 嵌入可视化

实战清单

资源 最低 推荐
CPU 4 核 8 核
内存 8 GB 16 GB(4 个 Docker 容器并行)
Docker 20.10+ 24+
总耗时 60 分钟 35 分钟

4 容器清单

postgres:16-alpine —— 数据仓库(演示)

openmetadata/server:1.5 —— L1 Discovery(含 MCP Server)

dbt-labs/dbt-semantic-layer:latest —— L2 MetricFlow(GraphQL API: 8080)

cubejs/cube:latest —— L2 Cube.js(REST API: 4000 / Playground: 3001)

完整实战《语义层端到端实战》?p=374


三、8 大决策矩阵(v2 升级:从 7 大 → 8 大,新增决策 8 语义层选型)

决策 1:OLAP 引擎怎么选?

你的场景 推荐 WP 实测 stars
极致单表聚合 + 时序数据 + IoT ClickHouse 322 49,269
Apache 顶级 + 中文社区 + 简单运维 + 完整生态 Apache Doris 296 ~30K
湖仓原生 + 多表 JOIN + MySQL 兼容 + 高并发点查 StarRocks 332 12,013
事件流式 + Lambda 架构 + 批流一体 Apache Druid 336 14,042
用户导向实时分析 + 高 QPS API + Star-Tree Apache Pinot 336 6,121
本地 Python / 数据科学 / 单机分析 / 嵌入式 DuckDB 294 ~24K

决策原则

数据量 TB 级 → ClickHouse / Doris / StarRocks

数据量 PB 级 + 数据湖 → StarRocks / Trino + Iceberg

事件流式 → Druid / Pinot

嵌入式 / 单机 → DuckDB

决策 2:BI 仪表盘怎么选?

你的场景 推荐 WP 实测 stars
Apache 顶级 + 自托管 + Druid 原生 Apache Superset 270 ~60K
易用 + 自托管 + 团队协作 Metabase 274 ~42K
dbt 原生 + 现代化 UI + 商业化 Lightdash 272 ~3K
SQL 协作 + 自托管 + 轻量 Redash 304 ~28K
BI-as-code + 静态站点 + Markdown Evidence.dev 314 ~7K

决策原则

Druid / Pinot 用户 → Apache Superset(原生集成)

dbt 用户 → Lightdash(dbt 原生集成)

团队小白用户 → Metabase(最易用)

BI-as-code(程序员向)→ Evidence.dev

轻量 + 自托管 + SQL → Redash

决策 3:数据集成 / ETL 怎么选?

你的场景 推荐 WP 实测 stars
快速 + 自托管 + 连接器最全 + 想加自定义 Airbyte 326 21,902
Python 数据应用 + 嵌入式 ETL + 不想上 Docker dlt ~3K
老牌 + Singer 规范 + 自定义 ETL + Python 重度 Meltano ~3K
商业 SaaS + 不想运维 Fivetran(闭源)
预算紧 + 商业 SaaS Stitch(闭源)

决策原则

连接器 > 5 + 自托管 + 自定义 → Airbyte

Python 进程内 + 不想上 Docker → dlt

完全开源 + 自定义 ETL → Meltano

商业 + 不想运维 → Fivetran

决策 4:数据转换怎么选?

你的场景 推荐 WP 实测 stars
行业标准 + dbt 原生 + Apache-2.0 dbt-core 290 ~9K
dbt 替代品 + Linux Foundation 接管 + 增量更新 sqlmesh 292 ~3K

决策原则

标准选型 + 团队熟悉 dbt → dbt-core

增量更新 + dbt 太慢 + 想换 → sqlmesh

决策 5:数据可视化怎么选?

你的场景 推荐 WP 实测 stars
国内项目 + 中文文档 + Dashboard + 地理可视化 Apache ECharts 324 67,081 ⭐池子最高
科学计算 + Jupyter + 学术 Plotly.js / Dash 298/299 18K / 21K
Python 数据应用 + 不写 JS Dash 299 21K
国内 + 蚂蚁生态 / 关系图谱(最强 G6) AntV ~20K
底层自定义 / 数据驱动文档 / 极致灵活 D3.js ~110K
极简 / 快速原型 / 移动端 H5 Chart.js ~65K

决策原则

国内项目ECharts(默认)

Python 科学家 → Dash / Plotly

关系图 → AntV (G6)

底层自定义 → D3.js

决策 6:数据治理怎么选?

你的场景 推荐 WP 实测 stars
生产级 + 80+ connector + column-level 血缘 + AI Context DataHub 330 12,534
快速上手 + 简化部署 + 现代 UI OpenMetadata ~5K
Databricks 生态 + Unity Catalog 集成 Unity Catalog(闭源)
Hadoop 生态 + Atlas + Ranger 集成 Apache Atlas ~1.9K
图数据库血缘 + Lyft 风格 Amundsen ~4.5K
dbt 可观测性 Elementary ~1.7K
数据质量校验 Great Expectations 262 ~10K
Data Contracts Soda Core 276 ~2.4K

决策原则

生产级 + 80+ connector + AI ContextDataHub


Apache 生态 → Apache Atlas

Databricks 生态 → Unity Catalog

快速上手 → OpenMetadata

质量校验 → Great Expectations

Data Contracts → Soda Core

决策 7:AI 原生数据应用怎么选?

你的场景 推荐 WP 实测 stars
自然语言问数据 + GenBI 开创者 + 语义层 WrenAI 316 ~17K
AI 原生数据应用框架 + Multi-Agents + 私有化 DB-GPT 318 ~20K
BI-as-code + SQL+MD+MCP + 静态站点 Evidence.dev 314 ~7K
快 BI + Agent + Go + DuckDB + SvelteKit Rill 320 ~3K
AI demo + HuggingFace Spaces + 极简 API Gradio ~10K
数据应用 + 自动重载 + AI chat 原生 + 7 年沉淀 Streamlit 334 45,555

决策原则

自然语言问数据WrenAI


AI 数据应用框架 + 私有化DB-GPT


BI-as-code + 程序员向Evidence.dev


快 BI + AgentRill


ML 模型 demo → Gradio

Python 数据应用 + AI chatStreamlit

决策 8:语义层怎么选?(v2 · 2026-08-19 补丁·L1-L4 全栈)⭐

决策 8 是 v2 新增的决策矩阵,对应 4 层语义层架构。每个场景需要选择 L1 / L3 / L2 三层组合。

你的场景 L1 Discovery L3 Ontology L2 Metric 备注
Apache 顶级 + 80+ connector + 11 年沉淀 DataHub DPROD MetricFlow LF Data 全治理组合
MCP 原生 + 14K stars + 现代 UI OpenMetadata DPROD MetricFlow 最强 AI 集成
嵌入式 BI + React 组件 + for AI DataHub DPROD Cube.js BI 前端一体
最小起步(单机可起) DataHub(社区版) DPROD(规范) Cube.js 个人 / 小团队
商业一站式 Unity Catalog Unity Catalog AtScale Databricks 用户
老牌 Hadoop 生态 Apache Atlas RDF/OWL Looker 传统企业

决策原则

AI Agent 优先 → OpenMetadata + DPROD + MetricFlow(MCP 集成最强

BI 前端 + 嵌入式 → DataHub + DPROD + Cube.js( 前端组件库最丰富

Databricks 用户 → Unity Catalog + AtScale( 一站式商业方案

个人 / 小团队 → DataHub(社区版)+ Cube.js( 单机可起

决策 8·细分 · L2 双雄选谁?(MetricFlow vs Cube.js)

维度 MetricFlow Cube.js
License Apache-2.0 ✅(0.209+) Apache-2.0 + MIT ✅ 双协议
学习曲线 中(要会 dbt) 中(JS/TS 友好)
AI 友好度 中(OSI 推动中) 高(README 第一句话:for AI)
嵌入式 BI 弱(仅 GraphQL) 强(React 组件库)
dbt 生态 强(dbt Labs 同一团队)
JS/TS 生态 强(10,710 commits)
OSI 联盟 创始成员 创始成员
可视化内置 有(Cube.js Playground)

关键判断

数据团队首选MetricFlow(dbt 原生,跟 dbt-core 是同一团队,Apache-2.0)

前端团队 / 嵌入式 BICube.js(TS 生态,React 组件库,Playground 开箱即用)

AI Agent 场景 → 两个都行(都是 OSI 创始成员,都支持 MCP)


四、技术咨询变现路径 ⭐ 实战

核心洞察 :28 篇调研是 技术品牌资产——技术咨询客户最关心的不是 ” 你用什么工具 ”,而是 ” 你懂不懂技术选型 ”。

变现路径 4 步

1. 内容营销(已经在做)

  • 持续产出深度向调研(每周 1-2 篇)→ 建立 ” 技术大牛 ” 人设
  • 公众号 / 知乎同步 → 扩大影响力
  • GEO 优化 → 让 AI 搜索引擎(Perplexity / Claude)推荐该调研

2. 免费咨询 → 高客单价项目

免费咨询(1 小时)↓
识别客户痛点(" 用 ClickHouse 还是 StarRocks?")↓
推荐深度向调研文章(精准命中)↓
客户建立信任(" 这位懂技术 ")↓
高客单价项目(5-50 万)

关键 :每次客户问技术选型问题, 先发对应的调研文章 + 解释 ” 为什么选 A 不选 B”。

3. 案例沉淀(最关键)

每做完一个项目 → 写 复盘文章(不要写技术细节,写 ” 我们遇到了什么问题 + 最终选了什么 + 为什么 ”):

  • “ 某电商公司 OLAP 选型:从 ClickHouse 到 StarRocks 的踩坑实录 ”
  • “ 某金融机构数据治理:从 Excel 到 DataHub 的 6 个月 ”
  • “ 某 AI 公司数据栈:Trino + Iceberg + StarRocks 三件套落地 ”

这些案例文章 = 技术品牌的最高价值资产

4. 培训 / 咨询包

高客单价技术咨询包(5-20 万):

  • 数据栈选型咨询(1-2 周)
  • 数据治理落地咨询(4-8 周)
  • AI Agent + 数据集成咨询(4-12 周)

每包都有 28 篇调研作为 参考资产 支撑。

五、AI Stack 新方向 ⭐ 2026+ 重点

2026 年 BI 栈的 最大变化 AI Agent 跟数据栈深度融合

方向 代表项目 WP 关键能力
AI 原生 BI WrenAI (316) / DB-GPT (318) / Evidence (314) / Rill (320) 8/15 自然语言查数据 / BI-as-code / 快 BI + Agent
AI 数据集成 Airbyte Agents (326) 326 600+ 数据源变 LLM tools
AI 数据上下文 DataHub Context Platform (330) 330 元数据 + 血缘 + AI Context
AI 数据应用 Streamlit + chat_message (334) 334 LLM Chatbot 10 分钟

AI Agent 跟数据栈的 3 层关系

┌─────────────────────────────────────────────┐
│  Layer 3 · AI 数据上下文(DataHub 330)│
│           给 LLM 提供正确表 / 列 / 质量分     │
├─────────────────────────────────────────────┤
│  Layer 2 · AI 数据集成(Airbyte Agents 326)│
│           让 LLM 主动拉业务数据(CRM / 订单)│
├─────────────────────────────────────────────┤
│  Layer 1 · AI 数据应用(Streamlit 334)│
│           LLM Chatbot / RAG / Agent demo      │
└─────────────────────────────────────────────┘

AI 技术咨询的黄金组合

Streamlit (334) 提供 AI 应用前端

Airbyte Agents (326) 提供数据拉取

DataHub (330) 提供数据上下文

WrenAI / DB-GPT (316/318) 提供 GenBI 查询

六、2026+ 趋势预测

趋势 1:湖仓一体成主流(2026-2028)

  • Apache Iceberg / Delta Lake 成为事实标准
  • StarRocks / Trino + Iceberg 是湖仓查询黄金组合
  • Doris / ClickHouse 也跟进湖仓集成

趋势 2:AI Agent 原生集成(2026+)

  • 每个数据栈组件都在加 MCP / Agent 集成
  • Airbyte Agents / DataHub Context / Streamlit chat 是先行者
  • 2027+ 预计所有 BI 工具都有 AI 原生界面

趋势 3:实时 OLAP + AI 推理结合(2026-2027)

  • Druid / Pinot + LLM 实时查询增强
  • 流式 SQL(Materialize / Flink)成为 AI 推理的数据层

趋势 4:Apache 治理成为主流(持续)

  • LF Data 治理项目(Trino / DataHub / StarRocks)越来越多
  • 商业 License(ELv2 / BSL)虽然能赚钱但被开源社区警惕

趋势 5:国产数据栈崛起(持续)

  • Apache Doris / StarRocks / DB-GPT 主导国内市场
  • 国内客户 首推 这 3 个 + ECharts

七、行动清单 ⭐ 立即执行

立即(本周)

  • [] 把 28 篇调研整理成 1 张可下载全景图(PNG / PDF)
  • [] 公众号 / 知乎 / CSDN 同步发布全景图文章
  • [] 给 5-10 个老客户发全景图 + 收集反馈

短期(本月)

  • [] 写 3 个客户案例复盘(已有项目)
  • [] 设计 3 个技术咨询包(5/10/20 万)
  • [] GEO 优化(让 AI 搜索引擎推荐该调研)

中期(3 个月)

  • [] 持续产出调研(每周 1-2 篇)→ 池子剩余 13 个项目
  • [] 案例 → 培训 → 课程的转化路径
  • [] 行业垂直研究(金融 / 电商 / 制造)

七·补、8 月补丁更新清单(v2 · 2026-08-19)⭐

本次新增调研 4 篇(v1 → v2 增量)

# 项目 WP 调研日期 核心定位 License
1 DPROD ?p=368 2026-08-18 L3 Ontology · OMG · Data Product 本体 CC BY 4.0
2 语义层四层模型 ?p=370 2026-08-19 L1-L4 全拆 + OSI + 横评
3 MetricFlow ?p=372 2026-08-19 L2 Metric · dbt Labs · OSI 创始 Apache-2.0 ✅
4 语义层端到端实战 ?p=374 2026-08-19 4 容器 E2E + MCP + 35 分钟跑通

数据治理赛道全套(v2 体系化)

# 项目 WP 赛道 License
1 DataHub(330 L1 Discovery Apache-2.0 ✅
2 OpenMetadata(366 L1 Discovery Apache-2.0 ✅
3 OpenLineage(358 L4 血缘标准 Apache-2.0 ✅
4 Marquez(360 L4 血缘后端 Apache-2.0 ✅
5 DPROD(368 L3 Ontology CC BY 4.0
6 语义层四层(370 横评
7 MetricFlow(372 L2 Metric Apache-2.0 ✅
8 语义层 E2E(374 实战

v2 关键升级(全景图 338 → 338 v2)

维度 v1(2026-08-16) v2(2026-08-19) 变化
WP 总数 142 159 +17(8 月新增 17 篇)
覆盖池子 28 32 +4(语义层 4 篇)
决策矩阵 7 大 8 大 +1(决策 8 语义层选型)
架构图 流水线 ASCII + 4 层语义层 + E2E 链路 +2 张图
AI Stack 3 层关系 升级到 4 层语义层 OSI 标准联盟

行动清单更新(v1 → v2)

  • [] 本周:把 v2 全景图 PDF 重新生成(含 4 层语义层 + E2E 链路图)
  • [] 本周:把 4 篇语义层新文(368/370/372/374)交叉链接到全景图
  • [] 下月:Cube.js 实战向(L2 双雄另一角,30 天内)
  • [] Q3:OSI 跟进文(规范稳定后发)
  • [] Q3:录制 35 分钟实战视频(Docker + 4 容器,给客户培训用)

一句话总结 v2 增量

v1 是 28 篇调研拼图 → v2 是 32 篇调研 + 4 层语义层架构 + E2E 实战链路

让客户 5 分钟看清 BI 数据栈 + 让 AI Agent 真正能查数据 = 技术咨询变现的两大核心资产。


八、总结

28 篇调研不是终点,是 技术咨询的起点

这张全景图的价值

客户角度 → 一站式看清 BI 数据栈全景

全景图角度 → 把知识转化为可变现的技术咨询资产

行业角度 → 沉淀个人技术品牌

3 个最关键的资产

  1. 这张全景图 :28 篇调研拼成 1 张图——客户看到的是对 BI 数据栈的 整体掌控力
  2. 决策矩阵 :7/8 大决策场景——客户看到的是 实战选型经验
  3. 案例复盘 :未来 3 个月最关键的产出——客户看到的是 真实落地能力

1 句建议

把 28 篇调研从 ” 文章 ” 变成 ” 资产 ”——全景图是入口,决策矩阵是工具,案例复盘是信任。

技术咨询的终极形态:用这张全景图让客户 5 分钟看懂 BI 数据栈全貌 → 用决策矩阵让客户知道为什么选 A 不选 B → 用案例复盘让客户建立 ” 这位懂技术 ” 的信任 → 接到 5-50 万的高客单价项目。

BI 栈全景图系列收官文到此结束——但 BI 技术品牌建设才刚刚开始。


参考

  • v2 调研文章清单(32 篇 · 2026-08-19 更新)(按调研顺序):
# 项目 WP 实测 stars 协议
1 ClickHouse 322 49,269 Apache-2.0 ✅
2 Apache ECharts 324 67,081 Apache-2.0 ✅
3 Airbyte 326 21,902 NOASSERTION ⚠️
4 Trino 328 13,148 Apache-2.0 ✅ + LF
5 DataHub 330 12,534 Apache-2.0 ✅ + LF Data
6 StarRocks 332 12,013 Apache-2.0 ✅ + LF 2024
7 Streamlit 334 45,555 Apache-2.0 ✅ + Snowflake
8 Druid + Pinot 横评 336 14K + 6K Apache-2.0 ✅ + Apache 2018
9 全景图收官文(本篇)v2 338
v2 增量
10 DPROD 368 36 commits CC BY 4.0
11 语义层四层模型横评 370
12 MetricFlow 372 Apache-2.0 ✅
13 语义层端到端实战 374

加上历史 19 篇(270/272/274/276/282/290/292/294/296/297/298/299/304/306/262/312/314/316/318/320/340/342/344/346/348/350/352/354/356/358/360/362/364/366),WP 总数 159 篇(v1 142 → v2 159)。

  • bi-research-pool 调研池/home/east/.openclaw/workspace-yunying/bi-research-pool.md
  • MEMORY 工作记录/home/east/.openclaw/workspace-yunying/MEMORY.md
  • BI 栈系列:全部在 https://east196.cn 上按 ID 查询

后续行动

  1. 下载全景图 → 公众号同步
  2. 客户案例复盘 → 5 个客户项目写案例
  3. 技术咨询包 → 5/10/20 万定价
  4. GEO 优化 → 让 AI 推荐该调研

BI 栈系列 收官,但不结束——继续产出案例 + 调研 + 培训 = 高客单价技术咨询的核心资产。

正文完