
一个从 ” 漂亮的折线图工具 ” 长成 ” 开源可观测性平台 ” 的项目。2014 年 Torkel Ödegaard 开源、2020 年收购 Redash、2021 年切 AGPL-3.0, 跟 Prometheus / Loki / Tempo / Pyroscope / Mimir 组成 LGTM+ 栈, 是当前 事实标准的开源可观测性平台。
写在前面
2014 年, 一个瑞典开发者在 Kibana 之外, 做了一个更轻量、更美观的折线图工具——Grafana。
当时它的定位很窄:“ 把 Prometheus / InfluxDB 的数据画成好看的图 ”。
12 年后, 这个项目长成了 76K stars 的庞然大物——覆盖了 指标、日志、追踪、剖析、前端 RUM 五大可观测性维度, 并形成了完整的开源产品家族:
- Grafana —— 可视化层(Dashboard / Explore)
- Loki —— 日志聚合(类 ELK, 但更轻量)
- Tempo —— 分布式追踪(OpenTelemetry 兼容)
- Pyroscope —— 持续剖析(Continuous Profiling)
- Mimir —— 指标后端(Prometheus 远程存储)
- Grafana Faro —— 前端 RUM
- k6 —— 负载测试(2023 年收购)
- Redash —— SQL 协作 BI(2020 年收购,2026 年并入 Grafana)
更戏剧性的是:2021 年 Grafana 把核心代码从 Apache-2.0 切换到 AGPL-3.0, 引发社区激烈争议——这是开源商业化历史上最具标志性的事件之一。
而对飞熊读者群来说,Grafana 跟 Redash 是同一棵树上的两个分支 ——上期调研的 Redash(304 篇) 现在已经是 Grafana 的一部分, 这篇调研就是这个故事的 ” 另一半 ”。
一、它解决什么问题
一句话卖点: 开源可观测性平台——从 Dashboard 到完整 LGTM+ 栈,2026 年事实标准的 ” 云原生监控全家桶 ”。
| 维度 | 信息 |
|---|---|
| 项目名 | Grafana |
| 创始人 | Torkel Ödegaard(瑞典,2014 年开源) |
| 公司 | Grafana Labs(2014 年成立,YC S14) |
| 核心仓库 | grafana/grafana |
| Stars | 76,282(比 Superset 74K 高, 跟 Kubernetes 100K+ 同一量级) |
| Forks | 14,566 |
| License | AGPL-3.0(⚠️ 2021/04 从 Apache-2.0 切换) |
| 主语言 | TypeScript 46M + Go 43M + PLpgSQL + CUE |
| 创建时间 | 2013-12-11(12 年常青树) |
| 最近 Push | 2026-08-13(今天, 极度活跃) |
| Open Issues | 3,368(健康, 符合规模) |
| Subscribers | 1,327 |
| 代码量 | 1.9 GB(~191 万 KB, 超大项目) |
| 全家桶 | Loki + Tempo + Pyroscope + Mimir + Faro + k6 + Redash |
| 官网 | https://grafana.com/ |
| 在线 Demo | https://play.grafana.org/ |
二、核心能力 1: 可视化 + 数据源生态
2.1 一切都是 Panel
Grafana 的核心抽象是 Dashboard = N 个 Panel:
- Timeseries Panel —— 折线图、面积图(最常用,Prometheus / InfluxDB 标准可视化)
- Stat / Gauge —— 单一大数字(KPI / 当前值)
- Bar / Pie / Histogram —— 柱状 / 饼图 / 直方图
- Geomap —— 地图(原生支持)
- Heatmap —— 热力图(性能分析常用)
- Table —— 表格
- Markdown / Text —— 文档面板
- Node Graph —— 节点图(服务依赖)
- 插件扩展 —— 社区 150+ 面板(Sankey / Candlestick / Plotly / ECharts 等)
vs Kibana:Grafana 的可视化更 ” 轻 ”,Kibana 更 ” 全 ”。Grafana 是 可视化之王,Kibana 是ELK 全栈套件。
2.2 150+ 数据源支持
Grafana 的 ” 数据源插件 ” 系统是它的护城河之一:
| 类别 | 代表数据源 |
|---|---|
| 时序数据库 | Prometheus / InfluxDB / TimescaleDB / VictoriaMetrics / Mimir |
| 日志 | Loki / Elasticsearch / Splunk |
| 追踪 | Tempo / Jaeger / Zipkin |
| 云厂商 | AWS CloudWatch / Azure Monitor / Google Cloud Monitoring |
| 数据库 | PostgreSQL / MySQL / MSSQL / Oracle / ClickHouse / Doris |
| 大数据 | BigQuery / Snowflake / Redshift / Databricks |
| 监控 SaaS | Datadog / New Relic / Honeycomb / Dynatrace |
| 物联网 | MQTT / InfluxDB / Timescale |
| 其他 | Graphite / OpenTSDB / TestData |
对比 Superset:Superset 数据源 50+,Grafana 数据源 150+——Grafana 是 ” 数据源覆盖最广的可视化工具 ”。
2.3 探索模式(Explore Mode)
除 Dashboard 外,Grafana 提供 Explore 模式——类似 Redash 的 SQL 编辑器:
- 直接对一个数据源写查询(QL / SQL / PromQL / LogQL)
- 实时看结果, 无需保存 Dashboard
- 适合排查问题时 ” 随手查一下 ”
这就是 Redash 整合进 Grafana 后的形态(2026 年,Grafana 11+ 内置 Explore + SQL 数据源)。
2.4 变量 + 模板 + Dashboard 复用
# 在 Dashboard 顶部设变量:$region, $instance
# Panel 查询里引用:up{region="$region", instance="$instance"}
# → 一个 Dashboard 服务多个 region, 顶部切换
实战价值: 同一个 ” 服务监控模板 ” 复用到 100 个 region, 无需复制 100 份 Dashboard。
2.5 告警(Alerting)
Grafana 9+ 内置告警系统(从 Prometheus Alertmanager 演化):
- 在 Panel 上点 “Create alert rule” → 选阈值 / 条件 / 评估间隔
- 通知渠道:Email / Slack / PagerDuty / Webhook / OpsGenie / VictorOps
- 告警分组 / 静默 / 升级路径
对比 Metabase:Metabase 告警较弱,Grafana 告警是企业级标准。
三、核心能力 2:Grafana 全家桶(LGTM+ Stack)
2020 年后,Grafana Labs 不再只做可视化, 而是 全家桶战略:
3.1 LGTM+ 栈
| 组件 | 用途 | 类比 |
|---|---|---|
| Loki | 日志聚合(类 ELK, 但更轻) | Elasticsearch 替代 |
| Grafana | 可视化 + 告警 | Kibana 替代 |
| Tempo | 分布式追踪 | Jaeger 替代 |
| Pyroscope | 持续剖析(CPU/ 内存火焰图) | (无主流开源替代) |
| Mimir | Prometheus 远程存储 | (Prometheus 自身) |
| Faro | 前端 RUM(Web Vitals / 错误监控) | Datadog RUM 替代 |
| k6 | 负载测试 | JMeter 替代 |
| Beyla | eBPF 自动埋点 | (无替代) |
核心思想:“ 一个 Dashboard 看一切 ”——指标、日志、追踪、剖析, 数据自动关联, 排查问题时一键跳转。
3.2 全家桶关键特性
Loki(日志)
- 设计哲学:”Prometheus for logs”——只索引标签, 不索引全文
- 存储成本 : 同等规模比 Elasticsearch 低 5-10 倍
- 查询语言:LogQL(类 PromQL)
- 适用:K8s 云原生场景;ES 仍是全文搜索首选
Tempo(追踪)
- OpenTelemetry 原生兼容
- 对象存储后端:S3 / GCS / MinIO, 存储成本极低
- Trace 关联: 从日志 / 指标一键跳到 Trace
Pyroscope(剖析)
- 持续剖析(Continuous Profiling):always-on 模式采集 CPU/ 内存火焰图
- 存储成本: 采样 + 压缩, 可承担生产负载
- 集成:
pyroscope connect一行集成 Go / Python / Rust / Java / Node.js
Mimir(指标)
- Prometheus 远程存储 的 ” 无限横向扩展 ” 版
- 多租户 + 降采样 + 长期存储
- 从单 Prometheus → 集群 Mimir, 运维 Prometheus 不再头疼
3.3 Grafana Cloud(商业产品)
Grafana Labs 同时提供 SaaS 服务:
- 免费层:3 用户 + 10K metrics + 50GB logs + 50GB traces
- Pro 层($8/ 月起): 无限用户 + 100K metrics
- 企业级:SLA / 合规(FedRAMP / SOC2 / GDPR)
- AI 助手:Grafana Assistant(2026 新发布, 基于 LLM 的可观测性 Copilot)
四、收购 Redash 的故事
2020 年 11 月,Grafana Labs 收购了 Redash(本文 304 篇调研的那个项目)——这是一个很有教育意义的开源收购案例:
4.1 收购动机
| 维度 | Grafana | Redash |
|---|---|---|
| 强项 | 时序数据 + 监控 | SQL 数据 + BI |
| 弱项 | SQL/ 数据库可视化弱 | 时序 / 监控弱 |
| 用户群 | SRE / DevOps | 数据分析师 / 产品 |
收购让两家 互补拼图——Grafana 补齐 SQL/BI 短板,Redash 拿到商业级工程团队。
4.2 收购后的变化
- ✅ 保留开源:Redash 仍是 BSD-2-Clause(Grafana 没污染它的 license)
- ✅ 代码继续维护: 但节奏放缓, 主要在 Grafana 11 内整合 Explore + SQL 数据源
- ⚠️ 新功能有限 :Redash 项目活跃度下降, 主线在 Grafana 内
- ✅ 数据互通:Redash query 可作为 Grafana 数据源
4.3 2021 年 License 切换
2021 年 4 月,Grafana Labs 把 Grafana 从 Apache-2.0 切换到 AGPL-3.0——这是 Grafana 历史上最具争议的事件:
| 立场 | 观点 |
|---|---|
| 支持方 | “Grafana Cloud 跟开源自托管竞争,AGPL 阻止 AWS/GCP 转售 Grafana 不回馈 ” |
| 反对方 | “ 社区贡献者被迫切 license, 违反 Apache 协议, 引发 fork(比如 Grafana fork)风险 ” |
| 结果 | AGPL-3.0 稳定下来,Redash 保持 BSD-2-Clause(独立),商业化 + 开源平衡 |
对飞熊读者启示 :AGPL-3.0 在中国大陆 / 商业 SaaS 场景需要法务评估—— 修改 Grafana 内核 + 提供 SaaS 必须开源。
五、对比 Superset / Metabase / Datadog / Kibana
| 维度 | Grafana | Apache Superset | Metabase | Kibana | Datadog |
|---|---|---|---|---|---|
| Stars | 76K | 74K | 48K | 闭源(Elastic) | 闭源 |
| License | AGPL-3.0 | Apache-2.0 | AGPL-3.0 | Elastic License | 商业 |
| 定位 | 可观测性平台 | 企业 BI 平台 | 自助 BI | ELK 全栈 | SaaS 监控 |
| 核心数据源 | 时序 + 日志 + 追踪 | SQL 数据库 | SQL 数据库 | Elasticsearch | 多源 |
| 数据源数 | 150+ | 50+ | 25+ | 仅 ES | 多源 |
| 可视化丰富度 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ |
| 告警 | ⭐⭐⭐⭐⭐(内置) | ⭐⭐⭐(3.0+) | ⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ |
| LGTM 全家桶 | ✅ | ❌ | ❌ | ✅ 部分 | ❌ |
| AI 助手 | ✅ Grafana Assistant | ❌ | ✅ | ✅ | ✅ |
| 企业级 | ⭐⭐⭐⭐⭐(FedRAMP) | ⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ |
| 学习曲线 | ⭐⭐⭐(中) | ⭐⭐⭐(中) | ⭐(低) | ⭐⭐⭐(中) | ⭐(低) |
结论:
- 选 Grafana:SRE / DevOps 团队、需可观测性全家桶、想统一指标 + 日志 + 追踪
- 选 Superset: 数据分析师、企业 BI、需要丰富图表
- 选 Metabase: 非技术用户、拖拽式 BI、SQL 弱
- 选 Kibana: 已经在用 ELK 日志栈
- 选 Datadog: 不差钱、要 SaaS、零运维
六、实战:3 步跑通
6.1 Docker Compose 启动
mkdir grafana-quickstart && cd grafana-quickstart
cat > docker-compose.yml <<EOF
version: '3'
services:
grafana:
image: grafana/grafana:latest
ports:
- "3000:3000"
environment:
- GF_SECURITY_ADMIN_PASSWORD=admin
EOF
docker-compose up -d
# 访问 http://localhost:3000(默认账号 admin / admin)
6.2 接 Prometheus 数据源
# 1. 起一个 Prometheus demo
docker run -d -p 9090:9090 prom/prometheus
# 2. Grafana → Configuration → Data Sources → Add Prometheus
# URL: http://host.docker.internal:9090
# 3. Save & Test → 应该显示 "Data source is working"
6.3 创建第一个 Dashboard(PromQL 示例)
- 新建 Dashboard → “Add visualization” → Timeseries
- 写 PromQL 查询:
promql
rate(node_cpu_seconds_total{mode="system"}[5m]) - 保存 → Dashboard URL:
http://localhost:3000/d/<id> - 告警:Panel → “Create alert rule” → 设阈值 > 0.8 → 通知渠道 Email
完整流程从空白到可视化:30 分钟以内。
6.4 进阶: 接 Loki / Tempo
# docker-compose.yml 加 Loki 和 Tempo
services:
loki:
image: grafana/loki:latest
ports: ["3100:3100"]
tempo:
image: grafana/tempo:latest
ports: ["3200:3200"]
grafana-agent:
image: grafana/agent:latest
# 配置收集日志 / 指标 / 追踪到 Loki/Tempo/Mimir
Grafana Agent 自动收集, 一个 Dashboard 同时展示指标 + 日志 + 追踪。
七、风险与坑
| 风险 | 说明 | 缓解 |
|---|---|---|
| AGPL-3.0 强 copyleft | 修改 Grafana 内核 + 提供 SaaS 必须开源 | 自用 OK; 商业 SaaS 需法务评估; 或用 Grafana Cloud 官方 |
| 插件兼容 | 部分社区插件升级 Grafana 后失效 | 用官方插件或固定版本 |
| 配置复杂度 | 150+ 数据源 × 多组件 → 配置爆炸 | 走 Grafana Cloud 一键起; 或跟全家桶打包走 |
| 迁移到 Loki 成本 | 已用 ELK 的团队迁到 Loki 需要重写 LogQL | LogQL ≈ PromQL, 学习曲线尚可 |
| 全家桶 vs 单体取舍 | 全家桶虽强, 但运维负担大(5+ 组件) | 中小团队: 只装 Grafana + Prometheus + Loki 三个 |
| 商业版 Gems 诱人 | 部分高级功能 (LDAP / 审计 / SAML) 需要企业版 | 开源版覆盖 90%; 商业版按年付 |
| 大项目 issue 堆积 | 3,368 open issues, 部分功能响应慢 | 优先用 stable 标签的功能; 企业版有支持 |
八、总结
Grafana 最适合的三个场景:
- SRE / DevOps 团队的可观测性平台 —— 指标 + 日志 + 追踪 + 剖析, 一个 Dashboard 看一切
- 云原生 / K8s 环境监控 —— Prometheus + Loki + Tempo + Pyroscope 是 K8s 上的事实标准
- 企业内部 ” 统一可视化层 ” —— 接 150+ 数据源, 替公司整合各种工具
一句话建议:
如果你是 SRE / DevOps / 平台工程师,Grafana 全家桶是 2026 年的事实标准; 如果你是数据分析师做 BI, 看 Superset/Metabase; 如果只是简单监控,Prometheus + Grafana 就够了。
先试一周:docker run grafana/grafana → 接 Prometheus → 创建 3 个核心指标 Dashboard → 设 1 个告警 → 集成 Loki 看日志。这周你会决定 Grafana 是不是你团队 ” 可观测性的标准答案 ”。
对飞熊读者启示:Redash 是 Grafana 故事的 ”SQL 协作 BI” 那一半;Grafana 是 ” 可观测性 + 监控 ” 这一半——两个项目 + 一家公司 = 一个完整的 ” 开源数据基础设施 ” 版图。
参考
- grafana/grafana — GitHub 仓库(76K stars)
- Grafana 官网 — 官方主页
- Grafana 文档 — 完整文档
- Grafana 全家桶 — Loki / Tempo / Mimir / Pyroscope / Faro
- Grafana 收购 Redash — 2020 年收购公告
- License 切换 — 2021 AGPL-3.0 切换公告
- Redash 调研(304) — 飞熊的 Redash 调研(Grafana 收购方)
- Apache Superset 调研(270) — BI 对比
- Metabase 调研(274) — BI 对比
- Apache Airflow 调研(306) — 数据编排(Grafana 生态补完)
研究文档(引用来源参考)
(no reference document available)