Grafana 调研:76K Stars 的开源可视化之王,从 Dashboard 到 LGTM 全家桶,12 年重新定义”可观测性”

48次阅读
Grafana 调研:76K Stars 的开源可视化之王, 从 Dashboard 到 LGTM 全家桶,12 年重新定义

一个从 ” 漂亮的折线图工具 ” 长成 ” 开源可观测性平台 ” 的项目。2014 年 Torkel Ödegaard 开源、2020 年收购 Redash、2021 年切 AGPL-3.0, 跟 Prometheus / Loki / Tempo / Pyroscope / Mimir 组成 LGTM+ 栈, 是当前 事实标准的开源可观测性平台

写在前面

2014 年, 一个瑞典开发者在 Kibana 之外, 做了一个更轻量、更美观的折线图工具——Grafana

当时它的定位很窄:“ 把 Prometheus / InfluxDB 的数据画成好看的图 ”

12 年后, 这个项目长成了 76K stars 的庞然大物——覆盖了 指标、日志、追踪、剖析、前端 RUM 五大可观测性维度, 并形成了完整的开源产品家族:

  • Grafana —— 可视化层(Dashboard / Explore)
  • Loki —— 日志聚合(类 ELK, 但更轻量)
  • Tempo —— 分布式追踪(OpenTelemetry 兼容)
  • Pyroscope —— 持续剖析(Continuous Profiling)
  • Mimir —— 指标后端(Prometheus 远程存储)
  • Grafana Faro —— 前端 RUM
  • k6 —— 负载测试(2023 年收购)
  • Redash —— SQL 协作 BI(2020 年收购,2026 年并入 Grafana)

更戏剧性的是:2021 年 Grafana 把核心代码从 Apache-2.0 切换到 AGPL-3.0, 引发社区激烈争议——这是开源商业化历史上最具标志性的事件之一。

而对飞熊读者群来说,Grafana 跟 Redash 是同一棵树上的两个分支 ——上期调研的 Redash(304 篇) 现在已经是 Grafana 的一部分, 这篇调研就是这个故事的 ” 另一半 ”。

一、它解决什么问题

一句话卖点: 开源可观测性平台——从 Dashboard 到完整 LGTM+ 栈,2026 年事实标准的 ” 云原生监控全家桶 ”。

维度 信息
项目名 Grafana
创始人 Torkel Ödegaard(瑞典,2014 年开源)
公司 Grafana Labs(2014 年成立,YC S14)
核心仓库 grafana/grafana
Stars 76,282(比 Superset 74K 高, 跟 Kubernetes 100K+ 同一量级)
Forks 14,566
License AGPL-3.0(⚠️ 2021/04 从 Apache-2.0 切换)
主语言 TypeScript 46M + Go 43M + PLpgSQL + CUE
创建时间 2013-12-11(12 年常青树)
最近 Push 2026-08-13(今天, 极度活跃)
Open Issues 3,368(健康, 符合规模)
Subscribers 1,327
代码量 1.9 GB(~191 万 KB, 超大项目)
全家桶 Loki + Tempo + Pyroscope + Mimir + Faro + k6 + Redash
官网 https://grafana.com/
在线 Demo https://play.grafana.org/

二、核心能力 1: 可视化 + 数据源生态

2.1 一切都是 Panel

Grafana 的核心抽象是 Dashboard = N 个 Panel:

  • Timeseries Panel —— 折线图、面积图(最常用,Prometheus / InfluxDB 标准可视化)
  • Stat / Gauge —— 单一大数字(KPI / 当前值)
  • Bar / Pie / Histogram —— 柱状 / 饼图 / 直方图
  • Geomap —— 地图(原生支持)
  • Heatmap —— 热力图(性能分析常用)
  • Table —— 表格
  • Markdown / Text —— 文档面板
  • Node Graph —— 节点图(服务依赖)
  • 插件扩展 —— 社区 150+ 面板(Sankey / Candlestick / Plotly / ECharts 等)

vs Kibana:Grafana 的可视化更 ” 轻 ”,Kibana 更 ” 全 ”。Grafana 是 可视化之王,Kibana 是ELK 全栈套件

2.2 150+ 数据源支持

Grafana 的 ” 数据源插件 ” 系统是它的护城河之一:

类别 代表数据源
时序数据库 Prometheus / InfluxDB / TimescaleDB / VictoriaMetrics / Mimir
日志 Loki / Elasticsearch / Splunk
追踪 Tempo / Jaeger / Zipkin
云厂商 AWS CloudWatch / Azure Monitor / Google Cloud Monitoring
数据库 PostgreSQL / MySQL / MSSQL / Oracle / ClickHouse / Doris
大数据 BigQuery / Snowflake / Redshift / Databricks
监控 SaaS Datadog / New Relic / Honeycomb / Dynatrace
物联网 MQTT / InfluxDB / Timescale
其他 Graphite / OpenTSDB / TestData

对比 Superset:Superset 数据源 50+,Grafana 数据源 150+——Grafana 是 ” 数据源覆盖最广的可视化工具 ”

2.3 探索模式(Explore Mode)

除 Dashboard 外,Grafana 提供 Explore 模式——类似 Redash 的 SQL 编辑器:

  • 直接对一个数据源写查询(QL / SQL / PromQL / LogQL)
  • 实时看结果, 无需保存 Dashboard
  • 适合排查问题时 ” 随手查一下 ”

这就是 Redash 整合进 Grafana 后的形态(2026 年,Grafana 11+ 内置 Explore + SQL 数据源)。

2.4 变量 + 模板 + Dashboard 复用

# 在 Dashboard 顶部设变量:$region, $instance
# Panel 查询里引用:up{region="$region", instance="$instance"}
# → 一个 Dashboard 服务多个 region, 顶部切换

实战价值: 同一个 ” 服务监控模板 ” 复用到 100 个 region, 无需复制 100 份 Dashboard。

2.5 告警(Alerting)

Grafana 9+ 内置告警系统(从 Prometheus Alertmanager 演化):

  • 在 Panel 上点 “Create alert rule” → 选阈值 / 条件 / 评估间隔
  • 通知渠道:Email / Slack / PagerDuty / Webhook / OpsGenie / VictorOps
  • 告警分组 / 静默 / 升级路径

对比 Metabase:Metabase 告警较弱,Grafana 告警是企业级标准。

三、核心能力 2:Grafana 全家桶(LGTM+ Stack)

2020 年后,Grafana Labs 不再只做可视化, 而是 全家桶战略:

3.1 LGTM+ 栈

组件 用途 类比
Loki 日志聚合(类 ELK, 但更轻) Elasticsearch 替代
Grafana 可视化 + 告警 Kibana 替代
Tempo 分布式追踪 Jaeger 替代
Pyroscope 持续剖析(CPU/ 内存火焰图) (无主流开源替代)
Mimir Prometheus 远程存储 (Prometheus 自身)
Faro 前端 RUM(Web Vitals / 错误监控) Datadog RUM 替代
k6 负载测试 JMeter 替代
Beyla eBPF 自动埋点 (无替代)

核心思想:“ 一个 Dashboard 看一切 ”——指标、日志、追踪、剖析, 数据自动关联, 排查问题时一键跳转。

3.2 全家桶关键特性

Loki(日志)

  • 设计哲学:”Prometheus for logs”——只索引标签, 不索引全文
  • 存储成本 : 同等规模比 Elasticsearch 低 5-10 倍
  • 查询语言:LogQL(类 PromQL)
  • 适用:K8s 云原生场景;ES 仍是全文搜索首选

Tempo(追踪)

  • OpenTelemetry 原生兼容
  • 对象存储后端:S3 / GCS / MinIO, 存储成本极低
  • Trace 关联: 从日志 / 指标一键跳到 Trace

Pyroscope(剖析)

  • 持续剖析(Continuous Profiling):always-on 模式采集 CPU/ 内存火焰图
  • 存储成本: 采样 + 压缩, 可承担生产负载
  • 集成:pyroscope connect 一行集成 Go / Python / Rust / Java / Node.js

Mimir(指标)

  • Prometheus 远程存储 的 ” 无限横向扩展 ” 版
  • 多租户 + 降采样 + 长期存储
  • 从单 Prometheus → 集群 Mimir, 运维 Prometheus 不再头疼

3.3 Grafana Cloud(商业产品)

Grafana Labs 同时提供 SaaS 服务:

  • 免费层:3 用户 + 10K metrics + 50GB logs + 50GB traces
  • Pro 层($8/ 月起): 无限用户 + 100K metrics
  • 企业级:SLA / 合规(FedRAMP / SOC2 / GDPR)
  • AI 助手:Grafana Assistant(2026 新发布, 基于 LLM 的可观测性 Copilot)

四、收购 Redash 的故事

2020 年 11 月,Grafana Labs 收购了 Redash(本文 304 篇调研的那个项目)——这是一个很有教育意义的开源收购案例:

4.1 收购动机

维度 Grafana Redash
强项 时序数据 + 监控 SQL 数据 + BI
弱项 SQL/ 数据库可视化弱 时序 / 监控弱
用户群 SRE / DevOps 数据分析师 / 产品

收购让两家 互补拼图——Grafana 补齐 SQL/BI 短板,Redash 拿到商业级工程团队。

4.2 收购后的变化

  • 保留开源:Redash 仍是 BSD-2-Clause(Grafana 没污染它的 license)
  • 代码继续维护: 但节奏放缓, 主要在 Grafana 11 内整合 Explore + SQL 数据源
  • ⚠️ 新功能有限 :Redash 项目活跃度下降, 主线在 Grafana 内
  • 数据互通:Redash query 可作为 Grafana 数据源

4.3 2021 年 License 切换

2021 年 4 月,Grafana Labs 把 Grafana 从 Apache-2.0 切换到 AGPL-3.0——这是 Grafana 历史上最具争议的事件:

立场 观点
支持方 “Grafana Cloud 跟开源自托管竞争,AGPL 阻止 AWS/GCP 转售 Grafana 不回馈 ”
反对方 “ 社区贡献者被迫切 license, 违反 Apache 协议, 引发 fork(比如 Grafana fork)风险 ”
结果 AGPL-3.0 稳定下来,Redash 保持 BSD-2-Clause(独立),商业化 + 开源平衡

对飞熊读者启示 :AGPL-3.0 在中国大陆 / 商业 SaaS 场景需要法务评估—— 修改 Grafana 内核 + 提供 SaaS 必须开源

五、对比 Superset / Metabase / Datadog / Kibana

维度 Grafana Apache Superset Metabase Kibana Datadog
Stars 76K 74K 48K 闭源(Elastic) 闭源
License AGPL-3.0 Apache-2.0 AGPL-3.0 Elastic License 商业
定位 可观测性平台 企业 BI 平台 自助 BI ELK 全栈 SaaS 监控
核心数据源 时序 + 日志 + 追踪 SQL 数据库 SQL 数据库 Elasticsearch 多源
数据源数 150+ 50+ 25+ 仅 ES 多源
可视化丰富度 ⭐⭐⭐⭐⭐ ⭐⭐⭐⭐⭐ ⭐⭐⭐ ⭐⭐⭐⭐ ⭐⭐⭐⭐⭐
告警 ⭐⭐⭐⭐⭐(内置) ⭐⭐⭐(3.0+) ⭐⭐⭐ ⭐⭐⭐⭐ ⭐⭐⭐⭐⭐
LGTM 全家桶 ✅ 部分
AI 助手 ✅ Grafana Assistant
企业级 ⭐⭐⭐⭐⭐(FedRAMP) ⭐⭐⭐⭐ ⭐⭐⭐⭐ ⭐⭐⭐⭐⭐ ⭐⭐⭐⭐⭐
学习曲线 ⭐⭐⭐(中) ⭐⭐⭐(中) ⭐(低) ⭐⭐⭐(中) ⭐(低)

结论:

  • 选 Grafana:SRE / DevOps 团队、需可观测性全家桶、想统一指标 + 日志 + 追踪
  • 选 Superset: 数据分析师、企业 BI、需要丰富图表
  • 选 Metabase: 非技术用户、拖拽式 BI、SQL 弱
  • 选 Kibana: 已经在用 ELK 日志栈
  • 选 Datadog: 不差钱、要 SaaS、零运维

六、实战:3 步跑通

6.1 Docker Compose 启动

mkdir grafana-quickstart && cd grafana-quickstart
cat > docker-compose.yml <<EOF
version: '3'
services:
  grafana:
    image: grafana/grafana:latest
    ports:
      - "3000:3000"
    environment:
      - GF_SECURITY_ADMIN_PASSWORD=admin
EOF
docker-compose up -d
# 访问 http://localhost:3000(默认账号 admin / admin)

6.2 接 Prometheus 数据源

# 1. 起一个 Prometheus demo
docker run -d -p 9090:9090 prom/prometheus
# 2. Grafana → Configuration → Data Sources → Add Prometheus
#    URL: http://host.docker.internal:9090
# 3. Save & Test → 应该显示 "Data source is working"

6.3 创建第一个 Dashboard(PromQL 示例)

  1. 新建 Dashboard → “Add visualization” → Timeseries
  2. 写 PromQL 查询:
    promql
    rate(node_cpu_seconds_total{mode="system"}[5m])
  3. 保存 → Dashboard URL:http://localhost:3000/d/<id>
  4. 告警:Panel → “Create alert rule” → 设阈值 > 0.8 → 通知渠道 Email

完整流程从空白到可视化:30 分钟以内。

6.4 进阶: 接 Loki / Tempo

# docker-compose.yml 加 Loki 和 Tempo
services:
  loki:
    image: grafana/loki:latest
    ports: ["3100:3100"]
  tempo:
    image: grafana/tempo:latest
    ports: ["3200:3200"]
  grafana-agent:
    image: grafana/agent:latest
    # 配置收集日志 / 指标 / 追踪到 Loki/Tempo/Mimir

Grafana Agent 自动收集, 一个 Dashboard 同时展示指标 + 日志 + 追踪。

七、风险与坑

风险 说明 缓解
AGPL-3.0 强 copyleft 修改 Grafana 内核 + 提供 SaaS 必须开源 自用 OK; 商业 SaaS 需法务评估; 或用 Grafana Cloud 官方
插件兼容 部分社区插件升级 Grafana 后失效 用官方插件或固定版本
配置复杂度 150+ 数据源 × 多组件 → 配置爆炸 走 Grafana Cloud 一键起; 或跟全家桶打包走
迁移到 Loki 成本 已用 ELK 的团队迁到 Loki 需要重写 LogQL LogQL ≈ PromQL, 学习曲线尚可
全家桶 vs 单体取舍 全家桶虽强, 但运维负担大(5+ 组件) 中小团队: 只装 Grafana + Prometheus + Loki 三个
商业版 Gems 诱人 部分高级功能 (LDAP / 审计 / SAML) 需要企业版 开源版覆盖 90%; 商业版按年付
大项目 issue 堆积 3,368 open issues, 部分功能响应慢 优先用 stable 标签的功能; 企业版有支持

八、总结

Grafana 最适合的三个场景:

  1. SRE / DevOps 团队的可观测性平台 —— 指标 + 日志 + 追踪 + 剖析, 一个 Dashboard 看一切
  2. 云原生 / K8s 环境监控 —— Prometheus + Loki + Tempo + Pyroscope 是 K8s 上的事实标准
  3. 企业内部 ” 统一可视化层 ” —— 接 150+ 数据源, 替公司整合各种工具

一句话建议:

如果你是 SRE / DevOps / 平台工程师,Grafana 全家桶是 2026 年的事实标准; 如果你是数据分析师做 BI, 看 Superset/Metabase; 如果只是简单监控,Prometheus + Grafana 就够了。

先试一周:docker run grafana/grafana → 接 Prometheus → 创建 3 个核心指标 Dashboard → 设 1 个告警 → 集成 Loki 看日志。这周你会决定 Grafana 是不是你团队 ” 可观测性的标准答案 ”。

对飞熊读者启示:Redash 是 Grafana 故事的 ”SQL 协作 BI” 那一半;Grafana 是 ” 可观测性 + 监控 ” 这一半——两个项目 + 一家公司 = 一个完整的 ” 开源数据基础设施 ” 版图。

参考

研究文档(引用来源参考)

(no reference document available)

正文完