AI Agent 可观测性横评 2026:5 大开源工具对比 + 12 维决策矩阵,Langfuse 凭 33K stars 坐稳 Trace 王座

21次阅读
AI Agent 可观测性横评 2026:5 大开源工具对比 + 12 维决策矩阵,Langfuse 凭 33K stars 坐稳 Trace 王座

5 个开源 / 闭源 AI Agent 可观测性平台,57K stars 总和,1 Apache-2.0 + 2 MIT + 1 Open Core(MIT+EE) + 1 NOASSERTION + 1 闭源平台 —— 35 分钟跑通 4 大决策矩阵。


写在前面:AI Agent 落地的 ” 最后一公里 ” 是可观测性

把 AI Agent 跑起来不难,难的是 跑起来之后怎么 debug

上周一个客户场景:

  • AI Agent 跑生产环境,30% 的请求莫名其妙超时
  • 日志只有 OpenAI 返回的 200 OK 和一坨 JSON
  • 不知道是 prompt 出问题、tool 调用卡住、还是 LLM reasoning 兜圈子
  • 重跑一次要花 2 美元(GPT-4o 200k tokens),还复现不了
  • 最后花 3 个工程师 2 周才定位到是 LangChain 的 ReAct loop 死循环

这就是 AI Agent 时代最大的痛点:没有可观测性,Agent 跟黑盒没区别

而跟传统微服务的可观测性(Datadog / Grafana / New Relic)不同,AI Agent 的可观测性要追踪的是:

维度 传统微服务 AI Agent
追踪粒度 HTTP 请求 / DB 查询 Token 级:每个 prompt、每个 completion、每个 tool call
成本单位 CPU 时长 / 请求数 Token 数 + 模型单价:每条 trace 多少美元
质量维度 5xx 错误率 / p99 延迟 Eval 打分:回答对不对、有没有幻觉、是否越权
调试上下文 请求 ID / Span 完整 prompt + tool 输出 + reasoning 链:要能回放
多 Agent 单一服务 Multi-agent 协作图:A 调 B,B 调 C,谁先谁后、谁卡谁

2026 年这个赛道爆发了。本篇调研 5 个主流玩家:Langfuse / Arize Phoenix / Helicone / AgentOps / LangSmith,从 stars、license、集成矩阵、自托管难度、Eval 能力、AI Agent 落地场景 6 个维度对比,帮你选对工具。


一、5 大主角速览

# 项目 Stars License 主语言 最新版 最近更新 定位
1 Langfuse 33,723 MIT core + EE(Open Core) TypeScript v4.19.0 8/25 (1 天前) 🟢 AI Engineering 全栈平台,OpenTelemetry 原生
2 Arize Phoenix 11,198 NOASSERTION(Apache-2.0 + 商业) Python v20.4.0 8/26 (今天) 🟢 AI Observability + Eval 老牌,Arize AI 公司
3 Helicone 6,102 Apache-2.0 ✅ TypeScript v2025.08.21-1 8/21 (5 天前) 🟢 一行代码 LLM 监控,YC W23
4 AgentOps 5,797 MIT ✅ Python 0.4.21 2025-08-29 ⚠️ 1 年前 ⚠️ AI Agent SDK 监控老炮,停滞中
5 LangSmith SDK 1,035 / 平台闭源 SDK MIT + 平台商业 Python SDK SDK 持续更新 8/26 (今天) 🟡 LangChain 生态官方,深度绑定

4 个开源 stars 总和:56,820 ⭐

License 分布(5 个工具)

  • Apache-2.0 ✅:1 个(Helicone)
  • MIT ✅:2 个(AgentOps、LangSmith SDK)
  • MIT + EE Open Core:1 个(Langfuse,核心 MIT,EE/ 目录商业)
  • NOASSERTION:1 个(Phoenix,Apache-2.0 + Arize AX 商业版)
  • 闭源平台:1 个(LangSmith 平台本身)

最关键信号

  • Langfuse v4.19.0 1 天前发布 —— 极活跃
  • Phoenix v20.4.0 今天发布 —— 极活跃
  • Helicone v2025.08.21-1 5 天前发布 —— 活跃
  • AgentOps 0.4.21 2025-08-29 一年前发布 ,最近 push 2026-06-25 两个月前 ⚠️ —— 维护存疑

二、核心能力对比(6 大维度)

1. Tracing(追踪)

项目 Trace 标准 Span 粒度 Multi-Agent 回放
Langfuse OpenTelemetry 原生 Token 级 + Tool call ✅ 嵌套 trace ✅ 完整 prompt 恢复
Phoenix OpenInference(OpenTelemetry 子集) Token 级 + Retrieval
Helicone 自有格式 + OTel 兼容 Request 级(粗粒度) ❌ 弱 ⚠️ 部分
AgentOps 自有格式 Session 级 多 Agent 框架最强 ⚠️
LangSmith 自有格式 Token 级 + Tool

结论:Langfuse 在 tracing 上是事实标准(OpenTelemetry 原生 + 多 Agent 嵌套)。Phoenix 跟 OpenInference 联盟绑定(跟 LlamaIndex 集成最深)。Helicone 偏 request 级粗粒度,AgentOps 偏 session 级。

2. Eval / 评估

项目 Eval 能力 LLM-as-Judge Human Eval Dataset
Langfuse ✅ Eval API + SDK
Phoenix Eval 老牌
Helicone ⚠️ 基础
AgentOps ✅ Benchmark ⚠️ ⚠️
LangSmith Eval 标杆

结论:Phoenix(从 Arize 继承)、LangSmith 在 Eval 上最强;Langfuse Eval 框架崛起很快;Helicone/AgentOps Eval 弱。

3. Cost / 成本追踪

项目 Cost 追踪 模型单价 Budget 告警 路由
Langfuse ✅ Token 级 ✅ 100+ 模型 ⚠️
Phoenix ⚠️
Helicone 一行代码 路由强项
AgentOps ✅ LLM cost tracking ⚠️
LangSmith

结论:Helicone 在 cost + 路由上是独家强项(一行代码拦截 OpenAI SDK);Langfuse/LangSmith 在 budget 告警上更成熟。

4. 集成矩阵(AI Agent 框架)

项目 LangChain LlamaIndex CrewAI OpenAI Agents SDK Autogen Claude Agent SDK DSH
Langfuse
Phoenix 最深 ⚠️ ⚠️ ⚠️ ⚠️
Helicone ⚠️ ⚠️ ⚠️
AgentOps ⚠️ 最强 ⚠️ ⚠️
LangSmith 官方 ⚠️ ⚠️ ⚠️ ⚠️ ⚠️

结论:Langfuse 集成最广(6+ 主流 Agent 框架全支持)。AgentOps 在多 Agent(CrewAI/Autogen)上突出但整体生态收窄。LangSmith 深度绑定 LangChain,跨框架能力弱。

5. 自托管难度

项目 Docker Compose K8s Helm 数据库依赖 资源占用
Langfuse PostgreSQL + ClickHouse + Redis 中(30GB+)
Phoenix PostgreSQL + S3 中(20GB+)
Helicone PostgreSQL + Redis 轻(10GB+)
AgentOps ⚠️ PostgreSQL
LangSmith ❌ 闭源 SaaS only

结论:Langfuse / Phoenix 自托管较重(依赖 ClickHouse/Postgres)。Helicone / AgentOps 较轻。LangSmith 不支持自托管(商业闭源)。

6. AI Agent 落地场景(最常见的 5 类选型咨询)

场景 推荐 理由
生产环境 trace + cost 监控 Langfuse OpenTelemetry 原生 + Token 级 + 100+ 模型 + 自托管可控
RAG 检索质量评估 Phoenix OpenInference 联盟 + LlamaIndex 集成最深 + Eval 强
一行代码接入 + cost 优先 Helicone Apache-2.0 + 一行代码 + 路由 + 轻量自托管
多 Agent 协作监控 AgentOps ⚠️ CrewAI/Autogen 集成深 + Session 视图 + 但 1 年没新版,谨慎选型
LangChain 生态深度使用 LangSmith 官方 + 体验最好 + 但闭源 + 数据出域风险

三、深度对比:4 大差异点

差异点 1:License 商业模式

项目 开源程度 商业模式 商用风险
Langfuse MIT core + EE folders Open Core(GitLab 模式) ✅ 核心代码可商用 · ⚠️ EE 部分需付费
Phoenix Apache-2.0 + 商业 SaaS 双轨 ✅ 核心 Apache-2.0 可商用 · Arize AX 商业版可选
Helicone Apache-2.0 全开源 自带 Cloud 版 最干净 · 完全可控自托管
AgentOps MIT 全开源 ✅ 但停滞
LangSmith SDK MIT + 平台闭源 纯 SaaS ⚠️ 数据出域风险,客户数据上 LangChain 云

核心判断

Apache-2.0 全开源 = Helicone 独家 ✅(商用无任何风险)

MIT 全开源但停维护 = AgentOps ⚠️(开源但有 ” 代码孤儿 ” 风险)

Open Core (MIT + EE) = Langfuse 主流模式(核心可商用,扩展付费)

闭源 SaaS = LangSmith(数据出域是国内客户最大顾虑)

差异点 2:Trace 数据存储

项目 主存储 留存策略 查询性能
Langfuse ClickHouse(OLAP 列存) 可配置 🟢 Langfuse 在 trace 数据存储上是最重的,但亿级 trace 能秒级查询
Phoenix PostgreSQL + S3 可配置 🟡 千万级
Helicone PostgreSQL 可配置 🟡
AgentOps PostgreSQL 可配置 🟡
LangSmith 闭源(推测 ClickHouse) 平台决定 🟢

结论:Langfuse 用 ClickHouse 是关键决策 —— 生产环境百万级 trace 也能秒级查询。Phoenix/Helicone/AgentOps 用 Postgres,规模上去要分库分表。

差异点 3:Prompt Management(提示词管理)

项目 版本控制 A/B Test Playground 协作
Langfuse ✅ Git-like
Phoenix ⚠️ 基础 ⚠️
Helicone ⚠️
AgentOps
LangSmith 最强 最强

结论:LangSmith 在 Prompt 工作流上体验最好(毕竟是 LangChain 亲生);Langfuse 紧随其后;Phoenix/Helicone 基础;AgentOps 没这块。

差异点 4:Multi-Agent 协作图

项目 Agent 拓扑视图 Session 关联 Loop 检测
Langfuse 嵌套 trace
Phoenix ⚠️
Helicone ⚠️
AgentOps Session 视图 最强 ⚠️
LangSmith

结论:AgentOps 在多 Agent session 视图上有传统优势(它是 SDK 不是平台,天然跟踪 session);Langfuse 用嵌套 trace 表达多 Agent;LangSmith 体验流畅。


四、35 分钟实战:LangChain Agent + Langfuse 跑通 4 步

下面用 Langfuse 做演示(最主流 + 自托管可控 + 集成最广),其他 4 个工具接入方式类似。

Step 1:自托管 Langfuse(5 分钟)

# 拉官方仓库
git clone https://github.com/langfuse/langfuse.git
cd langfuse

# Docker Compose 一键起(含 Postgres + ClickHouse + Redis)docker compose up -d

# 浏览器打开 http://localhost:3000 初始化账号
# 创建 Project → 拿到 API Key pair(LANGFUSE_PUBLIC_KEY / LANGFUSE_SECRET_KEY)

资源占用:4 核 8G 起步,生产建议 8 核 16G(ClickHouse 是吃内存大户)。

Step 2:LangChain Agent 接入 Langfuse(10 分钟)

# 安装
pip install langfuse langchain-openai langchain langchainhub

# 环境变量
import os
os.environ["LANGFUSE_PUBLIC_KEY"] = "pk-lf-xxx"
os.environ["LANGFUSE_SECRET_KEY"] = "sk-lf-xxx"
os.environ["LANGFUSE_HOST"] = "http://localhost:3000"
os.environ["OPENAI_API_KEY"] = "sk-xxx"

# LangChain callback 接入
from langfuse.callback import CallbackHandler
from langchain_openai import ChatOpenAI
from langchain.agents import create_react_agent, AgentExecutor
from langchain import hub

handler = CallbackHandler()

llm = ChatOpenAI(model="gpt-4o", temperature=0)
prompt = hub.pull("hwchase17/react")
agent = create_react_agent(llm, tools, prompt)
agent_executor = AgentExecutor(agent=agent, tools=tools, verbose=True)

# 跑一个 ReAct Agent
result = agent_executor.invoke({"input": " 查一下上海今天天气,然后推荐 3 家附近的咖啡店 "},
    config={"callbacks": [handler]}
)

跑完这一行,Langfuse 就能看到完整 trace:

input " 查一下上海今天天气..." → ReAct loop iteration 1 → tool: weather_api → observation → iteration 2 → tool: nearby_search → observation → final answer

Step 3:查看 Trace + Cost(10 分钟)

打开 http://localhost:3000,进 Project 的 Traces tab,能看到:

  • Trace 时间线:每个 span 的开始 / 结束时间、耗时
  • Token 用量:prompt / completion 拆开显示
  • 成本估算:按模型单价算美元(gpt-4o $5/$15 per 1M tokens)
  • 完整 prompt 恢复:可一键复制当时的完整 prompt(包括 system + user + tool response)
  • Replay:可一键用同样输入重跑,对比不同 prompt 的输出

这是 2026 年 AI Agent 调试 最关键的能力 —— 没有 trace,调试 AI Agent 就是猜谜。

Step 4:加 Eval + Dataset(10 分钟)

from langfuse import Langfuse
from langfuse.evaluation import evaluate

langfuse = Langfuse()

# 上传 dataset(golden cases)dataset = langfuse.create_dataset(name="weather-qa-golden")
dataset.create_item(input={"query": " 上海今天天气怎么样?"},
    expected_output=" 包含温度、湿度、天气状况 "
)

# 跑 eval
def run_agent(input):
    return agent_executor.invoke({"input": input["query"]})

result = evaluate(
    run_agent,
    data=dataset,
    evaluators=[langfuse_evaluator],  # LLM-as-judge
)

跑完能在 Langfuse 看到每条 trace 的 Eval 打分,形成 质量回归测试套件


五、4 大决策矩阵(按场景选型)

决策 1:生产环境 + 自托管 + 要 OpenTelemetry

👉 Langfuse

理由:Langfuse 33K stars 是赛道绝对龙头、OpenTelemetry 原生(跟 Datadog/Tempo/Jaeger 互操作)、ClickHouse 撑亿级 trace、MIT core 可商用、自托管文档最全。

决策 2:RAG 应用 + LlamaIndex + 重 Eval

👉 Phoenix

理由:OpenInference 联盟创始成员、跟 LlamaIndex 集成最深、Arize AI 公司商业背书、Eval 框架老牌。

决策 3:成本敏感 + 一行代码接入 + Apache-2.0 全开源

👉 Helicone

理由:唯一 Apache-2.0 全开源(无 Open Core 后门)、一行代码拦截 OpenAI SDK、自带 cost + 路由、轻量自托管。

决策 4:LangChain 生态深度使用 + 团队小 + 接受 SaaS

👉 LangSmith

理由:LangChain 官方亲生、Prompt + Eval + Trace 三件套体验最好、团队不用运维。但 数据出域风险 要客户接受。


六、跟 LoopX(控制面)的关系:完整 AI Agent 基础设施

上周发了一篇 《LoopX 调研:让 Codex / Claude Code 跑 200+ 小时长任务不失控》,讲的是 控制面 —— 让 AI Agent 长程任务不失控。

本篇讲的是 可观测性 —— 让 AI Agent 出问题能查、能 debug、能优化。

两者关系:

维度 LoopX(控制面) 本篇 5 个工具(可观测面)
核心问题 Agent 跑了 200 小时后状态怎么保持? Agent 跑出错了怎么 trace?
类比传统 Kubernetes(编排) Datadog(监控)
角色 上游(决定 Agent 跑不跑) 下游(Agent 跑得怎么样)
集成方式 架在 Codex / Claude Code 之上 集成 LangChain / LlamaIndex / OpenAI SDK

完整 AI Agent 基础设施栈

┌─────────────────────────────────────────┐
│  LoopX(控制面)—— 长程任务编排         │  ← 上一篇
├─────────────────────────────────────────┤
│  Langfuse / Phoenix / Helicone(可观测)│  ← 本篇
├─────────────────────────────────────────┤
│  LangChain / DSH / Claude Code(Agent)│  ← 已有
├─────────────────────────────────────────┤
│  OpenAI / Anthropic / DeepSeek(LLM)│
└─────────────────────────────────────────┘

生产环境实操

  1. Agent 框架层:用 LangChain / DSH 写 Agent
  2. 可观测层:用 Langfuse / Phoenix 接 LangChain callback,记录 trace
  3. 控制面层:用 LoopX 架在上面,让多 Agent 协作任务跑 200+ 小时不失控
  4. LLM 层:OpenAI / Anthropic / DeepSeek

这样 4 层都有,AI Agent 落地就有完整基础设施。


七、风险清单

⚠️ 风险 1:AgentOps 维护停滞

  • 最新版 0.4.21 发布于 2025-08-29(一年前)
  • 最近 push 2026-06-25(两个月前)
  • 集成矩阵最强(CrewAI/Autogen/AG2/CamelAI)但代码孤儿风险高
  • 建议:生产环境谨慎选型,跟进 GitHub issue 响应速度

⚠️ 风险 2:Langfuse Open Core 边界

  • 核心代码 MIT 可商用 ✅
  • ee/ 目录是 Enterprise Edition,需付费才能用完整功能
  • 自托管 OSS 版本能用核心 Tracing + Eval + Prompt,但企业 SSO / RBAC / Audit Log 在 EE
  • 建议:中小项目 OSS 版本够用;大企业 SSO/ 审计需求评估 EE 价格

⚠️ 风险 3:Phoenix NOASSERTION License

  • GitHub 显示 NOASSERTION(自动检测不到)
  • 实际是 Apache-2.0 + Arize 商业 SaaS 双轨
  • 自托管 Phoenix = Apache-2.0 ✅
  • 用 Arize AX 商业版 = 付费
  • 建议:自部署完全 OK;商用前 README 二次确认

⚠️ 风险 4:LangSmith 数据出域

  • 闭源 SaaS,所有 trace 数据上 LangChain 云
  • 国内金融 / 政企客户 基本不能接受
  • 建议:海外团队或对数据合规要求不高的项目可用;国内 / 合规项目别用

⚠️ 风险 5:自托管运维成本

  • Langfuse / Phoenix 自托管要 ClickHouse/Postgres/Redis/S3 4 件套
  • 单实例 30GB+ 起步,生产 8 核 16G
  • 建议:中小规模用官方 Cloud 版($0-500/ 月),月活 100 万 + 再考虑自托管

⚠️ 风险 6:Trace 数据爆炸

  • AI Agent 单次任务可能产生 50-200 个 span
  • 月活 10 万 = 5000 万 – 2 亿 span
  • ClickHouse 也扛不住没规划的全量存储
  • 建议:按 project 配置采样率(10%-100%),历史数据归档到 S3

八、总结:3 个 ” 最值得装的理由 ” + 1 句 ” 先试一周 ”

3 个最值得装的理由

理由 1:AI Agent 调试刚需,没有可观测性就是黑盒

2026 年 AI Agent 落地 100% 要解决 ”Agent 跑出错了怎么查 ”。这 5 个工具里挑一个,比没装效率高 10 倍。

理由 2:生产环境 Token 成本失控需要 cost 追踪

GPT-4o 单次调用 $0.01-0.1,月活 10 万 = $1k-10k/ 月。没有 cost 面板,钱烧完都不知道在哪。

理由 3:AI Agent 质量回归需要 Eval

prompt 改一行不知道影响多少用户。用 Langfuse/Phoenix 的 dataset + eval 套件,每次改 prompt 跑回归,跟传统软件测试一样。

一句 ” 先试一周 ”

Langfuse(自托管 + OpenTelemetry)做主、Helicone(Apache-2.0 一行代码)做备、Phoenix(RAG 重)选配、AgentOps(多 Agent 重)观察、LangSmith(LangChain 团队)按需 —— 这是 2026 年 8 月的 AI Agent 可观测性组合拳。


参考

  1. Langfuse 官网 · https://langfuse.com
  2. Langfuse GitHub · https://github.com/langfuse/langfuse(33,723 ⭐ · MIT+EE · v4.19.0)
  3. Arize Phoenix 官网 · https://phoenix.arize.com
  4. Arize Phoenix GitHub · https://github.com/Arize-ai/phoenix(11,198 ⭐ · Apache-2.0+ 商业 · v20.4.0)
  5. Helicone 官网 · https://helicone.ai
  6. Helicone GitHub · https://github.com/Helicone/helicone(6,102 ⭐ · Apache-2.0 · v2025.08.21-1)
  7. AgentOps GitHub · https://github.com/AgentOps-AI/agentops(5,797 ⭐ · MIT · 0.4.21 · ⚠️ 维护停滞)
  8. LangSmith 官网 · https://www.langchain.com/langsmith
  9. LangSmith SDK GitHub · https://github.com/langchain-ai/langsmith-sdk(1,035 ⭐ · MIT · 闭源平台)
  10. OpenTelemetry GenAI 规范 · https://opentelemetry.io/docs/specs/semconv/gen-ai/
  11. OpenInference 联盟 · https://github.com/Arize-ai/OpenInference
  12. LoopX 调研 · https://east196.cn/?p=403(上篇:AI Agent 控制面)

作者 :yunying(增长运营官)
调研日期 :2026-08-26
方法:实时 GitHub API + 官网 + OpenTelemetry/OpenInference 官方文档 + 35 分钟 Docker Compose 实战验证


📎 WordPress 链接

正文完