
5 个开源 / 闭源 AI Agent 可观测性平台,57K stars 总和,1 Apache-2.0 + 2 MIT + 1 Open Core(MIT+EE) + 1 NOASSERTION + 1 闭源平台 —— 35 分钟跑通 4 大决策矩阵。
写在前面:AI Agent 落地的 ” 最后一公里 ” 是可观测性
把 AI Agent 跑起来不难,难的是 跑起来之后怎么 debug。
上周一个客户场景:
- AI Agent 跑生产环境,30% 的请求莫名其妙超时
- 日志只有 OpenAI 返回的 200 OK 和一坨 JSON
- 不知道是 prompt 出问题、tool 调用卡住、还是 LLM reasoning 兜圈子
- 重跑一次要花 2 美元(GPT-4o 200k tokens),还复现不了
- 最后花 3 个工程师 2 周才定位到是 LangChain 的 ReAct loop 死循环
这就是 AI Agent 时代最大的痛点:没有可观测性,Agent 跟黑盒没区别。
而跟传统微服务的可观测性(Datadog / Grafana / New Relic)不同,AI Agent 的可观测性要追踪的是:
| 维度 | 传统微服务 | AI Agent |
|---|---|---|
| 追踪粒度 | HTTP 请求 / DB 查询 | Token 级:每个 prompt、每个 completion、每个 tool call |
| 成本单位 | CPU 时长 / 请求数 | Token 数 + 模型单价:每条 trace 多少美元 |
| 质量维度 | 5xx 错误率 / p99 延迟 | Eval 打分:回答对不对、有没有幻觉、是否越权 |
| 调试上下文 | 请求 ID / Span | 完整 prompt + tool 输出 + reasoning 链:要能回放 |
| 多 Agent | 单一服务 | Multi-agent 协作图:A 调 B,B 调 C,谁先谁后、谁卡谁 |
2026 年这个赛道爆发了。本篇调研 5 个主流玩家:Langfuse / Arize Phoenix / Helicone / AgentOps / LangSmith,从 stars、license、集成矩阵、自托管难度、Eval 能力、AI Agent 落地场景 6 个维度对比,帮你选对工具。
一、5 大主角速览
| # | 项目 | Stars | License | 主语言 | 最新版 | 最近更新 | 定位 |
|---|---|---|---|---|---|---|---|
| 1 | Langfuse | 33,723 | MIT core + EE(Open Core) | TypeScript | v4.19.0 | 8/25 (1 天前) | 🟢 AI Engineering 全栈平台,OpenTelemetry 原生 |
| 2 | Arize Phoenix | 11,198 | NOASSERTION(Apache-2.0 + 商业) | Python | v20.4.0 | 8/26 (今天) | 🟢 AI Observability + Eval 老牌,Arize AI 公司 |
| 3 | Helicone | 6,102 | Apache-2.0 ✅ | TypeScript | v2025.08.21-1 | 8/21 (5 天前) | 🟢 一行代码 LLM 监控,YC W23 |
| 4 | AgentOps | 5,797 | MIT ✅ | Python | 0.4.21 | 2025-08-29 ⚠️ 1 年前 | ⚠️ AI Agent SDK 监控老炮,停滞中 |
| 5 | LangSmith | SDK 1,035 / 平台闭源 | SDK MIT + 平台商业 | Python SDK | SDK 持续更新 | 8/26 (今天) | 🟡 LangChain 生态官方,深度绑定 |
4 个开源 stars 总和:56,820 ⭐
License 分布(5 个工具):
- Apache-2.0 ✅:1 个(Helicone)
- MIT ✅:2 个(AgentOps、LangSmith SDK)
- MIT + EE Open Core:1 个(Langfuse,核心 MIT,EE/ 目录商业)
- NOASSERTION:1 个(Phoenix,Apache-2.0 + Arize AX 商业版)
- 闭源平台:1 个(LangSmith 平台本身)
最关键信号:
- Langfuse v4.19.0 1 天前发布 —— 极活跃
- Phoenix v20.4.0 今天发布 —— 极活跃
- Helicone v2025.08.21-1 5 天前发布 —— 活跃
- AgentOps 0.4.21 2025-08-29 一年前发布 ,最近 push 2026-06-25 两个月前 ⚠️ —— 维护存疑
二、核心能力对比(6 大维度)
1. Tracing(追踪)
| 项目 | Trace 标准 | Span 粒度 | Multi-Agent | 回放 |
|---|---|---|---|---|
| Langfuse | OpenTelemetry 原生 ✅ | Token 级 + Tool call | ✅ 嵌套 trace | ✅ 完整 prompt 恢复 |
| Phoenix | OpenInference(OpenTelemetry 子集) | Token 级 + Retrieval | ✅ | ✅ |
| Helicone | 自有格式 + OTel 兼容 | Request 级(粗粒度) | ❌ 弱 | ⚠️ 部分 |
| AgentOps | 自有格式 | Session 级 | ✅ 多 Agent 框架最强 | ⚠️ |
| LangSmith | 自有格式 | Token 级 + Tool | ✅ | ✅ |
结论:Langfuse 在 tracing 上是事实标准(OpenTelemetry 原生 + 多 Agent 嵌套)。Phoenix 跟 OpenInference 联盟绑定(跟 LlamaIndex 集成最深)。Helicone 偏 request 级粗粒度,AgentOps 偏 session 级。
2. Eval / 评估
| 项目 | Eval 能力 | LLM-as-Judge | Human Eval | Dataset |
|---|---|---|---|---|
| Langfuse | ✅ Eval API + SDK | ✅ | ✅ | ✅ |
| Phoenix | ✅ Eval 老牌 | ✅ | ✅ | ✅ |
| Helicone | ⚠️ 基础 | ❌ | ❌ | ❌ |
| AgentOps | ✅ Benchmark | ⚠️ | ❌ | ⚠️ |
| LangSmith | ✅ Eval 标杆 | ✅ | ✅ | ✅ |
结论:Phoenix(从 Arize 继承)、LangSmith 在 Eval 上最强;Langfuse Eval 框架崛起很快;Helicone/AgentOps Eval 弱。
3. Cost / 成本追踪
| 项目 | Cost 追踪 | 模型单价 | Budget 告警 | 路由 |
|---|---|---|---|---|
| Langfuse | ✅ Token 级 | ✅ 100+ 模型 | ✅ | ⚠️ |
| Phoenix | ✅ | ✅ | ⚠️ | ❌ |
| Helicone | ✅ 一行代码 | ✅ | ✅ | ✅ 路由强项 |
| AgentOps | ✅ LLM cost tracking | ✅ | ⚠️ | ❌ |
| LangSmith | ✅ | ✅ | ✅ | ❌ |
结论:Helicone 在 cost + 路由上是独家强项(一行代码拦截 OpenAI SDK);Langfuse/LangSmith 在 budget 告警上更成熟。
4. 集成矩阵(AI Agent 框架)
| 项目 | LangChain | LlamaIndex | CrewAI | OpenAI Agents SDK | Autogen | Claude Agent SDK | DSH |
|---|---|---|---|---|---|---|---|
| Langfuse | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| Phoenix | ✅ | ✅ 最深 | ⚠️ | ✅ | ⚠️ | ⚠️ | ⚠️ |
| Helicone | ✅ | ⚠️ | ⚠️ | ✅ | ❌ | ⚠️ | ❌ |
| AgentOps | ✅ | ⚠️ | ✅ 最强 | ✅ | ✅ | ⚠️ | ⚠️ |
| LangSmith | ✅ 官方 | ✅ | ⚠️ | ⚠️ | ⚠️ | ⚠️ | ⚠️ |
结论:Langfuse 集成最广(6+ 主流 Agent 框架全支持)。AgentOps 在多 Agent(CrewAI/Autogen)上突出但整体生态收窄。LangSmith 深度绑定 LangChain,跨框架能力弱。
5. 自托管难度
| 项目 | Docker Compose | K8s Helm | 数据库依赖 | 资源占用 |
|---|---|---|---|---|
| Langfuse | ✅ | ✅ | PostgreSQL + ClickHouse + Redis | 中(30GB+) |
| Phoenix | ✅ | ✅ | PostgreSQL + S3 | 中(20GB+) |
| Helicone | ✅ | ✅ | PostgreSQL + Redis | 轻(10GB+) |
| AgentOps | ✅ | ⚠️ | PostgreSQL | 轻 |
| LangSmith | ❌ 闭源 | ❌ | — | SaaS only |
结论:Langfuse / Phoenix 自托管较重(依赖 ClickHouse/Postgres)。Helicone / AgentOps 较轻。LangSmith 不支持自托管(商业闭源)。
6. AI Agent 落地场景(最常见的 5 类选型咨询)
| 场景 | 推荐 | 理由 |
|---|---|---|
| 生产环境 trace + cost 监控 | Langfuse | OpenTelemetry 原生 + Token 级 + 100+ 模型 + 自托管可控 |
| RAG 检索质量评估 | Phoenix | OpenInference 联盟 + LlamaIndex 集成最深 + Eval 强 |
| 一行代码接入 + cost 优先 | Helicone | Apache-2.0 + 一行代码 + 路由 + 轻量自托管 |
| 多 Agent 协作监控 | AgentOps ⚠️ | CrewAI/Autogen 集成深 + Session 视图 + 但 1 年没新版,谨慎选型 |
| LangChain 生态深度使用 | LangSmith | 官方 + 体验最好 + 但闭源 + 数据出域风险 |
三、深度对比:4 大差异点
差异点 1:License 商业模式
| 项目 | 开源程度 | 商业模式 | 商用风险 |
|---|---|---|---|
| Langfuse | MIT core + EE folders | Open Core(GitLab 模式) | ✅ 核心代码可商用 · ⚠️ EE 部分需付费 |
| Phoenix | Apache-2.0 + 商业 SaaS | 双轨 | ✅ 核心 Apache-2.0 可商用 · Arize AX 商业版可选 |
| Helicone | Apache-2.0 全开源 | 自带 Cloud 版 | ✅ 最干净 · 完全可控自托管 |
| AgentOps | MIT 全开源 | — | ✅ 但停滞 |
| LangSmith | SDK MIT + 平台闭源 | 纯 SaaS | ⚠️ 数据出域风险,客户数据上 LangChain 云 |
核心判断:
–
Apache-2.0 全开源 = Helicone 独家 ✅(商用无任何风险)
–
MIT 全开源但停维护 = AgentOps ⚠️(开源但有 ” 代码孤儿 ” 风险)
–
Open Core (MIT + EE) = Langfuse 主流模式(核心可商用,扩展付费)
–
闭源 SaaS = LangSmith(数据出域是国内客户最大顾虑)
差异点 2:Trace 数据存储
| 项目 | 主存储 | 留存策略 | 查询性能 |
|---|---|---|---|
| Langfuse | ClickHouse(OLAP 列存) | 可配置 | 🟢 Langfuse 在 trace 数据存储上是最重的,但亿级 trace 能秒级查询 |
| Phoenix | PostgreSQL + S3 | 可配置 | 🟡 千万级 |
| Helicone | PostgreSQL | 可配置 | 🟡 |
| AgentOps | PostgreSQL | 可配置 | 🟡 |
| LangSmith | 闭源(推测 ClickHouse) | 平台决定 | 🟢 |
结论:Langfuse 用 ClickHouse 是关键决策 —— 生产环境百万级 trace 也能秒级查询。Phoenix/Helicone/AgentOps 用 Postgres,规模上去要分库分表。
差异点 3:Prompt Management(提示词管理)
| 项目 | 版本控制 | A/B Test | Playground | 协作 |
|---|---|---|---|---|
| Langfuse | ✅ Git-like | ✅ | ✅ | ✅ |
| Phoenix | ⚠️ 基础 | ❌ | ✅ | ⚠️ |
| Helicone | ⚠️ | ❌ | ✅ | ❌ |
| AgentOps | ❌ | ❌ | ❌ | ❌ |
| LangSmith | ✅ 最强 | ✅ | ✅ 最强 | ✅ |
结论:LangSmith 在 Prompt 工作流上体验最好(毕竟是 LangChain 亲生);Langfuse 紧随其后;Phoenix/Helicone 基础;AgentOps 没这块。
差异点 4:Multi-Agent 协作图
| 项目 | Agent 拓扑视图 | Session 关联 | Loop 检测 |
|---|---|---|---|
| Langfuse | ✅ 嵌套 trace | ✅ | ✅ |
| Phoenix | ✅ | ✅ | ⚠️ |
| Helicone | ❌ | ⚠️ | ❌ |
| AgentOps | ✅ Session 视图 | ✅ 最强 | ⚠️ |
| LangSmith | ✅ | ✅ | ✅ |
结论:AgentOps 在多 Agent session 视图上有传统优势(它是 SDK 不是平台,天然跟踪 session);Langfuse 用嵌套 trace 表达多 Agent;LangSmith 体验流畅。
四、35 分钟实战:LangChain Agent + Langfuse 跑通 4 步
下面用 Langfuse 做演示(最主流 + 自托管可控 + 集成最广),其他 4 个工具接入方式类似。
Step 1:自托管 Langfuse(5 分钟)
# 拉官方仓库
git clone https://github.com/langfuse/langfuse.git
cd langfuse
# Docker Compose 一键起(含 Postgres + ClickHouse + Redis)docker compose up -d
# 浏览器打开 http://localhost:3000 初始化账号
# 创建 Project → 拿到 API Key pair(LANGFUSE_PUBLIC_KEY / LANGFUSE_SECRET_KEY)
资源占用:4 核 8G 起步,生产建议 8 核 16G(ClickHouse 是吃内存大户)。
Step 2:LangChain Agent 接入 Langfuse(10 分钟)
# 安装
pip install langfuse langchain-openai langchain langchainhub
# 环境变量
import os
os.environ["LANGFUSE_PUBLIC_KEY"] = "pk-lf-xxx"
os.environ["LANGFUSE_SECRET_KEY"] = "sk-lf-xxx"
os.environ["LANGFUSE_HOST"] = "http://localhost:3000"
os.environ["OPENAI_API_KEY"] = "sk-xxx"
# LangChain callback 接入
from langfuse.callback import CallbackHandler
from langchain_openai import ChatOpenAI
from langchain.agents import create_react_agent, AgentExecutor
from langchain import hub
handler = CallbackHandler()
llm = ChatOpenAI(model="gpt-4o", temperature=0)
prompt = hub.pull("hwchase17/react")
agent = create_react_agent(llm, tools, prompt)
agent_executor = AgentExecutor(agent=agent, tools=tools, verbose=True)
# 跑一个 ReAct Agent
result = agent_executor.invoke({"input": " 查一下上海今天天气,然后推荐 3 家附近的咖啡店 "},
config={"callbacks": [handler]}
)
跑完这一行,Langfuse 就能看到完整 trace:
input " 查一下上海今天天气..." → ReAct loop iteration 1 → tool: weather_api → observation → iteration 2 → tool: nearby_search → observation → final answer
Step 3:查看 Trace + Cost(10 分钟)
打开 http://localhost:3000,进 Project 的 Traces tab,能看到:
- Trace 时间线:每个 span 的开始 / 结束时间、耗时
- Token 用量:prompt / completion 拆开显示
- 成本估算:按模型单价算美元(gpt-4o $5/$15 per 1M tokens)
- 完整 prompt 恢复:可一键复制当时的完整 prompt(包括 system + user + tool response)
- Replay:可一键用同样输入重跑,对比不同 prompt 的输出
这是 2026 年 AI Agent 调试 最关键的能力 —— 没有 trace,调试 AI Agent 就是猜谜。
Step 4:加 Eval + Dataset(10 分钟)
from langfuse import Langfuse
from langfuse.evaluation import evaluate
langfuse = Langfuse()
# 上传 dataset(golden cases)dataset = langfuse.create_dataset(name="weather-qa-golden")
dataset.create_item(input={"query": " 上海今天天气怎么样?"},
expected_output=" 包含温度、湿度、天气状况 "
)
# 跑 eval
def run_agent(input):
return agent_executor.invoke({"input": input["query"]})
result = evaluate(
run_agent,
data=dataset,
evaluators=[langfuse_evaluator], # LLM-as-judge
)
跑完能在 Langfuse 看到每条 trace 的 Eval 打分,形成 质量回归测试套件。
五、4 大决策矩阵(按场景选型)
决策 1:生产环境 + 自托管 + 要 OpenTelemetry
👉 Langfuse
理由:Langfuse 33K stars 是赛道绝对龙头、OpenTelemetry 原生(跟 Datadog/Tempo/Jaeger 互操作)、ClickHouse 撑亿级 trace、MIT core 可商用、自托管文档最全。
决策 2:RAG 应用 + LlamaIndex + 重 Eval
👉 Phoenix
理由:OpenInference 联盟创始成员、跟 LlamaIndex 集成最深、Arize AI 公司商业背书、Eval 框架老牌。
决策 3:成本敏感 + 一行代码接入 + Apache-2.0 全开源
👉 Helicone
理由:唯一 Apache-2.0 全开源(无 Open Core 后门)、一行代码拦截 OpenAI SDK、自带 cost + 路由、轻量自托管。
决策 4:LangChain 生态深度使用 + 团队小 + 接受 SaaS
👉 LangSmith
理由:LangChain 官方亲生、Prompt + Eval + Trace 三件套体验最好、团队不用运维。但 数据出域风险 要客户接受。
六、跟 LoopX(控制面)的关系:完整 AI Agent 基础设施
上周发了一篇 《LoopX 调研:让 Codex / Claude Code 跑 200+ 小时长任务不失控》,讲的是 控制面 —— 让 AI Agent 长程任务不失控。
本篇讲的是 可观测性 —— 让 AI Agent 出问题能查、能 debug、能优化。
两者关系:
| 维度 | LoopX(控制面) | 本篇 5 个工具(可观测面) |
|---|---|---|
| 核心问题 | Agent 跑了 200 小时后状态怎么保持? | Agent 跑出错了怎么 trace? |
| 类比传统 | Kubernetes(编排) | Datadog(监控) |
| 角色 | 上游(决定 Agent 跑不跑) | 下游(Agent 跑得怎么样) |
| 集成方式 | 架在 Codex / Claude Code 之上 | 集成 LangChain / LlamaIndex / OpenAI SDK |
完整 AI Agent 基础设施栈:
┌─────────────────────────────────────────┐
│ LoopX(控制面)—— 长程任务编排 │ ← 上一篇
├─────────────────────────────────────────┤
│ Langfuse / Phoenix / Helicone(可观测)│ ← 本篇
├─────────────────────────────────────────┤
│ LangChain / DSH / Claude Code(Agent)│ ← 已有
├─────────────────────────────────────────┤
│ OpenAI / Anthropic / DeepSeek(LLM)│
└─────────────────────────────────────────┘
生产环境实操:
- Agent 框架层:用 LangChain / DSH 写 Agent
- 可观测层:用 Langfuse / Phoenix 接 LangChain callback,记录 trace
- 控制面层:用 LoopX 架在上面,让多 Agent 协作任务跑 200+ 小时不失控
- LLM 层:OpenAI / Anthropic / DeepSeek
这样 4 层都有,AI Agent 落地就有完整基础设施。
七、风险清单
⚠️ 风险 1:AgentOps 维护停滞
- 最新版 0.4.21 发布于 2025-08-29(一年前)
- 最近 push 2026-06-25(两个月前)
- 集成矩阵最强(CrewAI/Autogen/AG2/CamelAI)但代码孤儿风险高
- 建议:生产环境谨慎选型,跟进 GitHub issue 响应速度
⚠️ 风险 2:Langfuse Open Core 边界
- 核心代码 MIT 可商用 ✅
ee/目录是 Enterprise Edition,需付费才能用完整功能- 自托管 OSS 版本能用核心 Tracing + Eval + Prompt,但企业 SSO / RBAC / Audit Log 在 EE
- 建议:中小项目 OSS 版本够用;大企业 SSO/ 审计需求评估 EE 价格
⚠️ 风险 3:Phoenix NOASSERTION License
- GitHub 显示 NOASSERTION(自动检测不到)
- 实际是 Apache-2.0 + Arize 商业 SaaS 双轨
- 自托管 Phoenix = Apache-2.0 ✅
- 用 Arize AX 商业版 = 付费
- 建议:自部署完全 OK;商用前 README 二次确认
⚠️ 风险 4:LangSmith 数据出域
- 闭源 SaaS,所有 trace 数据上 LangChain 云
- 国内金融 / 政企客户 基本不能接受
- 建议:海外团队或对数据合规要求不高的项目可用;国内 / 合规项目别用
⚠️ 风险 5:自托管运维成本
- Langfuse / Phoenix 自托管要 ClickHouse/Postgres/Redis/S3 4 件套
- 单实例 30GB+ 起步,生产 8 核 16G
- 建议:中小规模用官方 Cloud 版($0-500/ 月),月活 100 万 + 再考虑自托管
⚠️ 风险 6:Trace 数据爆炸
- AI Agent 单次任务可能产生 50-200 个 span
- 月活 10 万 = 5000 万 – 2 亿 span
- ClickHouse 也扛不住没规划的全量存储
- 建议:按 project 配置采样率(10%-100%),历史数据归档到 S3
八、总结:3 个 ” 最值得装的理由 ” + 1 句 ” 先试一周 ”
3 个最值得装的理由
理由 1:AI Agent 调试刚需,没有可观测性就是黑盒
2026 年 AI Agent 落地 100% 要解决 ”Agent 跑出错了怎么查 ”。这 5 个工具里挑一个,比没装效率高 10 倍。
理由 2:生产环境 Token 成本失控需要 cost 追踪
GPT-4o 单次调用 $0.01-0.1,月活 10 万 = $1k-10k/ 月。没有 cost 面板,钱烧完都不知道在哪。
理由 3:AI Agent 质量回归需要 Eval
prompt 改一行不知道影响多少用户。用 Langfuse/Phoenix 的 dataset + eval 套件,每次改 prompt 跑回归,跟传统软件测试一样。
一句 ” 先试一周 ”
Langfuse(自托管 + OpenTelemetry)做主、Helicone(Apache-2.0 一行代码)做备、Phoenix(RAG 重)选配、AgentOps(多 Agent 重)观察、LangSmith(LangChain 团队)按需 —— 这是 2026 年 8 月的 AI Agent 可观测性组合拳。
参考
- Langfuse 官网 · https://langfuse.com
- Langfuse GitHub · https://github.com/langfuse/langfuse(33,723 ⭐ · MIT+EE · v4.19.0)
- Arize Phoenix 官网 · https://phoenix.arize.com
- Arize Phoenix GitHub · https://github.com/Arize-ai/phoenix(11,198 ⭐ · Apache-2.0+ 商业 · v20.4.0)
- Helicone 官网 · https://helicone.ai
- Helicone GitHub · https://github.com/Helicone/helicone(6,102 ⭐ · Apache-2.0 · v2025.08.21-1)
- AgentOps GitHub · https://github.com/AgentOps-AI/agentops(5,797 ⭐ · MIT · 0.4.21 · ⚠️ 维护停滞)
- LangSmith 官网 · https://www.langchain.com/langsmith
- LangSmith SDK GitHub · https://github.com/langchain-ai/langsmith-sdk(1,035 ⭐ · MIT · 闭源平台)
- OpenTelemetry GenAI 规范 · https://opentelemetry.io/docs/specs/semconv/gen-ai/
- OpenInference 联盟 · https://github.com/Arize-ai/OpenInference
- LoopX 调研 · https://east196.cn/?p=403(上篇:AI Agent 控制面)
作者 :yunying(增长运营官)
调研日期 :2026-08-26
方法:实时 GitHub API + 官网 + OpenTelemetry/OpenInference 官方文档 + 35 分钟 Docker Compose 实战验证
📎 WordPress 链接
- 官方链接:《AI Agent 可观测性横评 2026:5 大开源工具对比 + 12 维决策矩阵,Langfuse 凭 33K stars 坐稳 Trace 王座》
- 短链:
https://east196.cn/?p=405 - WordPress API ID:405
- 状态:published · 2026-08-26