AI 观测与评估产品的功能边界越来越像:Trace、Dataset、Evaluator、Prompt、Dashboard,几乎都能在候选列表里找到。用勾选数量打分,通常会选出功能最多的产品,却不一定解决团队眼前的问题。
选型应从一组无法回答的问题开始。Agent 为什么失败总是靠猜?Prompt 改版后无法证明效果?线上数据不能离开公司?不同问题对应的门槛不同。团队如果还没定义一次任务、一次会话和一个质量分数的内部含义,平台接入只会增加字段,不会替团队完成定义。
先确定门槛,再比较体验
先写出当前最需要解决的两三个问题,以及不能妥协的限制。例如:必须完整还原跨服务工具调用;必须在内网部署;评估数据集要能在 CI 重跑;原始输入输出只能给少数角色查看。没有达到门槛的候选可以直接退出,不必靠其他加分项补回来。
达到门槛后,再沿实际工作流检查数据表达与接入体验:现有语言和 Agent 框架能否稳定采集 Trace、Session、工具调用、版本和 Score,线上失败能否进入离线评估。
治理与成本单独判断。明细、聚合和批量导出能否满足下游需求,权限、脱敏、保留与审计是否符合组织规则,订阅、模型评估、人工标注、自托管和维护的总成本能否接受。把这两组问题分开,避免接入体验掩盖治理缺口。
不要把“支持”当成已经验证。候选工具的功能深度可能相差很大,文档中同一个词也未必指向相同对象。选一组固定样本做 POC:一条包含检索和工具调用的 Agent Trace,一段多轮 Session,一组用户反馈,一个能重复运行的评估 Dataset。让每个候选处理同样的数据,再观察定位一次失败需要多久、字段是否完整、评估能否复跑、权限能否隔离,导出后是否还能重建关系。
Langfuse、LangSmith、Phoenix、MLflow、Braintrust、Weave,以及传统 APM 配合自建评估流水线,官方资料都展示了各自在追踪、评估或实验方面的能力。这里不做排行。产品更新很快,任何跨产品结论都应在选型当期回到各自官方文档核实。小团队可能更看重一体化和接入速度;已有 OTel、数仓和 ML 平台的团队,组合方案可能更顺手;自建换来控制权,也会增加长期责任。
选型结论应是一份可解释决策,而不是总分:解决哪些问题,哪些限制不可妥协,POC 看到了什么证据,接受哪些缺口,预计何时复核。这样产品能力变化后,团队还能沿原来的依据重新判断。
接入前就写退出计划
平台锁定不只发生在数据层。即使导出了全部 JSON,如果“任务”“版本”“质量分数”的含义只存在于平台 UI,迁移后仍然无法解释;Dataset、Evaluator 和 Prompt 规则只靠在线点击维护,也很难重建。
退出计划先做专属能力清单。列出 Prompt 标签、Evaluator、Dashboard、协作流程、权限模型和媒体处理等能力,标注哪些使用标准接口,哪些可以重建,哪些迁移时允许放弃。专属能力可以用,只要收益和退出代价同时可见。
迁移顺序遵循依赖关系。先迁身份和底层事实,包括 Trace、Session、稳定 ID、父子关系、输入输出与时间;再迁 Score、Dataset、Prompt 和 Experiment;最后重建 Dashboard、评论和协作视图。界面不同通常可以接受,底层事实缺失则无法补救。
OTel 和数据导出只能降低一部分锁定。第 10 章已经说明,OTel 能统一上下文传播和基础 Span,不保证每个平台的 Prompt、Token、媒体与评估对象完全互通;第 11 章也说明,拿到导出文件不等于保住了关系和指标口径。因此这里不再重复协议和接口细节,退出计划关心的是迁移后能否恢复工作。
用短期双写验证迁移
一次全量导出很难发现语义差异。迁移前应选择一小组代表性 Trace、Session、Score、Dataset 和 Experiment,在新旧平台短期双写。检查事件数量、父子关系、时间、Token、评分关联和聚合口径,不必追求两个页面看起来一样。
差异要分类处理:数据确实丢失、字段映射改变、产品能力不同,或两边默认计算口径不同。只有第一类能简单归为缺陷,其他差异需要明确转换规则或接受取舍。双写还会增加业务请求开销、存储和排障复杂度,因此应设置开始时间、样本范围和退出条件,不能无期限保留。
迁移验收先看底层事实:代表性 Trace 能完整重建,Trace 与 Session 边界没有混淆,核心指标偏差在预设范围。再看质量与治理资产:回归 Dataset 可以重新运行,Evaluator 配置和版本可追溯,权限、脱敏、保留及删除流程已经恢复。
新链路达到这些条件并稳定运行后,旧平台进入有期限的只读期。团队应能指出每项专属能力的替代方案、重建成本或放弃决定,并保存一次实际迁移演练记录。这些证据足以说明平台依赖处于可控状态。
候选工具官方来源
以下链接只用于确认候选产品的官方定位和当前能力,本文不据此排行:
- Langfuse Documentation,访问于 2026-08-18。
- LangSmith Evaluation Concepts,访问于 2026-08-18。
- Arize Phoenix Documentation,访问于 2026-08-18。
- MLflow Tracing for LLM and Agent Observability,访问于 2026-08-18。
- Braintrust Documentation,访问于 2026-08-18。
- W&B Weave Concepts,访问于 2026-08-18。
- OpenTelemetry Semantic Conventions,访问于 2026-08-18。
- OpenTelemetry GenAI Attributes,访问于 2026-08-18。
本地来源
知识库/AI应用可观测性与评估/提高篇/A24-如何选择观测与评估工具.md知识库/AI应用可观测性与评估/提高篇/A25-如何降低平台锁定.md知识库/AI应用可观测性与评估/AI应用可观测性与评估-延展研究.md知识库/AI应用可观测性与评估/01-知识映射与来源边界.md原始素材/langfuse-docs-md/docs__compatibility.md
参考资料
- Langfuse Documentation
- OpenTelemetry Semantic Conventions
- LangSmith Evaluation Concepts
- Arize Phoenix
系列目录:AI 应用可观测性与评估
