返回 AI 工具目录

Langfuse

基础设施人工精选最近核验 2026年7月23日

Langfuse 是开源(核心 MIT,企业版功能在 ee 目录另行授权)的大模型工程与可观测平台,帮助团队开发、监控、评估与调试 AI 应用。核心能力:链路追踪(记录 LLM 调用、检索、嵌入与 Agent 动作,支持会话排查)、Prompt 管理(版本控制与协作)、评估(LLM 裁判、代码评估器、用户反馈、人工标注)、数据集、Playground,以及带类型化 SDK(Python、JS/TS)的完整 API。集成 OpenAI SDK、LangChain、LlamaIndex、LiteLLM、OpenTelemetry 等。部署可用官方云(含免费额度)或自托管(Docker Compose、Kubernetes/Helm、Terraform),代码以 TypeScript 为主。

定价开源部署SaaS 云服务、自托管、API 接入国内可达国内可达

解决什么问题

  • 大模型应用上线后普遍缺乏看得见的手段:多步调用、检索与工具动作出问题难定位,Prompt 散落代码里、改动无版本,效果好坏靠人工感觉缺乏可量化评估;Langfuse 针对 LLMOps 这条链路提供统一平台
  • 追踪层把每次请求的完整链路(模型调用、参数、token、耗时、检索与 Agent 步骤)结构化记录,支持按会话与用户排查,便于定位延迟、错误与异常输出
  • Prompt 管理把提示词集中做版本控制与协作,并带缓存以避免拉取带来的延迟
  • 评估层支持 LLM 裁判、代码评估器、用户反馈与人工标注,配合数据集做上线前基准与持续回归,把改得好不好变成可比较的指标;Playground 便于快速试验不同 Prompt 与模型配置
  • 以 SDK 与 OpenTelemetry 接入,几乎不侵入业务代码即可为既有 AI 应用补上可观测、可评测与可迭代的闭环

适合

  • 适合正在把大模型应用推向生产、需要可观测与可评测能力的工程团队;要排查多步链路(RAG、Agent、工具调用)延迟与异常输出的场景
  • 希望把 Prompt 从代码里抽出来做版本管理与协作的团队;需要用数据集加自动评估(LLM 裁判、代码评估器)做上线前基准与持续回归的团队
  • 要把 LLM 调用纳入统一监控与成本/用量观测的平台方
  • 与主流框架(LangChain、LlamaIndex、LiteLLM、OpenAI SDK、Vercel AI SDK)和 OpenTelemetry 集成良好,适合作为自建 AI 栈的观测与评测层,与推理引擎(vLLM/SGLang)、网关(LiteLLM)分工互补
  • 对数据合规敏感、要求追踪数据留在境内的组织,可选自托管形态

不适合

  • 不适合尚处原型阶段、调用量很小、无需正式追踪与评估的项目,引入平台可能过重
  • 它是观测与评测层,不做模型推理,也不做多供应商路由与计费,那分别是 vLLM/SGLang 与 LiteLLM 的职责
  • 若只想要基础的日志和指标,已有 APM 或日志系统或许够用,不必专门引入 LLMOps 平台
  • 自托管形态包含 ClickHouse 等组件,对运维有一定要求,缺乏运维能力又不接受数据出境的小团队会比较吃力
  • 自动评估(尤其 LLM 裁判)的结果本身有不确定性,应作为参考而非绝对判据;评估质量取决于数据集与评测设计,平台提供工具但不替代评测方法

如何接入

  • 接入以 SDK 为主:Python 与 JS/TS 类型化 SDK,可包裹 OpenAI SDK 自动埋点,或通过 LangChain、LlamaIndex、LiteLLM、Vercel AI SDK 的原生集成把追踪数据送入 Langfuse;也支持 OpenTelemetry,便于并入既有观测体系
  • Prompt 通过控制台或 API 管理版本,应用运行时按名称拉取(带缓存)
  • 部署两种形态:一是官方云 cloud.langfuse.com(含免费额度,数据在海外);二是自托管——Docker Compose 适合单机或 VM,Kubernetes(Helm)适合集群,另有面向 AWS/Azure/GCP 的 Terraform 模板
  • 自托管栈通常包含 Postgres、ClickHouse、Redis 与对象存储等组件
  • 在自建 AI 栈中,Langfuse 位于观测与评测层,前接应用与框架、旁路记录,与推理引擎和网关解耦,不在关键请求路径上强依赖

已知限制

  • 自托管栈组件较多(Postgres、ClickHouse、Redis、对象存储),规模化后有部署、扩容与运维成本,追踪数据量大时需关注存储与查询性能
  • 部分企业级功能(位于 ee 目录)另行授权,非全部 MIT,选型前应确认所需功能的许可边界
  • 自动评估结果(LLM 裁判等)有不确定性,指标应作参考;评测质量依赖数据集设计
  • 国内可达性:平台可自托管在境内,追踪数据留在自有基础设施、便于满足数据留存与合规要求;但 Langfuse Cloud 部署在海外(欧盟或美国),使用云版意味着 AI 应用的调用数据(可能含用户输入)出境,合规敏感场景应选自托管
  • 镜像与依赖(GitHub、npm、Docker Hub 及 ClickHouse 等)在国内拉取可能较慢,建议用内网镜像源;项目迭代较快,升级前建议锁版本并验证数据迁移

接入与使用事实

部署方式
SaaS 云服务、自托管、API 接入
实现语言
TypeScript
中文界面
待确认
中文文档
待确认
定价方式
开源
许可证
待确认
国内可达性
国内可达
可达性观察
待补充

权限、依赖与维护信号

这些字段记录公开可见信号,不等同于安全审计结论。

权限信号

暂无公开信号。

依赖信号

暂无公开信号。

维护信号

暂无公开信号。

公开来源与证据

  1. 代码仓库仅作事实索引

访问官网