返回 AI 工具目录
Langfuse
基础设施人工精选最近核验 2026年7月23日
Langfuse 是开源(核心 MIT,企业版功能在 ee 目录另行授权)的大模型工程与可观测平台,帮助团队开发、监控、评估与调试 AI 应用。核心能力:链路追踪(记录 LLM 调用、检索、嵌入与 Agent 动作,支持会话排查)、Prompt 管理(版本控制与协作)、评估(LLM 裁判、代码评估器、用户反馈、人工标注)、数据集、Playground,以及带类型化 SDK(Python、JS/TS)的完整 API。集成 OpenAI SDK、LangChain、LlamaIndex、LiteLLM、OpenTelemetry 等。部署可用官方云(含免费额度)或自托管(Docker Compose、Kubernetes/Helm、Terraform),代码以 TypeScript 为主。
定价开源部署SaaS 云服务、自托管、API 接入国内可达国内可达
解决什么问题
- 大模型应用上线后普遍缺乏看得见的手段:多步调用、检索与工具动作出问题难定位,Prompt 散落代码里、改动无版本,效果好坏靠人工感觉缺乏可量化评估;Langfuse 针对 LLMOps 这条链路提供统一平台
- 追踪层把每次请求的完整链路(模型调用、参数、token、耗时、检索与 Agent 步骤)结构化记录,支持按会话与用户排查,便于定位延迟、错误与异常输出
- Prompt 管理把提示词集中做版本控制与协作,并带缓存以避免拉取带来的延迟
- 评估层支持 LLM 裁判、代码评估器、用户反馈与人工标注,配合数据集做上线前基准与持续回归,把改得好不好变成可比较的指标;Playground 便于快速试验不同 Prompt 与模型配置
- 以 SDK 与 OpenTelemetry 接入,几乎不侵入业务代码即可为既有 AI 应用补上可观测、可评测与可迭代的闭环
适合
- 适合正在把大模型应用推向生产、需要可观测与可评测能力的工程团队;要排查多步链路(RAG、Agent、工具调用)延迟与异常输出的场景
- 希望把 Prompt 从代码里抽出来做版本管理与协作的团队;需要用数据集加自动评估(LLM 裁判、代码评估器)做上线前基准与持续回归的团队
- 要把 LLM 调用纳入统一监控与成本/用量观测的平台方
- 与主流框架(LangChain、LlamaIndex、LiteLLM、OpenAI SDK、Vercel AI SDK)和 OpenTelemetry 集成良好,适合作为自建 AI 栈的观测与评测层,与推理引擎(vLLM/SGLang)、网关(LiteLLM)分工互补
- 对数据合规敏感、要求追踪数据留在境内的组织,可选自托管形态
不适合
- 不适合尚处原型阶段、调用量很小、无需正式追踪与评估的项目,引入平台可能过重
- 它是观测与评测层,不做模型推理,也不做多供应商路由与计费,那分别是 vLLM/SGLang 与 LiteLLM 的职责
- 若只想要基础的日志和指标,已有 APM 或日志系统或许够用,不必专门引入 LLMOps 平台
- 自托管形态包含 ClickHouse 等组件,对运维有一定要求,缺乏运维能力又不接受数据出境的小团队会比较吃力
- 自动评估(尤其 LLM 裁判)的结果本身有不确定性,应作为参考而非绝对判据;评估质量取决于数据集与评测设计,平台提供工具但不替代评测方法
如何接入
- 接入以 SDK 为主:Python 与 JS/TS 类型化 SDK,可包裹 OpenAI SDK 自动埋点,或通过 LangChain、LlamaIndex、LiteLLM、Vercel AI SDK 的原生集成把追踪数据送入 Langfuse;也支持 OpenTelemetry,便于并入既有观测体系
- Prompt 通过控制台或 API 管理版本,应用运行时按名称拉取(带缓存)
- 部署两种形态:一是官方云 cloud.langfuse.com(含免费额度,数据在海外);二是自托管——Docker Compose 适合单机或 VM,Kubernetes(Helm)适合集群,另有面向 AWS/Azure/GCP 的 Terraform 模板
- 自托管栈通常包含 Postgres、ClickHouse、Redis 与对象存储等组件
- 在自建 AI 栈中,Langfuse 位于观测与评测层,前接应用与框架、旁路记录,与推理引擎和网关解耦,不在关键请求路径上强依赖
已知限制
- 自托管栈组件较多(Postgres、ClickHouse、Redis、对象存储),规模化后有部署、扩容与运维成本,追踪数据量大时需关注存储与查询性能
- 部分企业级功能(位于 ee 目录)另行授权,非全部 MIT,选型前应确认所需功能的许可边界
- 自动评估结果(LLM 裁判等)有不确定性,指标应作参考;评测质量依赖数据集设计
- 国内可达性:平台可自托管在境内,追踪数据留在自有基础设施、便于满足数据留存与合规要求;但 Langfuse Cloud 部署在海外(欧盟或美国),使用云版意味着 AI 应用的调用数据(可能含用户输入)出境,合规敏感场景应选自托管
- 镜像与依赖(GitHub、npm、Docker Hub 及 ClickHouse 等)在国内拉取可能较慢,建议用内网镜像源;项目迭代较快,升级前建议锁版本并验证数据迁移
接入与使用事实
- 部署方式
- SaaS 云服务、自托管、API 接入
- 实现语言
- TypeScript
- 中文界面
- 待确认
- 中文文档
- 待确认
- 定价方式
- 开源
- 许可证
- 待确认
- 国内可达性
- 国内可达
- 可达性观察
- 待补充
权限、依赖与维护信号
这些字段记录公开可见信号,不等同于安全审计结论。
权限信号
暂无公开信号。
依赖信号
暂无公开信号。
维护信号
暂无公开信号。
公开来源与证据
- 代码仓库仅作事实索引
