返回 AI 工具目录
TFServing
基础设施人工精选最近核验 2026年7月23日
TensorFlow Serving 是 TensorFlow 官方的高性能模型服务系统,面向生产环境的推理部署。它负责训练后模型的生命周期与版本管理:可同时加载多个模型或同一模型的多个版本,通过高效查找对外提供服务,支持在不改动客户端代码的情况下热切换与灰度、AB 发布。对外暴露 gRPC 与 REST/HTTP 两种推理接口,内置面向 GPU 优化的批处理调度以提升吞吐,转发开销很低。原生支持 TensorFlow SavedModel 格式,并可扩展到其他模型类型与特征处理。用 C++ 编写,推荐经 Docker 部署,支持 Kubernetes,以 Apache-2.0 开源。适合已用 TensorFlow、需要稳定高并发在线推理的团队。
定价开源部署自托管、本地运行国内可达国内可达许可Apache-2.0
解决什么问题
- 生产环境模型的稳定高性能推理服务
- 同时服务多模型与多版本
- 不改客户端即可热切换与灰度发布
- gRPC 与 REST 两种推理接口
- GPU 批处理调度提升吞吐
适合
- 已用 TensorFlow 需在线推理的团队
- 要求高并发、低延迟的服务场景
- 需要多版本管理与灰度、AB 发布
- 希望容器化部署到 Kubernetes
不适合
- 最契合 TensorFlow SavedModel,其他格式需扩展
- 非模型训练或数据处理工具
- 面向传统 ML 推理,非大模型对话服务
- 高级批处理与扩展有配置成本
如何接入
- 将 SavedModel 挂载给服务加载
- 经 gRPC 或 REST 接口发起推理
- 推荐用官方 Docker 镜像部署
- 可编排到 Kubernetes 做扩缩容
已知限制
- 对非 TF 模型需自行扩展适配
- 批处理与性能调优需按负载配置
- 面向传统 ML,非 LLM 专用服务栈
- 运维高可用需自行设计
接入与使用事实
- 部署方式
- 自托管、本地运行
- 实现语言
- C++
- 中文界面
- 待确认
- 中文文档
- 待确认
- 定价方式
- 开源
- 许可证
- Apache-2.0
- 国内可达性
- 国内可达
- 可达性观察
- 待补充
权限、依赖与维护信号
这些字段记录公开可见信号,不等同于安全审计结论。
权限信号
暂无公开信号。
依赖信号
暂无公开信号。
维护信号
暂无公开信号。
公开来源与证据
暂无可公开的来源链接。
