返回 AI 工具目录

Triton Inference Server

基础设施人工精选最近核验 2026年7月23日

Triton Inference Server(前称 TensorRT Inference Server / TRTIS)是 NVIDIA 开源的推理服务软件,用于把多种框架的模型统一部署到生产环境。它支持 TensorRT、PyTorch、ONNX、OpenVINO、Python、RAPIDS FIL 等多种后端,具备并发模型执行、动态批处理、序列批处理与隐式状态管理、模型集成与业务逻辑脚本等能力,基于 KServe 标准提供 HTTP/REST 与 gRPC 接口,并含 C、Java 的进程内 API 与性能监控。可运行在 NVIDIA GPU、x86、ARM 与 AWS Inferentia 上,覆盖云、数据中心、边缘与嵌入式场景,通常以 Docker 容器部署或从源码构建。

定价开源部署自托管、本地运行国内可达国内可达许可BSD-3-Clause

解决什么问题

  • 把多种框架的模型统一部署为推理服务
  • 以动态批处理与并发执行提升利用率
  • 同时支持 HTTP/REST 与 gRPC 接口
  • 通过模型集成串联预处理与多模型流程
  • 覆盖云、数据中心、边缘到嵌入式部署

适合

  • 需同时服务多框架、多模型的推理平台
  • 追求 GPU 利用率与吞吐的生产环境
  • 以 NVIDIA GPU 为主的推理基础设施
  • 需要标准化接口与监控的团队

不适合

  • 充分发挥性能通常依赖 NVIDIA GPU 生态
  • 功能面广,配置与调优有学习成本
  • 它是服务框架,模型与权重需自备
  • 轻量单模型场景可能引入过多复杂度

如何接入

  • 以 Docker 容器部署或从源码构建
  • 基于 KServe 标准提供 HTTP/REST 与 gRPC
  • 支持 TensorRT、PyTorch、ONNX、OpenVINO 等后端
  • 提供 C、Java 进程内 API 与性能指标

已知限制

  • 性能优化与 NVIDIA 硬件及软件栈耦合较深
  • 多后端与高级特性配置复杂
  • 镜像多经 NVIDIA NGC,国内拉取需处理
  • 文档以英文为主

接入与使用事实

部署方式
自托管、本地运行
实现语言
C++、Python
中文界面
待确认
中文文档
待确认
定价方式
开源
许可证
BSD-3-Clause
国内可达性
国内可达
可达性观察
待补充

权限、依赖与维护信号

这些字段记录公开可见信号,不等同于安全审计结论。

权限信号

暂无公开信号。

依赖信号

暂无公开信号。

维护信号

暂无公开信号。

公开来源与证据

暂无可公开的来源链接。

访问官网