返回 AI 工具目录

TensorRT-LLM

基础设施人工精选最近核验 2026年7月23日

TensorRT-LLM 是 NVIDIA 开源的大模型推理加速库,用于在 NVIDIA GPU 上高效运行 LLM 与视觉生成模型。它提供 Python API 定义模型,内置面向注意力、GEMM、MoE 的定制算子,支持 FP8/FP4/INT4/AWQ 量化,以及张量并行、流水线并行、上下文并行、专家并行等切分策略,并实现投机解码、prefill-decode 分离等优化。预置 Llama、DeepSeek、Mixtral、Falcon 等模型实现,可与 Triton Inference Server、NVIDIA Dynamo 集成做数据中心级部署。以 Python/C++/CUDA 实现,Apache-2.0 许可,面向单卡到多机多卡场景。

定价开源部署自托管、本地运行国内可达国内可达

解决什么问题

  • 在 NVIDIA GPU 上降低 LLM 推理延迟、提升吞吐
  • 用量化与定制算子压缩显存并加速计算
  • 通过多种并行策略把大模型切分到多卡多机
  • 以投机解码等技术进一步提升生成吞吐

适合

  • 在自有 NVIDIA GPU 上做高性能 LLM 推理服务
  • 需要 FP8/INT4 等量化以控成本的部署
  • 多卡或多机部署超大参数模型
  • 希望配合 Triton 做数据中心级推理

不适合

  • 强依赖 NVIDIA GPU,不支持其他厂商加速卡
  • 构建与调优有门槛,不是开箱即用的推理服务
  • 仅覆盖推理,不含训练或微调流程
  • 高端数据中心 GPU 采购在国内可能受限

如何接入

  • 用 Python API 定义或加载模型并编译推理引擎
  • 提供 Python 与 C++ 运行时
  • 可与 Triton Inference Server、NVIDIA Dynamo 集成
  • 支持 Llama、DeepSeek、Mixtral 等预置模型

已知限制

  • 仅支持 NVIDIA GPU,存在硬件锁定
  • 编译与调优复杂,版本与硬件适配需投入
  • 依赖数据中心级 GPU,部分型号对华供货受限
  • 新特性迭代快,升级需跟进兼容性

接入与使用事实

部署方式
自托管、本地运行
实现语言
Python、C++、CUDA
中文界面
待确认
中文文档
待确认
定价方式
开源
许可证
待确认
国内可达性
国内可达
可达性观察
待补充

权限、依赖与维护信号

这些字段记录公开可见信号,不等同于安全审计结论。

权限信号

暂无公开信号。

依赖信号

暂无公开信号。

维护信号

暂无公开信号。

公开来源与证据

暂无可公开的来源链接。

访问官网