返回 AI 工具目录
TensorRT-LLM
基础设施人工精选最近核验 2026年7月23日
TensorRT-LLM 是 NVIDIA 开源的大模型推理加速库,用于在 NVIDIA GPU 上高效运行 LLM 与视觉生成模型。它提供 Python API 定义模型,内置面向注意力、GEMM、MoE 的定制算子,支持 FP8/FP4/INT4/AWQ 量化,以及张量并行、流水线并行、上下文并行、专家并行等切分策略,并实现投机解码、prefill-decode 分离等优化。预置 Llama、DeepSeek、Mixtral、Falcon 等模型实现,可与 Triton Inference Server、NVIDIA Dynamo 集成做数据中心级部署。以 Python/C++/CUDA 实现,Apache-2.0 许可,面向单卡到多机多卡场景。
定价开源部署自托管、本地运行国内可达国内可达
解决什么问题
- 在 NVIDIA GPU 上降低 LLM 推理延迟、提升吞吐
- 用量化与定制算子压缩显存并加速计算
- 通过多种并行策略把大模型切分到多卡多机
- 以投机解码等技术进一步提升生成吞吐
适合
- 在自有 NVIDIA GPU 上做高性能 LLM 推理服务
- 需要 FP8/INT4 等量化以控成本的部署
- 多卡或多机部署超大参数模型
- 希望配合 Triton 做数据中心级推理
不适合
- 强依赖 NVIDIA GPU,不支持其他厂商加速卡
- 构建与调优有门槛,不是开箱即用的推理服务
- 仅覆盖推理,不含训练或微调流程
- 高端数据中心 GPU 采购在国内可能受限
如何接入
- 用 Python API 定义或加载模型并编译推理引擎
- 提供 Python 与 C++ 运行时
- 可与 Triton Inference Server、NVIDIA Dynamo 集成
- 支持 Llama、DeepSeek、Mixtral 等预置模型
已知限制
- 仅支持 NVIDIA GPU,存在硬件锁定
- 编译与调优复杂,版本与硬件适配需投入
- 依赖数据中心级 GPU,部分型号对华供货受限
- 新特性迭代快,升级需跟进兼容性
接入与使用事实
- 部署方式
- 自托管、本地运行
- 实现语言
- Python、C++、CUDA
- 中文界面
- 待确认
- 中文文档
- 待确认
- 定价方式
- 开源
- 许可证
- 待确认
- 国内可达性
- 国内可达
- 可达性观察
- 待补充
权限、依赖与维护信号
这些字段记录公开可见信号,不等同于安全审计结论。
权限信号
暂无公开信号。
依赖信号
暂无公开信号。
维护信号
暂无公开信号。
公开来源与证据
暂无可公开的来源链接。
