返回 AI 工具目录
GPUStack
基础设施人工精选最近核验 2026年7月23日
GPUStack 是一个开源的 GPU 集群与模型推理管理平台,把从单台机器到跨机房、Kubernetes、云上的异构算力统一纳管,并以可插拔方式对接 vLLM、SGLang、TensorRT-LLM 等推理引擎来部署大模型、嵌入、重排与多模态服务。它面向需要自建推理底座的团队,提供算力调度、按需拉起 GPU 实例、模型生命周期管理、鉴权、监控与负载均衡等能力,并适配 NVIDIA、AMD 以及昇腾、海光、摩尔线程、天数、沐曦、寒武纪等国产加速卡,便于在信创与混合算力环境中落地。采用 Apache-2.0 许可,以 Docker/Python 服务形态自托管。
定价开源部署自托管、本地运行国内可达国内可达许可Apache-2.0
解决什么问题
- 统一纳管本地、K8s 与云上的异构 GPU 算力
- 可插拔对接 vLLM、SGLang、TensorRT-LLM 部署模型
- 覆盖大模型、嵌入、重排等多类推理服务
- 提供调度、监控、鉴权与负载均衡
- 适配 NVIDIA 与多种国产加速卡
适合
- 需要自建统一推理底座的中大型团队
- 拥有多品牌或国产 GPU 需要统一调度
- 信创或混合算力环境下的模型服务
- 希望自托管掌控数据与算力成本
不适合
- 仅调用外部模型 API、无自有 GPU 的场景不需要
- 无 K8s 与运维能力的小团队部署维护成本偏高
- 需要开箱即用托管服务的用户应选商业方案
- 对非常见加速卡的支持程度需先验证
如何接入
- 以 Docker 或 Python 服务部署 server 与 worker
- 通过 OpenAI 兼容 API 对上层应用暴露推理
- 纳管 vLLM、SGLang、TensorRT-LLM 等引擎
- 提供 Web 控制台与鉴权、监控、负载均衡
已知限制
- 自托管需自备 GPU 与运维投入
- 国产加速卡支持随版本演进,需按型号核验
- 从 HuggingFace 等拉取模型建议配国内镜像
- 高吞吐与低延迟需按引擎与硬件调优
接入与使用事实
- 部署方式
- 自托管、本地运行
- 实现语言
- Python
- 中文界面
- 待确认
- 中文文档
- 待确认
- 定价方式
- 开源
- 许可证
- Apache-2.0
- 国内可达性
- 国内可达
- 可达性观察
- 待补充
权限、依赖与维护信号
这些字段记录公开可见信号,不等同于安全审计结论。
权限信号
暂无公开信号。
依赖信号
暂无公开信号。
维护信号
暂无公开信号。
公开来源与证据
- 代码仓库仅作事实索引
