返回 AI 工具目录

KubeAI

基础设施人工精选最近核验 2026年7月23日

KubeAI 是面向 Kubernetes 的 AI 推理 Operator,用于在集群上部署与扩展大模型、嵌入、重排与语音转写等推理服务。它兼容 OpenAI API(如 /v1/chat/completions、/v1/embeddings),支持从零副本自动扩缩容、模型缓存与卷管理,并针对多副本 vLLM 场景做前缀感知的负载均衡以改善 KV cache 利用。部署基于 Helm,无需 Istio 或 Knative 等额外依赖,支持 CPU、GPU、TPU 与动态 LoRA 适配器,可对接 Kafka、PubSub 等事件流。以 Go 编写,采用 Apache-2.0 许可,持续活跃维护。

定价开源部署自托管国内可达国内可达

解决什么问题

  • 多副本 vLLM 默认负载均衡效率低
  • K8s 上模型服务部署与扩缩繁琐
  • 推理服务闲置时资源浪费
  • 引入 Istio/Knative 增加复杂度

适合

  • 在 K8s 上自建 LLM 推理平台
  • 需要 OpenAI 兼容接口对接现有应用
  • 多副本高并发需前缀感知路由
  • 希望闲时缩到零以省资源

不适合

  • 无 Kubernetes 环境时不适用
  • 仅需托管 API 的团队成本偏高
  • 单机小规模推理无需该方案
  • 需具备 K8s 与推理运维能力

如何接入

  • 提供 OpenAI 兼容的 REST 接口
  • 通过 Helm 部署到任意 K8s 集群
  • 支持 vLLM 等推理后端
  • 可对接 Kafka、PubSub 事件流
  • 支持动态 LoRA 适配器编排

已知限制

  • 依赖 Kubernetes,有一定门槛
  • 模型权重下载国内可能需镜像
  • 生产调优需理解 KV cache 与调度
  • GPU/TPU 资源成本需自行承担

接入与使用事实

部署方式
自托管
实现语言
Go
中文界面
待确认
中文文档
待确认
定价方式
开源
许可证
待确认
国内可达性
国内可达
可达性观察
待补充

权限、依赖与维护信号

这些字段记录公开可见信号,不等同于安全审计结论。

权限信号

暂无公开信号。

依赖信号

暂无公开信号。

维护信号

暂无公开信号。

公开来源与证据

暂无可公开的来源链接。

访问官网