返回 AI 工具目录
KubeAI
基础设施人工精选最近核验 2026年7月23日
KubeAI 是面向 Kubernetes 的 AI 推理 Operator,用于在集群上部署与扩展大模型、嵌入、重排与语音转写等推理服务。它兼容 OpenAI API(如 /v1/chat/completions、/v1/embeddings),支持从零副本自动扩缩容、模型缓存与卷管理,并针对多副本 vLLM 场景做前缀感知的负载均衡以改善 KV cache 利用。部署基于 Helm,无需 Istio 或 Knative 等额外依赖,支持 CPU、GPU、TPU 与动态 LoRA 适配器,可对接 Kafka、PubSub 等事件流。以 Go 编写,采用 Apache-2.0 许可,持续活跃维护。
定价开源部署自托管国内可达国内可达
解决什么问题
- 多副本 vLLM 默认负载均衡效率低
- K8s 上模型服务部署与扩缩繁琐
- 推理服务闲置时资源浪费
- 引入 Istio/Knative 增加复杂度
适合
- 在 K8s 上自建 LLM 推理平台
- 需要 OpenAI 兼容接口对接现有应用
- 多副本高并发需前缀感知路由
- 希望闲时缩到零以省资源
不适合
- 无 Kubernetes 环境时不适用
- 仅需托管 API 的团队成本偏高
- 单机小规模推理无需该方案
- 需具备 K8s 与推理运维能力
如何接入
- 提供 OpenAI 兼容的 REST 接口
- 通过 Helm 部署到任意 K8s 集群
- 支持 vLLM 等推理后端
- 可对接 Kafka、PubSub 事件流
- 支持动态 LoRA 适配器编排
已知限制
- 依赖 Kubernetes,有一定门槛
- 模型权重下载国内可能需镜像
- 生产调优需理解 KV cache 与调度
- GPU/TPU 资源成本需自行承担
接入与使用事实
- 部署方式
- 自托管
- 实现语言
- Go
- 中文界面
- 待确认
- 中文文档
- 待确认
- 定价方式
- 开源
- 许可证
- 待确认
- 国内可达性
- 国内可达
- 可达性观察
- 待补充
权限、依赖与维护信号
这些字段记录公开可见信号,不等同于安全审计结论。
权限信号
暂无公开信号。
依赖信号
暂无公开信号。
维护信号
暂无公开信号。
公开来源与证据
暂无可公开的来源链接。
