返回 AI 工具目录

Kaito

基础设施人工精选最近核验 2026年7月23日

Kaito(Kubernetes AI Toolchain Operator)是一个在 Kubernetes 上自动化大模型推理、微调与 RAG 部署的算子套件。它用简化的 CRD 隐藏并行、调度等底层参数,配合节点自动置备(Karpenter)按模型显存需求分配 GPU,支持 vLLM 兼容的 HuggingFace 模型,并提供管理向量库与嵌入服务的 RAGEngine。还可与 KEDA 联动做按负载自动扩缩,以及基于 Gateway API 的 KVCache 感知路由。定位是把在 K8s 上跑模型的复杂配置产品化,适合已有集群、想自托管推理的团队。

定价开源部署自托管国内可达国内可达

解决什么问题

  • 用 CRD 简化在 K8s 上部署大模型推理
  • 按模型显存自动置备与调度 GPU 节点
  • 内置 RAGEngine 管理向量库与嵌入服务
  • 兼容 vLLM 支持的 HuggingFace 模型
  • 配合 KEDA 做按负载自动扩缩容

适合

  • 已用 Kubernetes,想在集群内自托管模型推理
  • 需要标准化的模型微调与推理工作流
  • 希望 GPU 资源按模型需求自动分配
  • 要在集群内搭建 RAG 检索服务

不适合

  • 依赖 Kubernetes,无集群的团队门槛高
  • 需自备 GPU 节点,资源成本不可忽略
  • 默认模型源指向 HuggingFace,境内需换源
  • 偏运维基础设施,非开箱即用的应用

如何接入

  • 以 Operator 形式安装到 Kubernetes 集群
  • 通过 Workspace CRD 声明模型与资源
  • 对接 Karpenter 做 GPU 节点自动置备
  • 可与 KEDA、Gateway API 集成扩缩与路由

已知限制

  • 默认从 HuggingFace 拉取模型,境内需配镜像
  • 运维与调优仍需 Kubernetes 与 GPU 经验
  • 生态与预设围绕主流开源模型,私有模型需适配
  • 文档以英文为主

接入与使用事实

部署方式
自托管
实现语言
Go、Python
中文界面
待确认
中文文档
待确认
定价方式
开源
许可证
待确认
国内可达性
国内可达
可达性观察
待补充

权限、依赖与维护信号

这些字段记录公开可见信号,不等同于安全审计结论。

权限信号

暂无公开信号。

依赖信号

暂无公开信号。

维护信号

暂无公开信号。

公开来源与证据

暂无可公开的来源链接。

访问官网