返回 AI 工具目录
Kaito
基础设施人工精选最近核验 2026年7月23日
Kaito(Kubernetes AI Toolchain Operator)是一个在 Kubernetes 上自动化大模型推理、微调与 RAG 部署的算子套件。它用简化的 CRD 隐藏并行、调度等底层参数,配合节点自动置备(Karpenter)按模型显存需求分配 GPU,支持 vLLM 兼容的 HuggingFace 模型,并提供管理向量库与嵌入服务的 RAGEngine。还可与 KEDA 联动做按负载自动扩缩,以及基于 Gateway API 的 KVCache 感知路由。定位是把在 K8s 上跑模型的复杂配置产品化,适合已有集群、想自托管推理的团队。
定价开源部署自托管国内可达国内可达
解决什么问题
- 用 CRD 简化在 K8s 上部署大模型推理
- 按模型显存自动置备与调度 GPU 节点
- 内置 RAGEngine 管理向量库与嵌入服务
- 兼容 vLLM 支持的 HuggingFace 模型
- 配合 KEDA 做按负载自动扩缩容
适合
- 已用 Kubernetes,想在集群内自托管模型推理
- 需要标准化的模型微调与推理工作流
- 希望 GPU 资源按模型需求自动分配
- 要在集群内搭建 RAG 检索服务
不适合
- 依赖 Kubernetes,无集群的团队门槛高
- 需自备 GPU 节点,资源成本不可忽略
- 默认模型源指向 HuggingFace,境内需换源
- 偏运维基础设施,非开箱即用的应用
如何接入
- 以 Operator 形式安装到 Kubernetes 集群
- 通过 Workspace CRD 声明模型与资源
- 对接 Karpenter 做 GPU 节点自动置备
- 可与 KEDA、Gateway API 集成扩缩与路由
已知限制
- 默认从 HuggingFace 拉取模型,境内需配镜像
- 运维与调优仍需 Kubernetes 与 GPU 经验
- 生态与预设围绕主流开源模型,私有模型需适配
- 文档以英文为主
接入与使用事实
- 部署方式
- 自托管
- 实现语言
- Go、Python
- 中文界面
- 待确认
- 中文文档
- 待确认
- 定价方式
- 开源
- 许可证
- 待确认
- 国内可达性
- 国内可达
- 可达性观察
- 待补充
权限、依赖与维护信号
这些字段记录公开可见信号,不等同于安全审计结论。
权限信号
暂无公开信号。
依赖信号
暂无公开信号。
维护信号
暂无公开信号。
公开来源与证据
暂无可公开的来源链接。
