返回 AI 工具目录

Slurm

基础设施人工精选最近核验 2026年7月23日

Slurm(Slurm Workload Manager)是 SchedMD 维护的开源集群资源管理与作业调度系统,面向 Linux 高性能计算集群。它承担三类核心职责:在一段时间内为用户分配计算节点的独占或共享访问,提供在节点上启动、执行与监控并行作业的框架,以及通过排队机制仲裁资源争用。在 AI 场景中常用于调度 GPU 训练与推理作业,按队列、优先级与资源配额分配算力。以 C 为主实现,采用 GPL 许可,需自建部署在 Linux 集群上。

定价开源部署自托管国内可达国内可达

解决什么问题

  • 在多用户集群上公平分配计算节点与算力
  • 为并行作业提供启动、执行与监控框架
  • 用排队与优先级仲裁资源争用
  • 按配额与队列调度 GPU 训练与推理任务

适合

  • 自建 GPU/HPC 集群需要统一作业调度
  • 多团队共享算力需要配额与优先级管理
  • 大规模模型训练的批量作业排队场景
  • 已有 Linux 集群运维能力的团队

不适合

  • 仅在 Linux 上测试与运行,不支持其他系统
  • 单机或少量 GPU 场景引入调度器偏重
  • 部署与运维需要专门的集群管理能力
  • 不含模型训练框架,仅负责资源调度

如何接入

  • 以 C 实现,提供命令行与作业脚本接口
  • 可对接容器、MPI 与常见训练框架的批处理
  • 通过插件机制扩展调度策略与记账
  • 由 SchedMD 提供商业支持选项

已知限制

  • 目前仅在 Linux 上经过测试
  • 安装配置与运维复杂度较高
  • 本身不提供训练/推理逻辑,仅做调度
  • 高级支持与咨询需向 SchedMD 商业采购

接入与使用事实

部署方式
自托管
实现语言
C、Python
中文界面
待确认
中文文档
待确认
定价方式
开源
许可证
待确认
国内可达性
国内可达
可达性观察
待补充

权限、依赖与维护信号

这些字段记录公开可见信号,不等同于安全审计结论。

权限信号

暂无公开信号。

依赖信号

暂无公开信号。

维护信号

暂无公开信号。

公开来源与证据

  1. 代码仓库仅作事实索引

访问官网