返回 AI 工具目录
Slurm
基础设施人工精选最近核验 2026年7月23日
Slurm(Slurm Workload Manager)是 SchedMD 维护的开源集群资源管理与作业调度系统,面向 Linux 高性能计算集群。它承担三类核心职责:在一段时间内为用户分配计算节点的独占或共享访问,提供在节点上启动、执行与监控并行作业的框架,以及通过排队机制仲裁资源争用。在 AI 场景中常用于调度 GPU 训练与推理作业,按队列、优先级与资源配额分配算力。以 C 为主实现,采用 GPL 许可,需自建部署在 Linux 集群上。
定价开源部署自托管国内可达国内可达
解决什么问题
- 在多用户集群上公平分配计算节点与算力
- 为并行作业提供启动、执行与监控框架
- 用排队与优先级仲裁资源争用
- 按配额与队列调度 GPU 训练与推理任务
适合
- 自建 GPU/HPC 集群需要统一作业调度
- 多团队共享算力需要配额与优先级管理
- 大规模模型训练的批量作业排队场景
- 已有 Linux 集群运维能力的团队
不适合
- 仅在 Linux 上测试与运行,不支持其他系统
- 单机或少量 GPU 场景引入调度器偏重
- 部署与运维需要专门的集群管理能力
- 不含模型训练框架,仅负责资源调度
如何接入
- 以 C 实现,提供命令行与作业脚本接口
- 可对接容器、MPI 与常见训练框架的批处理
- 通过插件机制扩展调度策略与记账
- 由 SchedMD 提供商业支持选项
已知限制
- 目前仅在 Linux 上经过测试
- 安装配置与运维复杂度较高
- 本身不提供训练/推理逻辑,仅做调度
- 高级支持与咨询需向 SchedMD 商业采购
接入与使用事实
- 部署方式
- 自托管
- 实现语言
- C、Python
- 中文界面
- 待确认
- 中文文档
- 待确认
- 定价方式
- 开源
- 许可证
- 待确认
- 国内可达性
- 国内可达
- 可达性观察
- 待补充
权限、依赖与维护信号
这些字段记录公开可见信号,不等同于安全审计结论。
权限信号
暂无公开信号。
依赖信号
暂无公开信号。
维护信号
暂无公开信号。
公开来源与证据
- 代码仓库仅作事实索引
