返回 AI 工具目录
Horovod
开发框架人工精选最近核验 2026年7月23日
Horovod 是 Uber 开源、现由 LF AI & Data 基金会托管的分布式深度学习训练框架,目标是把单机单卡训练脚本以较小改动扩展到多卡与多机集群。它采用 MPI 通信模型,核心是 allreduce/allgather/broadcast 等集合通信,并通过 Tensor Fusion 合并小张量、autotune 自动调参、Timeline 记录性能来提升扩展效率。支持 TensorFlow、Keras、PyTorch,可在 Docker、Kubernetes、Spark、Ray、HPC 等环境运行。适合已有单卡训练代码、需要横向扩展算力的团队;近年发布节奏放缓,MXNet 支持已进入遗留状态。
定价开源部署自托管、本地运行国内可达国内可达
解决什么问题
- 把单机单卡训练脚本以少量改动扩展到多卡多机
- 用 allreduce 等集合通信替代参数服务器,降低改造成本
- Tensor Fusion 合并小张量并重叠计算与通信提升吞吐
- 提供 Timeline 与 autotune 辅助定位扩展瓶颈
适合
- 已有 TensorFlow/PyTorch 单卡训练、需横向扩展算力
- 多机多卡数据并行训练场景
- 在 Kubernetes、Spark、Ray 或 HPC 集群统一调度训练
- 希望以较小代码改动接入分布式训练
不适合
- 只做单卡训练、无扩展需求时收益有限
- 主要依赖模型并行或超大参数切分的场景不是其强项
- 需要活跃迭代与前沿特性者须注意近年发布节奏放缓
- MXNet 相关支持已进入遗留状态,不建议新项目依赖
如何接入
- 以 Python API 包装现有训练循环,改动集中在优化器与初始化
- 依赖 MPI 或 Gloo 作为通信后端
- 可配合 Docker、Kubernetes(Helm)、Spark、Ray 部署
- 与 TensorFlow、Keras、PyTorch 框架对接
已知限制
- 需自行准备多机网络与 GPU 环境,运维有门槛
- 近年发布节奏放缓,活跃度不如早期
- MXNet 支持为遗留状态
- GitHub 与 pip 拉取国内可能需镜像
接入与使用事实
- 部署方式
- 自托管、本地运行
- 实现语言
- Python、C++
- 中文界面
- 待确认
- 中文文档
- 待确认
- 定价方式
- 开源
- 许可证
- 待确认
- 国内可达性
- 国内可达
- 可达性观察
- 待补充
权限、依赖与维护信号
这些字段记录公开可见信号,不等同于安全审计结论。
权限信号
暂无公开信号。
依赖信号
暂无公开信号。
维护信号
暂无公开信号。
公开来源与证据
暂无可公开的来源链接。
