返回 AI 工具目录

Horovod

开发框架人工精选最近核验 2026年7月23日

Horovod 是 Uber 开源、现由 LF AI & Data 基金会托管的分布式深度学习训练框架,目标是把单机单卡训练脚本以较小改动扩展到多卡与多机集群。它采用 MPI 通信模型,核心是 allreduce/allgather/broadcast 等集合通信,并通过 Tensor Fusion 合并小张量、autotune 自动调参、Timeline 记录性能来提升扩展效率。支持 TensorFlow、Keras、PyTorch,可在 Docker、Kubernetes、Spark、Ray、HPC 等环境运行。适合已有单卡训练代码、需要横向扩展算力的团队;近年发布节奏放缓,MXNet 支持已进入遗留状态。

定价开源部署自托管、本地运行国内可达国内可达

解决什么问题

  • 把单机单卡训练脚本以少量改动扩展到多卡多机
  • 用 allreduce 等集合通信替代参数服务器,降低改造成本
  • Tensor Fusion 合并小张量并重叠计算与通信提升吞吐
  • 提供 Timeline 与 autotune 辅助定位扩展瓶颈

适合

  • 已有 TensorFlow/PyTorch 单卡训练、需横向扩展算力
  • 多机多卡数据并行训练场景
  • 在 Kubernetes、Spark、Ray 或 HPC 集群统一调度训练
  • 希望以较小代码改动接入分布式训练

不适合

  • 只做单卡训练、无扩展需求时收益有限
  • 主要依赖模型并行或超大参数切分的场景不是其强项
  • 需要活跃迭代与前沿特性者须注意近年发布节奏放缓
  • MXNet 相关支持已进入遗留状态,不建议新项目依赖

如何接入

  • 以 Python API 包装现有训练循环,改动集中在优化器与初始化
  • 依赖 MPI 或 Gloo 作为通信后端
  • 可配合 Docker、Kubernetes(Helm)、Spark、Ray 部署
  • 与 TensorFlow、Keras、PyTorch 框架对接

已知限制

  • 需自行准备多机网络与 GPU 环境,运维有门槛
  • 近年发布节奏放缓,活跃度不如早期
  • MXNet 支持为遗留状态
  • GitHub 与 pip 拉取国内可能需镜像

接入与使用事实

部署方式
自托管、本地运行
实现语言
Python、C++
中文界面
待确认
中文文档
待确认
定价方式
开源
许可证
待确认
国内可达性
国内可达
可达性观察
待补充

权限、依赖与维护信号

这些字段记录公开可见信号,不等同于安全审计结论。

权限信号

暂无公开信号。

依赖信号

暂无公开信号。

维护信号

暂无公开信号。

公开来源与证据

暂无可公开的来源链接。

访问官网