返回 AI 工具目录

LMFlow

开发框架人工精选最近核验 2026年7月23日

面向大模型微调与推理的开源工具箱,由 OptimalScale 团队维护,目标是降低微调大模型的门槛。它提供全量微调、LoRA、LISA、QLoRA 等多种训练方式,配合梯度检查点、DeepSpeed Zero-3 等显存优化,可在有限算力上训练;推理端支持 FlashAttention、vLLM、SGLang 加速,并有长上下文位置插值与图文多模态能力。通过 HuggingFace 兼容 LLaMA 系列、Phi-3、ChatGLM、Baichuan 等模型,提供 Gradio 界面与 Flask 支持。Apache 2.0 许可,自托管开源;官方主要在 Linux 上测试,macOS/Windows 可能报错。

定价开源部署本地运行、自托管国内可达国内可达许可Apache-2.0

解决什么问题

  • 提供全量、LoRA、LISA、QLoRA 多种微调方式
  • 用 DeepSpeed、梯度检查点降低显存占用
  • 推理支持 vLLM、SGLang、FlashAttention 加速
  • 通过 HuggingFace 兼容主流开源模型
  • 支持长上下文与图文多模态输入

适合

  • 需要在有限 GPU 上微调开源大模型的团队
  • 关注显存优化与低成本训练的研究者
  • 要微调 ChatGLM、Baichuan 等中文模型
  • 想统一微调到推理的一套工具链

不适合

  • 面向有 ML 工程能力的研究/工程团队
  • 官方主要在 Linux 测试,macOS/Windows 可能报错
  • 大模型全量微调仍需可观 GPU 显存
  • 非托管服务,训练环境与算力自备

如何接入

  • 模型:LLaMA 系列、Phi-3、ChatGLM、Baichuan 等
  • 训练:LoRA、QLoRA、LISA、DeepSpeed Zero-3
  • 推理:vLLM、SGLang、FlashAttention
  • 界面:Gradio Web 与 Flask 服务

已知限制

  • 显存需求随模型规模上升,大模型成本高
  • macOS/Windows 未充分测试,建议用 Linux
  • 训练效果依赖数据质量与超参调优
  • 自托管无官方 SLA,需自行运维

接入与使用事实

部署方式
本地运行、自托管
实现语言
Python
中文界面
待确认
中文文档
待确认
定价方式
开源
许可证
Apache-2.0
国内可达性
国内可达
可达性观察
待补充

权限、依赖与维护信号

这些字段记录公开可见信号,不等同于安全审计结论。

权限信号

暂无公开信号。

依赖信号

暂无公开信号。

维护信号

暂无公开信号。

公开来源与证据

暂无可公开的来源链接。

访问官网