返回 AI 工具目录
LMFlow
开发框架人工精选最近核验 2026年7月23日
面向大模型微调与推理的开源工具箱,由 OptimalScale 团队维护,目标是降低微调大模型的门槛。它提供全量微调、LoRA、LISA、QLoRA 等多种训练方式,配合梯度检查点、DeepSpeed Zero-3 等显存优化,可在有限算力上训练;推理端支持 FlashAttention、vLLM、SGLang 加速,并有长上下文位置插值与图文多模态能力。通过 HuggingFace 兼容 LLaMA 系列、Phi-3、ChatGLM、Baichuan 等模型,提供 Gradio 界面与 Flask 支持。Apache 2.0 许可,自托管开源;官方主要在 Linux 上测试,macOS/Windows 可能报错。
定价开源部署本地运行、自托管国内可达国内可达许可Apache-2.0
解决什么问题
- 提供全量、LoRA、LISA、QLoRA 多种微调方式
- 用 DeepSpeed、梯度检查点降低显存占用
- 推理支持 vLLM、SGLang、FlashAttention 加速
- 通过 HuggingFace 兼容主流开源模型
- 支持长上下文与图文多模态输入
适合
- 需要在有限 GPU 上微调开源大模型的团队
- 关注显存优化与低成本训练的研究者
- 要微调 ChatGLM、Baichuan 等中文模型
- 想统一微调到推理的一套工具链
不适合
- 面向有 ML 工程能力的研究/工程团队
- 官方主要在 Linux 测试,macOS/Windows 可能报错
- 大模型全量微调仍需可观 GPU 显存
- 非托管服务,训练环境与算力自备
如何接入
- 模型:LLaMA 系列、Phi-3、ChatGLM、Baichuan 等
- 训练:LoRA、QLoRA、LISA、DeepSpeed Zero-3
- 推理:vLLM、SGLang、FlashAttention
- 界面:Gradio Web 与 Flask 服务
已知限制
- 显存需求随模型规模上升,大模型成本高
- macOS/Windows 未充分测试,建议用 Linux
- 训练效果依赖数据质量与超参调优
- 自托管无官方 SLA,需自行运维
接入与使用事实
- 部署方式
- 本地运行、自托管
- 实现语言
- Python
- 中文界面
- 待确认
- 中文文档
- 待确认
- 定价方式
- 开源
- 许可证
- Apache-2.0
- 国内可达性
- 国内可达
- 可达性观察
- 待补充
权限、依赖与维护信号
这些字段记录公开可见信号,不等同于安全审计结论。
权限信号
暂无公开信号。
依赖信号
暂无公开信号。
维护信号
暂无公开信号。
公开来源与证据
暂无可公开的来源链接。
