返回 AI 工具目录
bitsandbytes
开发框架人工精选最近核验 2026年7月23日
bitsandbytes 是面向 PyTorch 的 k-bit 量化库,由 bitsandbytes-foundation 维护。它通过 8-bit 优化器、LLM.int8() 8-bit 推理与 QLoRA 4-bit 训练,把大模型的显存占用大幅降低,让单卡或消费级环境也能加载与微调较大的模型。它以 Linear8bitLt、Linear4bit 等算子替换原有线性层,已集成进 Hugging Face Transformers、Diffusers、PEFT 生态,pip 安装即可使用。主要支持 NVIDIA GPU(SM60 起),并对 AMD、Intel GPU、CPU、Apple Silicon 提供不同程度支持。定位是模型压缩与显存优化的底层组件,而非训练框架本身。
定价开源部署本地运行国内可达国内可达许可MIT
解决什么问题
- 大模型加载或微调时显存不足、单卡放不下
- 全精度推理占用显存高、部署成本大
- QLoRA 用 4-bit 量化实现低显存微调
- 8-bit 优化器降低训练时的优化器状态显存
适合
- 需在有限显存 GPU 上加载或推理较大模型
- 用 QLoRA 在单卡做参数高效微调
- 基于 Hugging Face 生态做量化部署
- 训练大模型时压缩优化器状态显存
不适合
- 依赖受支持的 GPU(NVIDIA SM60 起),纯 CPU 性能受限
- 非训练或推理框架,需配合 Transformers、PEFT 使用
- 要求 Python 3.10+ 与 PyTorch 2.4+ 环境
- Intel Gaudi、macOS Metal 等仅部分支持、速度较慢
如何接入
- pip 安装后替换 Linear8bitLt、Linear4bit 算子
- 与 Transformers 的 load_in_8bit/4bit 参数直接对接
- 配合 PEFT 实现 QLoRA 微调流程
- 支持 Diffusers 等 Hugging Face 组件
已知限制
- 量化会带来一定精度损失,需按任务评估
- 硬件覆盖不均,部分后端为实验性支持
- 对 PyTorch/CUDA 版本有明确依赖,升级需匹配
- 属底层库,缺乏面向业务的高层封装
接入与使用事实
- 部署方式
- 本地运行
- 实现语言
- Python、CUDA、C++
- 中文界面
- 待确认
- 中文文档
- 待确认
- 定价方式
- 开源
- 许可证
- MIT
- 国内可达性
- 国内可达
- 可达性观察
- 待补充
权限、依赖与维护信号
这些字段记录公开可见信号,不等同于安全审计结论。
权限信号
暂无公开信号。
依赖信号
暂无公开信号。
维护信号
暂无公开信号。
公开来源与证据
暂无可公开的来源链接。
