返回 AI 工具目录

bitsandbytes

开发框架人工精选最近核验 2026年7月23日

bitsandbytes 是面向 PyTorch 的 k-bit 量化库,由 bitsandbytes-foundation 维护。它通过 8-bit 优化器、LLM.int8() 8-bit 推理与 QLoRA 4-bit 训练,把大模型的显存占用大幅降低,让单卡或消费级环境也能加载与微调较大的模型。它以 Linear8bitLt、Linear4bit 等算子替换原有线性层,已集成进 Hugging Face Transformers、Diffusers、PEFT 生态,pip 安装即可使用。主要支持 NVIDIA GPU(SM60 起),并对 AMD、Intel GPU、CPU、Apple Silicon 提供不同程度支持。定位是模型压缩与显存优化的底层组件,而非训练框架本身。

定价开源部署本地运行国内可达国内可达许可MIT

解决什么问题

  • 大模型加载或微调时显存不足、单卡放不下
  • 全精度推理占用显存高、部署成本大
  • QLoRA 用 4-bit 量化实现低显存微调
  • 8-bit 优化器降低训练时的优化器状态显存

适合

  • 需在有限显存 GPU 上加载或推理较大模型
  • 用 QLoRA 在单卡做参数高效微调
  • 基于 Hugging Face 生态做量化部署
  • 训练大模型时压缩优化器状态显存

不适合

  • 依赖受支持的 GPU(NVIDIA SM60 起),纯 CPU 性能受限
  • 非训练或推理框架,需配合 Transformers、PEFT 使用
  • 要求 Python 3.10+ 与 PyTorch 2.4+ 环境
  • Intel Gaudi、macOS Metal 等仅部分支持、速度较慢

如何接入

  • pip 安装后替换 Linear8bitLt、Linear4bit 算子
  • 与 Transformers 的 load_in_8bit/4bit 参数直接对接
  • 配合 PEFT 实现 QLoRA 微调流程
  • 支持 Diffusers 等 Hugging Face 组件

已知限制

  • 量化会带来一定精度损失,需按任务评估
  • 硬件覆盖不均,部分后端为实验性支持
  • 对 PyTorch/CUDA 版本有明确依赖,升级需匹配
  • 属底层库,缺乏面向业务的高层封装

接入与使用事实

部署方式
本地运行
实现语言
Python、CUDA、C++
中文界面
待确认
中文文档
待确认
定价方式
开源
许可证
MIT
国内可达性
国内可达
可达性观察
待补充

权限、依赖与维护信号

这些字段记录公开可见信号,不等同于安全审计结论。

权限信号

暂无公开信号。

依赖信号

暂无公开信号。

维护信号

暂无公开信号。

公开来源与证据

暂无可公开的来源链接。

访问官网