返回 AI 工具目录

OneComp

基础设施人工精选最近核验 2026年7月24日

FujitsuResearch/OneCompression(OneComp)是富士通研究院的 Python 库,用一条命令自动完成大模型量化压缩。它检测 GPU 显存后为各层选择合适位宽,采用量化误差传播(QEP)与逐层坐标下降(LPCD)、AutoBit 混合精度、JointQ 联合优化等方法压缩,评估后保存模型;可选 LoRA 微调恢复精度与旋转预处理。提供 vLLM 插件用于部署服务。已在 Llama、Qwen3、Gemma 等架构验证,兼容 Hugging Face 模型。以 Python 编写,按 MIT 开源。

定价开源部署本地运行、自托管国内可达国内可达

解决什么问题

  • 用一条命令自动完成大模型量化压缩
  • 按显存为各层选择合适位宽
  • 量化误差传播提升压缩后精度
  • 可选 LoRA 微调恢复精度
  • 经 vLLM 插件部署压缩后模型

适合

  • 要在有限显存上部署较大模型
  • 希望自动分配混合精度位宽
  • 用 vLLM 做量化模型推理服务
  • 已在 Llama Qwen Gemma 等架构上

不适合

  • vLLM 服务需 Linux 加 NVIDIA GPU
  • 需要 PyTorch 与相应 CUDA 环境
  • 仅验证过部分主流模型架构
  • 仅做压缩与部署不含训练

如何接入

  • 经命令行或 Python API 调用运行
  • 以 vLLM 插件对接推理服务
  • 可配合 Open WebUI 提供对话界面
  • 读取 Hugging Face 兼容模型

已知限制

  • 模型多来自 Hugging Face 国内需镜像
  • vLLM 部署对系统与显卡有要求
  • 不同架构压缩效果需实测
  • 精度恢复的微调需额外算力

接入与使用事实

部署方式
本地运行、自托管
实现语言
Python
中文界面
待确认
中文文档
待确认
定价方式
开源
许可证
待确认
国内可达性
国内可达
可达性观察
待补充

权限、依赖与维护信号

这些字段记录公开可见信号,不等同于安全审计结论。

权限信号

暂无公开信号。

依赖信号

暂无公开信号。

维护信号

暂无公开信号。

公开来源与证据

暂无可公开的来源链接。

访问官网