返回 AI 工具目录
OneComp
基础设施人工精选最近核验 2026年7月24日
FujitsuResearch/OneCompression(OneComp)是富士通研究院的 Python 库,用一条命令自动完成大模型量化压缩。它检测 GPU 显存后为各层选择合适位宽,采用量化误差传播(QEP)与逐层坐标下降(LPCD)、AutoBit 混合精度、JointQ 联合优化等方法压缩,评估后保存模型;可选 LoRA 微调恢复精度与旋转预处理。提供 vLLM 插件用于部署服务。已在 Llama、Qwen3、Gemma 等架构验证,兼容 Hugging Face 模型。以 Python 编写,按 MIT 开源。
定价开源部署本地运行、自托管国内可达国内可达
解决什么问题
- 用一条命令自动完成大模型量化压缩
- 按显存为各层选择合适位宽
- 量化误差传播提升压缩后精度
- 可选 LoRA 微调恢复精度
- 经 vLLM 插件部署压缩后模型
适合
- 要在有限显存上部署较大模型
- 希望自动分配混合精度位宽
- 用 vLLM 做量化模型推理服务
- 已在 Llama Qwen Gemma 等架构上
不适合
- vLLM 服务需 Linux 加 NVIDIA GPU
- 需要 PyTorch 与相应 CUDA 环境
- 仅验证过部分主流模型架构
- 仅做压缩与部署不含训练
如何接入
- 经命令行或 Python API 调用运行
- 以 vLLM 插件对接推理服务
- 可配合 Open WebUI 提供对话界面
- 读取 Hugging Face 兼容模型
已知限制
- 模型多来自 Hugging Face 国内需镜像
- vLLM 部署对系统与显卡有要求
- 不同架构压缩效果需实测
- 精度恢复的微调需额外算力
接入与使用事实
- 部署方式
- 本地运行、自托管
- 实现语言
- Python
- 中文界面
- 待确认
- 中文文档
- 待确认
- 定价方式
- 开源
- 许可证
- 待确认
- 国内可达性
- 国内可达
- 可达性观察
- 待补充
权限、依赖与维护信号
这些字段记录公开可见信号,不等同于安全审计结论。
权限信号
暂无公开信号。
依赖信号
暂无公开信号。
维护信号
暂无公开信号。
公开来源与证据
暂无可公开的来源链接。
