返回 AI 工具目录
Infinity
基础设施人工精选最近核验 2026年7月23日
Infinity 是一个高吞吐、低延迟的推理服务引擎,专注部署嵌入(embedding)、重排(reranking)以及 CLIP/CLAP/ColPali 等多模态与分类模型。它可加载 HuggingFace 上的各类模型,提供与 OpenAI 规范对齐的 REST API,支持动态批处理、多模型编排,以及 PyTorch、ONNX/TensorRT、CTranslate2 等后端和 CUDA、ROCm、CPU、Apple MPS、AWS INF2 等加速器。可用 pip 安装(infinity-emb)、预构建 Docker 镜像或 infinity_emb 命令行部署,MIT 许可。适合自建向量化与重排服务、支撑 RAG 与检索链路。
定价开源部署自托管、本地运行、API 接入国内可达国内可达许可MIT
解决什么问题
- 自建 embedding 与 rerank 的高并发推理服务
- 用 OpenAI 兼容 API 统一对接各类检索模型
- 动态批处理提升吞吐、降低单请求延迟
- 在同一服务里混合编排多个模型与多模态
适合
- 需要私有化部署向量化/重排以支撑 RAG
- 希望用 OpenAI 兼容接口替换云端 embedding
- 有 GPU 或多加速器环境、追求吞吐的团队
不适合
- 仅偶尔调用、无需自建服务时可直接用托管 API
- 无 GPU 资源时高吞吐优势有限
- 需自行拉取 HuggingFace 模型并管理版本
如何接入
- 暴露 OpenAI 规范的 REST API 供上层调用
- pip、Docker 镜像或 CLI 三种方式部署
- 可对接 LangChain 等 RAG 框架的 embedding 接口
已知限制
- 模型默认从 HuggingFace 拉取,国内需镜像或缓存
- 高吞吐依赖 GPU,CPU 环境性能受限
- 需自行负责服务运维、扩缩容与监控
接入与使用事实
- 部署方式
- 自托管、本地运行、API 接入
- 实现语言
- Python
- 中文界面
- 待确认
- 中文文档
- 待确认
- 定价方式
- 开源
- 许可证
- MIT
- 国内可达性
- 国内可达
- 可达性观察
- 待补充
权限、依赖与维护信号
这些字段记录公开可见信号,不等同于安全审计结论。
权限信号
暂无公开信号。
依赖信号
暂无公开信号。
维护信号
暂无公开信号。
公开来源与证据
暂无可公开的来源链接。
