返回 AI 工具目录

Infinity

基础设施人工精选最近核验 2026年7月23日

Infinity 是一个高吞吐、低延迟的推理服务引擎,专注部署嵌入(embedding)、重排(reranking)以及 CLIP/CLAP/ColPali 等多模态与分类模型。它可加载 HuggingFace 上的各类模型,提供与 OpenAI 规范对齐的 REST API,支持动态批处理、多模型编排,以及 PyTorch、ONNX/TensorRT、CTranslate2 等后端和 CUDA、ROCm、CPU、Apple MPS、AWS INF2 等加速器。可用 pip 安装(infinity-emb)、预构建 Docker 镜像或 infinity_emb 命令行部署,MIT 许可。适合自建向量化与重排服务、支撑 RAG 与检索链路。

定价开源部署自托管、本地运行、API 接入国内可达国内可达许可MIT

解决什么问题

  • 自建 embedding 与 rerank 的高并发推理服务
  • 用 OpenAI 兼容 API 统一对接各类检索模型
  • 动态批处理提升吞吐、降低单请求延迟
  • 在同一服务里混合编排多个模型与多模态

适合

  • 需要私有化部署向量化/重排以支撑 RAG
  • 希望用 OpenAI 兼容接口替换云端 embedding
  • 有 GPU 或多加速器环境、追求吞吐的团队

不适合

  • 仅偶尔调用、无需自建服务时可直接用托管 API
  • 无 GPU 资源时高吞吐优势有限
  • 需自行拉取 HuggingFace 模型并管理版本

如何接入

  • 暴露 OpenAI 规范的 REST API 供上层调用
  • pip、Docker 镜像或 CLI 三种方式部署
  • 可对接 LangChain 等 RAG 框架的 embedding 接口

已知限制

  • 模型默认从 HuggingFace 拉取,国内需镜像或缓存
  • 高吞吐依赖 GPU,CPU 环境性能受限
  • 需自行负责服务运维、扩缩容与监控

接入与使用事实

部署方式
自托管、本地运行、API 接入
实现语言
Python
中文界面
待确认
中文文档
待确认
定价方式
开源
许可证
MIT
国内可达性
国内可达
可达性观察
待补充

权限、依赖与维护信号

这些字段记录公开可见信号,不等同于安全审计结论。

权限信号

暂无公开信号。

依赖信号

暂无公开信号。

维护信号

暂无公开信号。

公开来源与证据

暂无可公开的来源链接。

访问官网