返回 AI 工具目录

Xinference

基础设施人工精选最近核验 2026年7月23日

Xinference(Xorbits Inference)是一个开源的模型推理服务框架,用统一接口部署和调用大语言模型、嵌入、重排、图像、语音等多类模型,对外提供与 OpenAI 兼容的 REST API,便于把应用中的模型调用切换到自托管部署。它整合 vLLM、llama.cpp、GGML、TensorRT 等多种推理引擎,支持 GPU/CPU 异构硬件与多机分布式部署,并提供 Web UI、命令行与 RPC 接口以及自动批处理。它常被用作 Dify、RAGFlow、LangChain 等上层框架的模型后端,社区版可自托管免费,另有企业版。

定价开源部署自托管、本地运行国内可达国内可达许可Apache-2.0

解决什么问题

  • 用统一接口部署 LLM、嵌入、图像、语音等模型
  • 提供 OpenAI 兼容 API,便于切换到自托管
  • 整合 vLLM、llama.cpp 等多种推理引擎
  • 支持 GPU/CPU 异构与多机分布式
  • 内置自动批处理提升并发吞吐

适合

  • 需自托管、私有化部署多类模型的团队
  • 想用 OpenAI 兼容 API 替换云端模型
  • 作为 Dify、RAGFlow 等上层框架的后端
  • 有 GPU/CPU 混合资源需统一调度

不适合

  • 自托管需自备算力与运维能力
  • 企业级功能属独立商业版本
  • 模型权重仍需自行获取与合规评估
  • 不含上层业务编排,需搭配应用框架

如何接入

  • 提供 OpenAI 兼容 REST API
  • 推理引擎覆盖 vLLM、llama.cpp、GGML、TensorRT
  • 对接 LangChain、LlamaIndex、Dify、RAGFlow
  • 支持 pip、Docker、Kubernetes(Helm)部署

已知限制

  • 自托管性能取决于硬件与引擎选型
  • 企业版与社区版能力存在差异
  • 大模型部署对显存与内存要求较高
  • 需自行负责模型来源与合规

接入与使用事实

部署方式
自托管、本地运行
实现语言
Python、TypeScript
中文界面
待确认
中文文档
待确认
定价方式
开源
许可证
Apache-2.0
国内可达性
国内可达
可达性观察
待补充

权限、依赖与维护信号

这些字段记录公开可见信号,不等同于安全审计结论。

权限信号

暂无公开信号。

依赖信号

暂无公开信号。

维护信号

暂无公开信号。

公开来源与证据

  1. 代码仓库仅作事实索引

访问官网