返回 AI 工具目录
Xinference
基础设施人工精选最近核验 2026年7月23日
Xinference(Xorbits Inference)是一个开源的模型推理服务框架,用统一接口部署和调用大语言模型、嵌入、重排、图像、语音等多类模型,对外提供与 OpenAI 兼容的 REST API,便于把应用中的模型调用切换到自托管部署。它整合 vLLM、llama.cpp、GGML、TensorRT 等多种推理引擎,支持 GPU/CPU 异构硬件与多机分布式部署,并提供 Web UI、命令行与 RPC 接口以及自动批处理。它常被用作 Dify、RAGFlow、LangChain 等上层框架的模型后端,社区版可自托管免费,另有企业版。
定价开源部署自托管、本地运行国内可达国内可达许可Apache-2.0
解决什么问题
- 用统一接口部署 LLM、嵌入、图像、语音等模型
- 提供 OpenAI 兼容 API,便于切换到自托管
- 整合 vLLM、llama.cpp 等多种推理引擎
- 支持 GPU/CPU 异构与多机分布式
- 内置自动批处理提升并发吞吐
适合
- 需自托管、私有化部署多类模型的团队
- 想用 OpenAI 兼容 API 替换云端模型
- 作为 Dify、RAGFlow 等上层框架的后端
- 有 GPU/CPU 混合资源需统一调度
不适合
- 自托管需自备算力与运维能力
- 企业级功能属独立商业版本
- 模型权重仍需自行获取与合规评估
- 不含上层业务编排,需搭配应用框架
如何接入
- 提供 OpenAI 兼容 REST API
- 推理引擎覆盖 vLLM、llama.cpp、GGML、TensorRT
- 对接 LangChain、LlamaIndex、Dify、RAGFlow
- 支持 pip、Docker、Kubernetes(Helm)部署
已知限制
- 自托管性能取决于硬件与引擎选型
- 企业版与社区版能力存在差异
- 大模型部署对显存与内存要求较高
- 需自行负责模型来源与合规
接入与使用事实
- 部署方式
- 自托管、本地运行
- 实现语言
- Python、TypeScript
- 中文界面
- 待确认
- 中文文档
- 待确认
- 定价方式
- 开源
- 许可证
- Apache-2.0
- 国内可达性
- 国内可达
- 可达性观察
- 待补充
权限、依赖与维护信号
这些字段记录公开可见信号,不等同于安全审计结论。
权限信号
暂无公开信号。
依赖信号
暂无公开信号。
维护信号
暂无公开信号。
公开来源与证据
- 代码仓库仅作事实索引
