返回 AI 工具目录

text-embeddings-inference

基础设施人工精选最近核验 2026年7月23日

Text Embeddings Inference(TEI)是 HuggingFace 开源的文本嵌入与序列分类推理服务,把嵌入、重排与分类模型以低延迟、高吞吐部署上线。它无需模型图编译、镜像小、启动快,采用基于 token 的动态批处理并做 Flash Attention 等推理优化,支持 Safetensors/ONNX 权重,内置 OpenTelemetry 追踪与 Prometheus 指标。支持 BERT、XLM-RoBERTa、GTE、Qwen2/3、ModernBERT 等主流嵌入与 BGE 重排模型,覆盖 CPU、NVIDIA、Apple Silicon 等硬件。采用 Apache-2.0,以 Rust 为主,可 Docker 或本地部署。

定价开源部署自托管、本地运行国内可达国内可达许可Apache-2.0

解决什么问题

  • 高吞吐低延迟地部署嵌入与重排模型
  • 基于 token 的动态批处理提升利用率
  • 无需图编译、镜像小、启动快
  • 内置指标与链路追踪便于生产运维

适合

  • 需要自托管嵌入或重排服务支撑 RAG 与搜索
  • 追求推理吞吐与延迟优化的团队
  • 希望统一部署多种嵌入模型
  • 需要可观测性的生产推理场景

不适合

  • 只做嵌入、分类与重排,不生成文本对话
  • 特定新模型架构支持需先核对清单
  • 充分性能需匹配对应 GPU 与配置
  • 不含向量库,需另配检索存储

如何接入

  • 以 Docker 或本地二进制启动推理服务
  • 通过 HTTP API 请求嵌入与重排结果
  • 从 HuggingFace 加载 Safetensors 或 ONNX 权重
  • 暴露 Prometheus 指标与 OTel 追踪

已知限制

  • 仅推理服务,需自行搭配向量库与应用层
  • 拉取模型依赖 HuggingFace,建议配镜像
  • 不同硬件与模型的性能差异需实测
  • 新模型支持随版本更新演进

接入与使用事实

部署方式
自托管、本地运行
实现语言
Rust
中文界面
待确认
中文文档
待确认
定价方式
开源
许可证
Apache-2.0
国内可达性
国内可达
可达性观察
待补充

权限、依赖与维护信号

这些字段记录公开可见信号,不等同于安全审计结论。

权限信号

暂无公开信号。

依赖信号

暂无公开信号。

维护信号

暂无公开信号。

公开来源与证据

  1. 代码仓库仅作事实索引

访问官网