返回 AI 工具目录

Text Generation Inference

基础设施人工精选最近核验 2026年7月23日

Text Generation Inference(TGI)是 Hugging Face 开源的大语言模型推理与服务工具包,用 Rust、Python 与 gRPC 构建,曾用于其生产环境支撑 HuggingChat 与 Inference API。支持 Llama、Falcon、StarCoder 等开源模型,提供张量并行、连续批处理、Flash/Paged Attention 优化、Token 流式输出、多种量化以及兼容 OpenAI Chat Completion 的接口,可在 NVIDIA、AMD、Intel、TPU 等硬件上以容器部署。需注意:该仓库已于 2026-03-21 归档为只读并进入维护模式,官方建议新项目改用 vLLM、SGLang 等引擎。

定价开源部署自托管、本地运行国内可达国内可达许可Apache-2.0

解决什么问题

  • 把开源大模型部署为高吞吐推理服务
  • 用连续批处理与张量并行提升吞吐
  • 以兼容 OpenAI 的接口对外提供生成
  • 通过多种量化降低显存与成本
  • 支持多种硬件后端的容器化部署

适合

  • 已有并将长期沿用 TGI 部署的团队
  • 需要自托管开源模型推理服务
  • 使用 Llama、Falcon 等受支持模型
  • 需要 OpenAI 兼容接口与流式输出

不适合

  • 仓库已归档只读,新项目建议选 vLLM 或 SGLang
  • 仅接受轻量维护性修复,不再迭代新特性
  • 自托管需要 GPU 与部署运维能力
  • 非受支持模型架构的支持有限

如何接入

  • 以 Docker 容器方式部署为推理服务
  • 暴露兼容 OpenAI Chat Completion 的接口
  • 支持 Prometheus 指标与分布式追踪
  • 可在 NVIDIA、AMD、Intel、TPU 等硬件运行

已知限制

  • 仓库已于 2026-03-21 归档并转维护模式
  • 官方推荐迁移到 vLLM、SGLang、llama.cpp 等
  • 自托管对 GPU 与工程能力有要求
  • 容器镜像与模型权重需从海外源获取

接入与使用事实

部署方式
自托管、本地运行
实现语言
Python、Rust
中文界面
待确认
中文文档
待确认
定价方式
开源
许可证
Apache-2.0
国内可达性
国内可达
可达性观察
待补充

权限、依赖与维护信号

这些字段记录公开可见信号,不等同于安全审计结论。

权限信号

暂无公开信号。

依赖信号

暂无公开信号。

维护信号

暂无公开信号。

公开来源与证据

暂无可公开的来源链接。

访问官网