返回 AI 工具目录
Text Generation Inference
基础设施人工精选最近核验 2026年7月23日
Text Generation Inference(TGI)是 Hugging Face 开源的大语言模型推理与服务工具包,用 Rust、Python 与 gRPC 构建,曾用于其生产环境支撑 HuggingChat 与 Inference API。支持 Llama、Falcon、StarCoder 等开源模型,提供张量并行、连续批处理、Flash/Paged Attention 优化、Token 流式输出、多种量化以及兼容 OpenAI Chat Completion 的接口,可在 NVIDIA、AMD、Intel、TPU 等硬件上以容器部署。需注意:该仓库已于 2026-03-21 归档为只读并进入维护模式,官方建议新项目改用 vLLM、SGLang 等引擎。
定价开源部署自托管、本地运行国内可达国内可达许可Apache-2.0
解决什么问题
- 把开源大模型部署为高吞吐推理服务
- 用连续批处理与张量并行提升吞吐
- 以兼容 OpenAI 的接口对外提供生成
- 通过多种量化降低显存与成本
- 支持多种硬件后端的容器化部署
适合
- 已有并将长期沿用 TGI 部署的团队
- 需要自托管开源模型推理服务
- 使用 Llama、Falcon 等受支持模型
- 需要 OpenAI 兼容接口与流式输出
不适合
- 仓库已归档只读,新项目建议选 vLLM 或 SGLang
- 仅接受轻量维护性修复,不再迭代新特性
- 自托管需要 GPU 与部署运维能力
- 非受支持模型架构的支持有限
如何接入
- 以 Docker 容器方式部署为推理服务
- 暴露兼容 OpenAI Chat Completion 的接口
- 支持 Prometheus 指标与分布式追踪
- 可在 NVIDIA、AMD、Intel、TPU 等硬件运行
已知限制
- 仓库已于 2026-03-21 归档并转维护模式
- 官方推荐迁移到 vLLM、SGLang、llama.cpp 等
- 自托管对 GPU 与工程能力有要求
- 容器镜像与模型权重需从海外源获取
接入与使用事实
- 部署方式
- 自托管、本地运行
- 实现语言
- Python、Rust
- 中文界面
- 待确认
- 中文文档
- 待确认
- 定价方式
- 开源
- 许可证
- Apache-2.0
- 国内可达性
- 国内可达
- 可达性观察
- 待补充
权限、依赖与维护信号
这些字段记录公开可见信号,不等同于安全审计结论。
权限信号
暂无公开信号。
依赖信号
暂无公开信号。
维护信号
暂无公开信号。
公开来源与证据
暂无可公开的来源链接。
