返回 AI 工具目录

GPTCache

开发框架人工精选最近核验 2026年7月23日

GPTCache 是面向大模型应用的语义缓存库,由 Zilliz 开源。它在应用与 LLM 之间加一层缓存,用向量相似度匹配语义相近的历史请求,命中即返回缓存结果,从而降低重复调用的 token 成本与响应延迟。架构可自由组合嵌入生成器(OpenAI、ONNX、Hugging Face 等)、向量库(Milvus、FAISS、Chroma 等)与缓存存储(SQLite、Redis、MySQL 等),并支持 LRU/FIFO/LFU 等淘汰策略。已集成 LangChain 与 llama_index,也提供 Docker 镜像供多语言调用。需注意其已不再新增对新模型 API 的适配,改为引导使用通用 get/set 接口。定位是给 LLM 应用做成本与延迟优化的缓存中间层。

定价开源部署本地运行、自托管国内可达国内可达许可MIT

解决什么问题

  • LLM 重复或相似请求带来高额 token 成本
  • 相同问题反复调用模型导致响应延迟
  • 精确匹配缓存无法命中语义相近的问题
  • 需要灵活替换嵌入与向量存储后端

适合

  • 高并发或重复问答场景降低模型调用量
  • 已用 LangChain 或 llama_index 的应用加缓存
  • 需要自选嵌入器与向量库的私有部署
  • 对相似查询做语义级命中复用

不适合

  • 语义匹配存在误命中风险,需调阈值并评估
  • 仓库不再新增新模型 API 适配,需用通用接口
  • 早期项目 API 可能变动,升级需回归测试
  • 强实时或强一致结果场景不宜返回缓存

如何接入

  • 作为中间层包裹 OpenAI 等模型调用
  • 与 LangChain、llama_index 直接集成
  • 可用 Docker 服务镜像供非 Python 调用
  • 嵌入器、向量库、存储后端可自由组合

已知限制

  • 已不再新增对新模型 API 的官方适配
  • 语义缓存有误命中可能,需人工设阈值
  • 缓存质量依赖嵌入模型与相似度阈值
  • 若使用境外嵌入 API 则涉及数据出域

接入与使用事实

部署方式
本地运行、自托管
实现语言
Python
中文界面
待确认
中文文档
待确认
定价方式
开源
许可证
MIT
国内可达性
国内可达
可达性观察
待补充

权限、依赖与维护信号

这些字段记录公开可见信号,不等同于安全审计结论。

权限信号

暂无公开信号。

依赖信号

暂无公开信号。

维护信号

暂无公开信号。

公开来源与证据

暂无可公开的来源链接。

访问官网