返回 AI 工具目录

Llama2 Embedding Server

开发框架人工精选最近核验 2026年7月23日

Swiss Army Llama(原 llama_embeddings_fastapi_service)是一个基于 FastAPI 的本地大模型工具服务,通过 REST 接口把 llama.cpp 加载的本地模型能力暴露出来。它可批量计算文本嵌入与补全,自动处理 PDF(含需 OCR 的扫描件)、Word、图片等常见文档,支持提交音频用 Whisper 转写后再算嵌入;嵌入结果缓存在 SQLite 避免重复计算。语义检索用 FAISS 向量搜索,并可用 Rust 库 fast_vector_similarity 计算多种相似度度量。附带 Swagger UI,便于集成到自有应用。

定价开源部署自托管、本地运行国内可达国内可达

解决什么问题

  • 用本地模型批量产出文本嵌入,数据不出本机
  • 自动解析 PDF、Word、图片等文档并算嵌入
  • 提交音频经 Whisper 转写后再计算嵌入
  • FAISS 向量检索支持跨已缓存嵌入做语义搜索
  • 嵌入缓存于 SQLite,避免重复计算

适合

  • 希望在本地或私有服务器自建嵌入与检索服务
  • 需要把多种文档类型统一转成向量
  • 用 Swagger/REST 快速集成到自有应用
  • 倾向 llama.cpp 系本地模型而非云 API

不适合

  • 仓库未标注开源许可证,商用前需与作者确认授权
  • 面向自托管,需自行运维与保证算力
  • 本地模型质量与速度受硬件限制
  • 非托管式 SaaS,不提供官方在线服务

如何接入

  • 以 FastAPI 提供 REST 接口,配 Swagger UI
  • 可 Docker 部署,支持可选 RAM Disk 加速加载
  • 模型经 llama.cpp 加载,支持多种池化方式
  • 相似度计算调用 Rust 库 fast_vector_similarity
  • 输出可为 JSON 或打包 ZIP

已知限制

  • 未见明确许可证,授权状态需与作者确认
  • 项目更新趋缓,近一次提交为 2025 年初
  • 依赖本地算力,大批量文档处理耗时
  • 文档解析质量受 textract 与 OCR 能力限制

接入与使用事实

部署方式
自托管、本地运行
实现语言
Python
中文界面
待确认
中文文档
待确认
定价方式
开源
许可证
待确认
国内可达性
国内可达
可达性观察
待补充

权限、依赖与维护信号

这些字段记录公开可见信号,不等同于安全审计结论。

权限信号

暂无公开信号。

依赖信号

暂无公开信号。

维护信号

暂无公开信号。

公开来源与证据

  1. 代码仓库仅作事实索引

访问官网