返回 AI 工具目录
Llama2 Embedding Server
开发框架人工精选最近核验 2026年7月23日
Swiss Army Llama(原 llama_embeddings_fastapi_service)是一个基于 FastAPI 的本地大模型工具服务,通过 REST 接口把 llama.cpp 加载的本地模型能力暴露出来。它可批量计算文本嵌入与补全,自动处理 PDF(含需 OCR 的扫描件)、Word、图片等常见文档,支持提交音频用 Whisper 转写后再算嵌入;嵌入结果缓存在 SQLite 避免重复计算。语义检索用 FAISS 向量搜索,并可用 Rust 库 fast_vector_similarity 计算多种相似度度量。附带 Swagger UI,便于集成到自有应用。
定价开源部署自托管、本地运行国内可达国内可达
解决什么问题
- 用本地模型批量产出文本嵌入,数据不出本机
- 自动解析 PDF、Word、图片等文档并算嵌入
- 提交音频经 Whisper 转写后再计算嵌入
- FAISS 向量检索支持跨已缓存嵌入做语义搜索
- 嵌入缓存于 SQLite,避免重复计算
适合
- 希望在本地或私有服务器自建嵌入与检索服务
- 需要把多种文档类型统一转成向量
- 用 Swagger/REST 快速集成到自有应用
- 倾向 llama.cpp 系本地模型而非云 API
不适合
- 仓库未标注开源许可证,商用前需与作者确认授权
- 面向自托管,需自行运维与保证算力
- 本地模型质量与速度受硬件限制
- 非托管式 SaaS,不提供官方在线服务
如何接入
- 以 FastAPI 提供 REST 接口,配 Swagger UI
- 可 Docker 部署,支持可选 RAM Disk 加速加载
- 模型经 llama.cpp 加载,支持多种池化方式
- 相似度计算调用 Rust 库 fast_vector_similarity
- 输出可为 JSON 或打包 ZIP
已知限制
- 未见明确许可证,授权状态需与作者确认
- 项目更新趋缓,近一次提交为 2025 年初
- 依赖本地算力,大批量文档处理耗时
- 文档解析质量受 textract 与 OCR 能力限制
接入与使用事实
- 部署方式
- 自托管、本地运行
- 实现语言
- Python
- 中文界面
- 待确认
- 中文文档
- 待确认
- 定价方式
- 开源
- 许可证
- 待确认
- 国内可达性
- 国内可达
- 可达性观察
- 待补充
权限、依赖与维护信号
这些字段记录公开可见信号,不等同于安全审计结论。
权限信号
暂无公开信号。
依赖信号
暂无公开信号。
维护信号
暂无公开信号。
公开来源与证据
- 代码仓库仅作事实索引
