返回 AI 工具目录

llama.cpp

开发框架人工精选最近核验 2026年7月23日

llama.cpp 是用纯 C/C++ 实现的大模型推理引擎,目标是最小依赖、在从消费级设备到服务器的广泛硬件上高效运行 LLM。它以量化(1.5–8 bit,GGUF 格式)大幅降低显存与内存占用,支持 CPU+GPU 混合推理,并针对 Apple Silicon(Metal)、NVIDIA/AMD(CUDA/HIP)、Vulkan、SYCL 等多种后端优化。除 CLI 外还内置一个兼容 OpenAI 接口的 HTTP 服务器,便于直接替换云端 API;另有 Python、Go、Node.js、Rust 等多语言绑定。支持 LLaMA、Mistral、Qwen、Phi、Gemma 等上百种模型架构及部分多模态模型,采用 MIT 许可,完全离线可用。

定价开源部署本地运行、自托管、API 接入国内可达国内可达许可MIT

解决什么问题

  • 在本地或边缘设备上离线跑大模型推理
  • 用量化把大模型压进有限的显存与内存
  • 以兼容 OpenAI 的接口平替云端 API
  • 在无独立显卡的机器上也能做 CPU 推理

适合

  • 要私有化、数据不出本机的推理场景
  • 需在消费级或国产硬件上部署开源模型
  • 想用统一的 OpenAI 接口对接现有应用
  • 接受自行下载权重、自行调优的团队

不适合

  • 需要开箱托管、不想运维的用户不适合
  • 超大模型仍受本地显存与内存上限约束
  • 量化会带来一定精度损失,需权衡
  • 权重需自备,部分模型境内获取不便

如何接入

  • 提供 llama-cli 与 llama-server 两类入口
  • llama-server 暴露兼容 OpenAI 的 HTTP API
  • 支持 Metal、CUDA、Vulkan、SYCL 等多后端
  • 有 Python、Go、Node、Rust 等语言绑定

已知限制

  • 仅做推理,不含训练或微调流程
  • 性能与可跑模型受本机硬件上限约束
  • 量化档位与精度需自行权衡调优
  • GGUF 权重需自行获取与转换

接入与使用事实

部署方式
本地运行、自托管、API 接入
实现语言
C++、C、CUDA
中文界面
待确认
中文文档
待确认
定价方式
开源
许可证
MIT
国内可达性
国内可达
可达性观察
待补充

权限、依赖与维护信号

这些字段记录公开可见信号,不等同于安全审计结论。

权限信号

暂无公开信号。

依赖信号

暂无公开信号。

维护信号

暂无公开信号。

公开来源与证据

暂无可公开的来源链接。

访问官网