返回 AI 工具目录
llama.cpp
开发框架人工精选最近核验 2026年7月23日
llama.cpp 是用纯 C/C++ 实现的大模型推理引擎,目标是最小依赖、在从消费级设备到服务器的广泛硬件上高效运行 LLM。它以量化(1.5–8 bit,GGUF 格式)大幅降低显存与内存占用,支持 CPU+GPU 混合推理,并针对 Apple Silicon(Metal)、NVIDIA/AMD(CUDA/HIP)、Vulkan、SYCL 等多种后端优化。除 CLI 外还内置一个兼容 OpenAI 接口的 HTTP 服务器,便于直接替换云端 API;另有 Python、Go、Node.js、Rust 等多语言绑定。支持 LLaMA、Mistral、Qwen、Phi、Gemma 等上百种模型架构及部分多模态模型,采用 MIT 许可,完全离线可用。
定价开源部署本地运行、自托管、API 接入国内可达国内可达许可MIT
解决什么问题
- 在本地或边缘设备上离线跑大模型推理
- 用量化把大模型压进有限的显存与内存
- 以兼容 OpenAI 的接口平替云端 API
- 在无独立显卡的机器上也能做 CPU 推理
适合
- 要私有化、数据不出本机的推理场景
- 需在消费级或国产硬件上部署开源模型
- 想用统一的 OpenAI 接口对接现有应用
- 接受自行下载权重、自行调优的团队
不适合
- 需要开箱托管、不想运维的用户不适合
- 超大模型仍受本地显存与内存上限约束
- 量化会带来一定精度损失,需权衡
- 权重需自备,部分模型境内获取不便
如何接入
- 提供 llama-cli 与 llama-server 两类入口
- llama-server 暴露兼容 OpenAI 的 HTTP API
- 支持 Metal、CUDA、Vulkan、SYCL 等多后端
- 有 Python、Go、Node、Rust 等语言绑定
已知限制
- 仅做推理,不含训练或微调流程
- 性能与可跑模型受本机硬件上限约束
- 量化档位与精度需自行权衡调优
- GGUF 权重需自行获取与转换
接入与使用事实
- 部署方式
- 本地运行、自托管、API 接入
- 实现语言
- C++、C、CUDA
- 中文界面
- 待确认
- 中文文档
- 待确认
- 定价方式
- 开源
- 许可证
- MIT
- 国内可达性
- 国内可达
- 可达性观察
- 待补充
权限、依赖与维护信号
这些字段记录公开可见信号,不等同于安全审计结论。
权限信号
暂无公开信号。
依赖信号
暂无公开信号。
维护信号
暂无公开信号。
公开来源与证据
暂无可公开的来源链接。
