返回 AI 工具目录

Ollama

基础设施人工精选最近核验 2026年7月23日

Ollama 是开源(MIT)的本地大模型运行工具,在个人电脑或服务器上一条命令即可拉起并对话开源模型。支持 macOS、Windows、Linux 与官方 Docker 镜像,底层基于 llama.cpp,以 Go 为主实现。通过 ollama run <模型> 下载并运行 Gemma、Llama、Qwen、DeepSeek、gpt-oss 等模型库中的模型,权重多为 GGUF 量化格式,可离线运行、数据留在本机。内置 REST API 并提供 OpenAI 兼容接口,便于本地应用与 Agent 集成;可用 Modelfile 自定义参数与系统提示。另有可选的 Ollama Cloud(美国、欧洲、新加坡)提供更大模型的托管算力。整体偏开发与本地推理,不面向高并发生产集群。

定价开源部署本地运行、自托管、API 接入、SaaS 云服务国内可达国内可达许可MIT

解决什么问题

  • 解决在本地快速用起开源模型的门槛问题:自己编译 llama.cpp、找权重、配量化、写推理服务对多数开发者门槛偏高
  • Ollama 把模型下载、量化权重管理、运行时和统一 API 封装成一条命令,ollama run 即可对话或供程序调用
  • 内置模型库并处理不同模型的加载细节,支持 GPU 加速与纯 CPU 回退,权重多用 GGUF 格式以便在有限显存或内存下运行较大模型
  • 本地常驻服务(REST 与 OpenAI 兼容接口)让原型、桌面应用、编码助手与 Agent 无需接入云 API 即可调用本地模型,数据不出本机,适合演示、内网工具与隐私敏感场景
  • 对需要更大模型又不想自建 GPU 的用户,官方提供可选云端算力作为延伸

适合

  • 开发者在笔记本或工作站上做原型、Demo、本地测试,或需要本地、离线、数据不出机的桌面工具、内网助手与隐私敏感场景
  • 为编码助手、Agent、RAG 应用提供本地 OpenAI 兼容后端,免去云 API 费用与网络依赖
  • 小团队在单机或单卡上低频、并发不高地使用中小参数模型,或想快速比较多个开源模型效果的评估
  • 跨 macOS/Windows/Linux 一致的体验和简单的 REST/CLI,是个人与团队本地实验的常见选择
  • 若想先在本地把某个开源或国产模型(如 Qwen、DeepSeek)跑起来看看,通常是较快路径

不适合

  • 不适合高并发、大规模生产在线服务;Ollama 面向单机与开发便利,吞吐、批处理与多机扩展不是其强项,生产级推理更适合 vLLM 或 SGLang
  • 需要精细控制显存分页、连续批处理、张量并行以压低单位成本的平台方,应选专用推理引擎
  • 要在多模型供应商间做统一路由、配额、计费与容灾的,是网关工具(LiteLLM)的职责
  • 需要企业级鉴权、多租户、审计与 SLA 的严肃生产环境,单靠 Ollama 不够
  • 它不做训练或微调、不做调用追踪与评测;若追求极致推理性能或特定硬件(如华为昇腾)深度优化,需先评估其后端支持范围

如何接入

  • 部署以本地与自托管为主:macOS、Windows 用安装包,Linux 用安装脚本,或用官方 ollama/ollama Docker 镜像;安装后后台常驻一个服务,默认监听 localhost:11434
  • 集成方式有二:原生 REST API(/api/chat、/api/generate 等)与 OpenAI 兼容端点,后者让基于 OpenAI SDK 的应用改 base_url 即可指向本地模型;LangChain、LlamaIndex 等主流框架也有对接
  • 模型通过 ollama pull/run 从官方模型库获取,或用 Modelfile 基于 GGUF 权重自定义参数、系统提示与模板
  • 支持 NVIDIA、Apple 等 GPU 加速与 CPU 回退;若需更大模型,可接可选的 Ollama Cloud
  • 在自建栈中,Ollama 常作为本地模型后端,配合 LiteLLM 做统一入口、Langfuse 做调用追踪

已知限制

  • Ollama 优先易用与本地体验,并非高吞吐生产引擎,面对高并发、长上下文批量请求时性能与资源控制不及 vLLM/SGLang,并发、批处理与多机扩展能力有限
  • 模型效果受量化(GGUF)程度影响,低比特量化会有精度损失;可运行的模型大小受本机显存或内存约束;且不提供多租户、细粒度鉴权、审计与计费,需外部组件补齐
  • 国内可达性:软件本体本地运行、数据不出域,可达性良好;但模型默认从海外 ollama.com 模型库拉取,国内下载可能较慢,建议预拉取或改用本地/国产权重(GGUF)导入
  • Ollama Cloud 为海外服务(美国、欧洲、新加坡),使用云端即涉及数据出境与延迟,合规场景应仅用本地模式
  • 项目更新频繁,接口与模型库随版本变化,生产集成建议锁定版本

接入与使用事实

部署方式
本地运行、自托管、API 接入、SaaS 云服务
实现语言
Go、C
中文界面
待确认
中文文档
待确认
定价方式
开源
许可证
MIT
国内可达性
国内可达
可达性观察
待补充

权限、依赖与维护信号

这些字段记录公开可见信号,不等同于安全审计结论。

权限信号

暂无公开信号。

依赖信号

暂无公开信号。

维护信号

暂无公开信号。

公开来源与证据

  1. 代码仓库仅作事实索引

访问官网