返回 AI 工具目录

Rapid-MLX

基础设施人工精选最近核验 2026年7月23日

Rapid-MLX 是面向 Apple Silicon 的本地大模型推理引擎,用 Python 编写、基于 Apple MLX 框架。它提供与 OpenAI /v1/chat/completions 和 Anthropic /v1/messages 兼容的本地接口,采用原生 MLX kernel、连续批处理与提示缓存,官方称在 Apple 芯片上相比 Ollama 有约二到四倍的吞吐。支持一百多个模型别名、十余种工具调用解析器,并与 Cursor、Claude Code、Aider 等多种 agent 框架对接,视觉与音频为可选扩展。项目以 Apache-2.0 开源,适合在 Mac 上做隐私优先、无需云 API 的本地推理与 agent 后端。

定价开源部署本地运行、API 接入国内可达国内可达性待核验许可Apache-2.0

解决什么问题

  • 在 Apple Silicon 上高效运行本地大模型、免依赖云 API
  • 需要 OpenAI、Anthropic 兼容接口以复用现有客户端
  • 本地推理吞吐不足、批处理与缓存缺失
  • 工具调用解析在不同模型间不一致

适合

  • 使用 Apple Silicon Mac 做本地推理的开发者与团队
  • 出于隐私或成本考虑不走云端模型 API 的场景
  • 需要把本地模型接入 Cursor、Aider 等 agent 工具
  • 需要工具调用与多模型别名管理的本地服务

不适合

  • 非 Apple Silicon 硬件(Intel Mac、Windows、Linux)无法使用
  • 需要多机分布式服务而非单机本地推理
  • 依赖官方托管 SLA 而非自运维的团队
  • 模型权重需自行获取,受限于本地显存与内存

如何接入

  • 暴露 OpenAI 与 Anthropic 兼容的本地 HTTP 接口
  • 与 Cursor、Claude Code、Aider 等多类 agent 框架对接
  • 内置多种工具调用解析器,支持函数调用
  • 视觉、音频能力以可选扩展方式安装

已知限制

  • 仅支持 Apple Silicon,硬件覆盖面窄
  • 模型权重多来自 HuggingFace,国内下载需镜像或代理
  • 二到四倍吞吐为官方对比数据,实测随模型与配置变化
  • 单机本地方案,不覆盖高并发生产集群

接入与使用事实

部署方式
本地运行、API 接入
实现语言
Python
中文界面
待确认
中文文档
待确认
定价方式
开源
许可证
Apache-2.0
国内可达性
国内可达性待核验
可达性观察
待补充

权限、依赖与维护信号

这些字段记录公开可见信号,不等同于安全审计结论。

权限信号

暂无公开信号。

依赖信号

暂无公开信号。

维护信号

暂无公开信号。

公开来源与证据

  1. 代码仓库仅作事实索引

访问官网