返回 AI 工具目录
Rapid-MLX
基础设施人工精选最近核验 2026年7月23日
Rapid-MLX 是面向 Apple Silicon 的本地大模型推理引擎,用 Python 编写、基于 Apple MLX 框架。它提供与 OpenAI /v1/chat/completions 和 Anthropic /v1/messages 兼容的本地接口,采用原生 MLX kernel、连续批处理与提示缓存,官方称在 Apple 芯片上相比 Ollama 有约二到四倍的吞吐。支持一百多个模型别名、十余种工具调用解析器,并与 Cursor、Claude Code、Aider 等多种 agent 框架对接,视觉与音频为可选扩展。项目以 Apache-2.0 开源,适合在 Mac 上做隐私优先、无需云 API 的本地推理与 agent 后端。
定价开源部署本地运行、API 接入国内可达国内可达性待核验许可Apache-2.0
解决什么问题
- 在 Apple Silicon 上高效运行本地大模型、免依赖云 API
- 需要 OpenAI、Anthropic 兼容接口以复用现有客户端
- 本地推理吞吐不足、批处理与缓存缺失
- 工具调用解析在不同模型间不一致
适合
- 使用 Apple Silicon Mac 做本地推理的开发者与团队
- 出于隐私或成本考虑不走云端模型 API 的场景
- 需要把本地模型接入 Cursor、Aider 等 agent 工具
- 需要工具调用与多模型别名管理的本地服务
不适合
- 非 Apple Silicon 硬件(Intel Mac、Windows、Linux)无法使用
- 需要多机分布式服务而非单机本地推理
- 依赖官方托管 SLA 而非自运维的团队
- 模型权重需自行获取,受限于本地显存与内存
如何接入
- 暴露 OpenAI 与 Anthropic 兼容的本地 HTTP 接口
- 与 Cursor、Claude Code、Aider 等多类 agent 框架对接
- 内置多种工具调用解析器,支持函数调用
- 视觉、音频能力以可选扩展方式安装
已知限制
- 仅支持 Apple Silicon,硬件覆盖面窄
- 模型权重多来自 HuggingFace,国内下载需镜像或代理
- 二到四倍吞吐为官方对比数据,实测随模型与配置变化
- 单机本地方案,不覆盖高并发生产集群
接入与使用事实
- 部署方式
- 本地运行、API 接入
- 实现语言
- Python
- 中文界面
- 待确认
- 中文文档
- 待确认
- 定价方式
- 开源
- 许可证
- Apache-2.0
- 国内可达性
- 国内可达性待核验
- 可达性观察
- 待补充
权限、依赖与维护信号
这些字段记录公开可见信号,不等同于安全审计结论。
权限信号
暂无公开信号。
依赖信号
暂无公开信号。
维护信号
暂无公开信号。
公开来源与证据
- 代码仓库仅作事实索引
