返回 AI 工具目录
Shimmy
基础设施人工精选最近核验 2026年7月23日
Shimmy 是用 Rust 编写的轻量本地大模型推理服务器,自述为「纯 Rust 的 WebGPU 推理引擎,兼容 OpenAI API,原生支持 GGUF,可运行于各类 GPU,单二进制、无需 Python、不依赖 llama.cpp」。它提供与 OpenAI 接口兼容的端点,便于把本地模型接入现有应用;自带 Airframe(WGSL GPU 推理)、INT4 KV 缓存压缩以降显存、YaRN 扩展上下文,并能自动发现 HuggingFace、Ollama、LM Studio 中的模型。支持 NVIDIA、AMD、Intel 与 Apple Silicon,可下载预编译二进制或用 cargo 安装,MIT 许可(仓库亦列出 Apache-2.0)。
定价开源部署本地运行、自托管国内可达国内可达许可Apache-2.0
解决什么问题
- 在本地跑大模型并暴露 OpenAI 兼容接口
- 免装 Python 与复杂依赖,单二进制启动
- 跨品牌 GPU 统一用 WebGPU 做推理
- 显存有限时用 INT4 KV 压缩降占用
适合
- 想以最小依赖在本机提供模型接口的开发者
- 需 OpenAI 兼容端点做本地替代或离线场景
- 多品牌 GPU、希望统一推理后端
不适合
- 面向本地/单机,非大规模集群推理
- 项目较新、迭代快,接口可能变动
- GGUF 为主,其他模型格式支持有限
- WebGPU 引擎性能随硬件差异较大
如何接入
- 下载预编译二进制或 cargo install 运行
- 应用侧按 OpenAI API 方式调用其端点
- 可自动发现本地 Ollama/LM Studio 模型
已知限制
- 从 HuggingFace 拉模型在国内可能较慢
- 正文未含官方性能数字,吞吐随硬件而定
- 新版本功能仍在快速演进
接入与使用事实
- 部署方式
- 本地运行、自托管
- 实现语言
- Rust
- 中文界面
- 待确认
- 中文文档
- 待确认
- 定价方式
- 开源
- 许可证
- Apache-2.0
- 国内可达性
- 国内可达
- 可达性观察
- 待补充
权限、依赖与维护信号
这些字段记录公开可见信号,不等同于安全审计结论。
权限信号
暂无公开信号。
依赖信号
暂无公开信号。
维护信号
暂无公开信号。
公开来源与证据
- 代码仓库仅作事实索引
