返回 AI 工具目录

Shimmy

基础设施人工精选最近核验 2026年7月23日

Shimmy 是用 Rust 编写的轻量本地大模型推理服务器,自述为「纯 Rust 的 WebGPU 推理引擎,兼容 OpenAI API,原生支持 GGUF,可运行于各类 GPU,单二进制、无需 Python、不依赖 llama.cpp」。它提供与 OpenAI 接口兼容的端点,便于把本地模型接入现有应用;自带 Airframe(WGSL GPU 推理)、INT4 KV 缓存压缩以降显存、YaRN 扩展上下文,并能自动发现 HuggingFace、Ollama、LM Studio 中的模型。支持 NVIDIA、AMD、Intel 与 Apple Silicon,可下载预编译二进制或用 cargo 安装,MIT 许可(仓库亦列出 Apache-2.0)。

定价开源部署本地运行、自托管国内可达国内可达许可Apache-2.0

解决什么问题

  • 在本地跑大模型并暴露 OpenAI 兼容接口
  • 免装 Python 与复杂依赖,单二进制启动
  • 跨品牌 GPU 统一用 WebGPU 做推理
  • 显存有限时用 INT4 KV 压缩降占用

适合

  • 想以最小依赖在本机提供模型接口的开发者
  • 需 OpenAI 兼容端点做本地替代或离线场景
  • 多品牌 GPU、希望统一推理后端

不适合

  • 面向本地/单机,非大规模集群推理
  • 项目较新、迭代快,接口可能变动
  • GGUF 为主,其他模型格式支持有限
  • WebGPU 引擎性能随硬件差异较大

如何接入

  • 下载预编译二进制或 cargo install 运行
  • 应用侧按 OpenAI API 方式调用其端点
  • 可自动发现本地 Ollama/LM Studio 模型

已知限制

  • 从 HuggingFace 拉模型在国内可能较慢
  • 正文未含官方性能数字,吞吐随硬件而定
  • 新版本功能仍在快速演进

接入与使用事实

部署方式
本地运行、自托管
实现语言
Rust
中文界面
待确认
中文文档
待确认
定价方式
开源
许可证
Apache-2.0
国内可达性
国内可达
可达性观察
待补充

权限、依赖与维护信号

这些字段记录公开可见信号,不等同于安全审计结论。

权限信号

暂无公开信号。

依赖信号

暂无公开信号。

维护信号

暂无公开信号。

公开来源与证据

  1. 代码仓库仅作事实索引

访问官网