返回 AI 工具目录
Whisper
开发框架人工精选最近核验 2026年7月23日
Whisper 是 OpenAI 开源的通用语音识别模型(MIT 许可),采用 Transformer 序列到序列架构,在大规模多语言音频上训练,用单一模型完成多语种转写、语音翻译成英文、语种识别与语音活动检测。提供 tiny 到 large 六个规模,参数量约 39M 至 1550M,显存需求约 1GB 至 10GB,另有优化速度的 turbo 版本。通过 pip 安装 openai-whisper,需 Python 3.8–3.11 与 ffmpeg,支持命令行与 Python API,权重公开,可本地离线推理。
定价开源部署本地运行、自托管国内可达国内可达许可MIT
解决什么问题
- 把音频批量转写为文字并支持多语种
- 将多语种语音直接翻译为英文文本
- 在本地离线完成语音识别,数据不出机器
- 用统一模型替代多阶段传统语音流水线
- 按精度与算力在六档模型规模间取舍
适合
- 需要本地、可控、离线的语音转写能力
- 处理多语种音频且对数据隐私敏感的场景
- 有 GPU 或愿意接受 CPU 较慢推理的团队
- 作为产品语音功能的开源底座自行集成
不适合
- 无 GPU 时大模型推理速度慢、成本高
- 非流式设计,实时低延迟转写需额外改造
- 对特定行业术语与口音准确率可能不足
- 模型体积大,边缘设备受显存约束
- 不含说话人分离,需自行叠加
如何接入
- pip install -U openai-whisper 安装
- 预先安装 ffmpeg 与 Python 3.8–3.11
- 命令行直接转写或用 Python API 调用
- 按显存选择 tiny 至 large 或 turbo 模型
- 可自建服务封装为内部转写接口
已知限制
- 首次使用需从海外 CDN 下载模型权重
- 大模型显存需求高,长音频耗时明显
- 默认非实时,流式场景需二次开发
- 低资源语种准确率低于高资源语种
- 无内置说话人分离与标点优化保证
接入与使用事实
- 部署方式
- 本地运行、自托管
- 实现语言
- Python
- 中文界面
- 待确认
- 中文文档
- 待确认
- 定价方式
- 开源
- 许可证
- MIT
- 国内可达性
- 国内可达
- 可达性观察
- 待补充
权限、依赖与维护信号
这些字段记录公开可见信号,不等同于安全审计结论。
权限信号
暂无公开信号。
依赖信号
暂无公开信号。
维护信号
暂无公开信号。
公开来源与证据
- 代码仓库仅作事实索引
