返回 AI 工具目录

Whisper

开发框架人工精选最近核验 2026年7月23日

Whisper 是 OpenAI 开源的通用语音识别模型(MIT 许可),采用 Transformer 序列到序列架构,在大规模多语言音频上训练,用单一模型完成多语种转写、语音翻译成英文、语种识别与语音活动检测。提供 tiny 到 large 六个规模,参数量约 39M 至 1550M,显存需求约 1GB 至 10GB,另有优化速度的 turbo 版本。通过 pip 安装 openai-whisper,需 Python 3.8–3.11 与 ffmpeg,支持命令行与 Python API,权重公开,可本地离线推理。

定价开源部署本地运行、自托管国内可达国内可达许可MIT

解决什么问题

  • 把音频批量转写为文字并支持多语种
  • 将多语种语音直接翻译为英文文本
  • 在本地离线完成语音识别,数据不出机器
  • 用统一模型替代多阶段传统语音流水线
  • 按精度与算力在六档模型规模间取舍

适合

  • 需要本地、可控、离线的语音转写能力
  • 处理多语种音频且对数据隐私敏感的场景
  • 有 GPU 或愿意接受 CPU 较慢推理的团队
  • 作为产品语音功能的开源底座自行集成

不适合

  • 无 GPU 时大模型推理速度慢、成本高
  • 非流式设计,实时低延迟转写需额外改造
  • 对特定行业术语与口音准确率可能不足
  • 模型体积大,边缘设备受显存约束
  • 不含说话人分离,需自行叠加

如何接入

  • pip install -U openai-whisper 安装
  • 预先安装 ffmpeg 与 Python 3.8–3.11
  • 命令行直接转写或用 Python API 调用
  • 按显存选择 tiny 至 large 或 turbo 模型
  • 可自建服务封装为内部转写接口

已知限制

  • 首次使用需从海外 CDN 下载模型权重
  • 大模型显存需求高,长音频耗时明显
  • 默认非实时,流式场景需二次开发
  • 低资源语种准确率低于高资源语种
  • 无内置说话人分离与标点优化保证

接入与使用事实

部署方式
本地运行、自托管
实现语言
Python
中文界面
待确认
中文文档
待确认
定价方式
开源
许可证
MIT
国内可达性
国内可达
可达性观察
待补充

权限、依赖与维护信号

这些字段记录公开可见信号,不等同于安全审计结论。

权限信号

暂无公开信号。

依赖信号

暂无公开信号。

维护信号

暂无公开信号。

公开来源与证据

  1. 代码仓库仅作事实索引

访问官网