返回 AI 工具目录

AudioGPT

AI 应用人工精选最近核验 2026年7月23日

AudioGPT 是一个开源的多模态音频 AI 研究项目,围绕「理解与生成语音、音乐、声音与说话人头像」整合多个基础模型。它把文本转语音、语音识别/增强/分离/翻译、歌声合成、文本转音频、音频修复、图像转音频、声音检测与提取,以及说话人头像生成等十余类任务串联起来。以 Python 实现,集成 FastSpeech、VITS、Whisper、DiffSinger、Make-An-Audio、GeneFace 等模型,提供 Hugging Face Spaces 演示。多项能力标注为 WIP(开发中),定位研究演示而非生产系统。

定价开源部署本地运行、自托管国内可达国内可达性待核验

解决什么问题

  • 用统一入口串联语音、音乐、声音与说话人头像等音频任务
  • 覆盖文本转语音、识别、增强、分离与翻译
  • 支持歌声合成、文本转音频与音频修复
  • 提供声音检测/提取与说话人头像生成
  • 以对话式方式调度多个音频基础模型

适合

  • 研究多模态音频、想快速试跑多种任务的开发者
  • 需要一处集成多种音频模型做对比的场景
  • 愿意自托管并自行下载模型权重的用户
  • 把它当能力原型/演示而非上线系统的团队

不适合

  • 多项任务标注 WIP,能力不完整、不宜直接生产
  • 部分模型仓库缺失,复现需自行补齐权重
  • 许可未在说明中明确,商用前需核对
  • 模型权重下载体量大,境内拉取可能较慢

如何接入

  • 集成 FastSpeech、VITS、Whisper、DiffSinger 等模型
  • 含 Make-An-Audio、GeneFace 等音频/头像生成模型
  • 提供 Hugging Face Spaces 在线演示
  • Python 实现,自托管运行

已知限制

  • 多项能力处于 WIP,稳定性与完整度不足
  • 部分模型无对应仓库,需自行处理
  • 许可信息不明确,商用需谨慎
  • 依赖境外模型托管,权重下载慢且可能受限

接入与使用事实

部署方式
本地运行、自托管
实现语言
Python
中文界面
待确认
中文文档
待确认
定价方式
开源
许可证
待确认
国内可达性
国内可达性待核验
可达性观察
待补充

权限、依赖与维护信号

这些字段记录公开可见信号,不等同于安全审计结论。

权限信号

暂无公开信号。

依赖信号

暂无公开信号。

维护信号

暂无公开信号。

公开来源与证据

暂无可公开的来源链接。

访问官网