返回 AI 工具目录
AudioGPT
AI 应用人工精选最近核验 2026年7月23日
AudioGPT 是一个开源的多模态音频 AI 研究项目,围绕「理解与生成语音、音乐、声音与说话人头像」整合多个基础模型。它把文本转语音、语音识别/增强/分离/翻译、歌声合成、文本转音频、音频修复、图像转音频、声音检测与提取,以及说话人头像生成等十余类任务串联起来。以 Python 实现,集成 FastSpeech、VITS、Whisper、DiffSinger、Make-An-Audio、GeneFace 等模型,提供 Hugging Face Spaces 演示。多项能力标注为 WIP(开发中),定位研究演示而非生产系统。
定价开源部署本地运行、自托管国内可达国内可达性待核验
解决什么问题
- 用统一入口串联语音、音乐、声音与说话人头像等音频任务
- 覆盖文本转语音、识别、增强、分离与翻译
- 支持歌声合成、文本转音频与音频修复
- 提供声音检测/提取与说话人头像生成
- 以对话式方式调度多个音频基础模型
适合
- 研究多模态音频、想快速试跑多种任务的开发者
- 需要一处集成多种音频模型做对比的场景
- 愿意自托管并自行下载模型权重的用户
- 把它当能力原型/演示而非上线系统的团队
不适合
- 多项任务标注 WIP,能力不完整、不宜直接生产
- 部分模型仓库缺失,复现需自行补齐权重
- 许可未在说明中明确,商用前需核对
- 模型权重下载体量大,境内拉取可能较慢
如何接入
- 集成 FastSpeech、VITS、Whisper、DiffSinger 等模型
- 含 Make-An-Audio、GeneFace 等音频/头像生成模型
- 提供 Hugging Face Spaces 在线演示
- Python 实现,自托管运行
已知限制
- 多项能力处于 WIP,稳定性与完整度不足
- 部分模型无对应仓库,需自行处理
- 许可信息不明确,商用需谨慎
- 依赖境外模型托管,权重下载慢且可能受限
接入与使用事实
- 部署方式
- 本地运行、自托管
- 实现语言
- Python
- 中文界面
- 待确认
- 中文文档
- 待确认
- 定价方式
- 开源
- 许可证
- 待确认
- 国内可达性
- 国内可达性待核验
- 可达性观察
- 待补充
权限、依赖与维护信号
这些字段记录公开可见信号,不等同于安全审计结论。
权限信号
暂无公开信号。
依赖信号
暂无公开信号。
维护信号
暂无公开信号。
公开来源与证据
暂无可公开的来源链接。
