返回 AI 工具目录
Bark
开发框架人工精选最近核验 2026年7月23日
Bark 是 Suno 开源(MIT)的文本转音频生成模型。它不是传统 TTS,而是完全生成式:不经过音素中间步骤,采用类 GPT 架构(参考 AudioLM、Vall-E),配合 EnCodec 的量化音频表示,直接由文本生成音频。除多语言语音外,还能生成音乐、背景音与笑声、叹息等非语言声音,可用 [laughter]、♪ 等标记控制输出。支持含简体中文在内的 13 种语言,提供 100 多个说话人预设,单次约生成 13–14 秒音频。因其生成式特性,输出可能偏离提示、存在不确定性,且不支持自定义音色克隆(仅限内置预设)。
定价开源部署本地运行、自托管国内可达国内可达许可MIT
解决什么问题
- 由文本直接生成多语言语音,含简体中文等 13 种语言
- 在语音外还能生成音乐、音效与笑声、叹息等非语言声音
- 用 [laughter]、♪ 等标记在文本内控制情绪与非语言表达
- 提供 100 多个说话人预设,无需自备语料即可出声
适合
- 需要生成式、带情感与非语言表达的音频原型或创意内容
- 多语言语音、音效、简单音乐的实验与 Demo 场景
- 希望模型与数据留在本地、可自托管的团队
- 接受输出有随机性、以创意而非严格复现为目标
不适合
- 需要逐字稳定、可复现的播报级 TTS,生成式输出会偏离提示
- 需要克隆指定人物音色,仅支持内置预设、不做自定义克隆
- 长音频场景受限,单次约 13–14 秒需自行拼接
- 商用配音一致性要求高时需额外校验与后期处理
如何接入
- MIT 许可,以 Python/PyTorch 模型形式本地运行
- 提供 100 多个说话人预设,支持情感与非语言标记
- 单次约生成 13–14 秒,长文本需分段生成再拼接
- 底层用 EnCodec 量化音频、类 GPT 架构生成
已知限制
- 完全生成式,输出可能偏离提示、稳定性不如传统 TTS
- 不支持自定义音色克隆,仅能使用内置说话人预设
- 单次生成约 13–14 秒,长音频需自行分段
- 本地推理需下载模型权重,对算力有一定要求
接入与使用事实
- 部署方式
- 本地运行、自托管
- 实现语言
- Python
- 中文界面
- 待确认
- 中文文档
- 待确认
- 定价方式
- 开源
- 许可证
- MIT
- 国内可达性
- 国内可达
- 可达性观察
- 待补充
权限、依赖与维护信号
这些字段记录公开可见信号,不等同于安全审计结论。
权限信号
暂无公开信号。
依赖信号
暂无公开信号。
维护信号
暂无公开信号。
公开来源与证据
暂无可公开的来源链接。
