返回 AI 工具目录

Bark

开发框架人工精选最近核验 2026年7月23日

Bark 是 Suno 开源(MIT)的文本转音频生成模型。它不是传统 TTS,而是完全生成式:不经过音素中间步骤,采用类 GPT 架构(参考 AudioLM、Vall-E),配合 EnCodec 的量化音频表示,直接由文本生成音频。除多语言语音外,还能生成音乐、背景音与笑声、叹息等非语言声音,可用 [laughter]、♪ 等标记控制输出。支持含简体中文在内的 13 种语言,提供 100 多个说话人预设,单次约生成 13–14 秒音频。因其生成式特性,输出可能偏离提示、存在不确定性,且不支持自定义音色克隆(仅限内置预设)。

定价开源部署本地运行、自托管国内可达国内可达许可MIT

解决什么问题

  • 由文本直接生成多语言语音,含简体中文等 13 种语言
  • 在语音外还能生成音乐、音效与笑声、叹息等非语言声音
  • 用 [laughter]、♪ 等标记在文本内控制情绪与非语言表达
  • 提供 100 多个说话人预设,无需自备语料即可出声

适合

  • 需要生成式、带情感与非语言表达的音频原型或创意内容
  • 多语言语音、音效、简单音乐的实验与 Demo 场景
  • 希望模型与数据留在本地、可自托管的团队
  • 接受输出有随机性、以创意而非严格复现为目标

不适合

  • 需要逐字稳定、可复现的播报级 TTS,生成式输出会偏离提示
  • 需要克隆指定人物音色,仅支持内置预设、不做自定义克隆
  • 长音频场景受限,单次约 13–14 秒需自行拼接
  • 商用配音一致性要求高时需额外校验与后期处理

如何接入

  • MIT 许可,以 Python/PyTorch 模型形式本地运行
  • 提供 100 多个说话人预设,支持情感与非语言标记
  • 单次约生成 13–14 秒,长文本需分段生成再拼接
  • 底层用 EnCodec 量化音频、类 GPT 架构生成

已知限制

  • 完全生成式,输出可能偏离提示、稳定性不如传统 TTS
  • 不支持自定义音色克隆,仅能使用内置说话人预设
  • 单次生成约 13–14 秒,长音频需自行分段
  • 本地推理需下载模型权重,对算力有一定要求

接入与使用事实

部署方式
本地运行、自托管
实现语言
Python
中文界面
待确认
中文文档
待确认
定价方式
开源
许可证
MIT
国内可达性
国内可达
可达性观察
待补充

权限、依赖与维护信号

这些字段记录公开可见信号,不等同于安全审计结论。

权限信号

暂无公开信号。

依赖信号

暂无公开信号。

维护信号

暂无公开信号。

公开来源与证据

暂无可公开的来源链接。

访问官网