返回 AI 工具目录

Pipecat

开发框架人工精选最近核验 2026年7月23日

Pipecat 是一个开源的实时语音与多模态对话 AI 框架,用 Python 编写,采用可组合的管道(pipeline)架构,把语音转文字、大模型、文字转语音等环节串成一条流式处理链路。它内置对 40 多种 AI 服务与多种传输方式(WebRTC、WebSocket、WhatsApp 等)的可插拔集成,支持打断、多智能体交接与并行协同,面向语音助手、电话客服、实时互动等低延迟场景。框架可本地运行,也可拆分到多进程或多机部署,采用 BSD-2 许可。

定价开源部署本地运行、自托管国内可达国内可达许可BSD-2-Clause

解决什么问题

  • 把 STT、LLM、TTS 拼装成可复用的流式对话管道
  • 统一封装 WebRTC、WebSocket 等实时音视频传输
  • 处理打断、回合切换等实时对话时序问题
  • 支持多智能体交接与并行协同
  • 可插拔接入 40 多种语音与模型服务

适合

  • 需要自建实时语音或电话对话机器人的团队
  • Python 技术栈、要低延迟流式交互的场景
  • 希望自由组合 STT/LLM/TTS 供应商
  • 做语音助手、语音客服、实时互动应用

不适合

  • 只做文本对话、无实时语音需求时偏重
  • 默认集成以海外服务为主,国内需自行替换
  • 不提供开箱即用的实名认证与内容审核
  • 非 Python 技术栈接入成本较高

如何接入

  • pip 或 uv 安装,用 Python 代码编排处理管道
  • 通过 service 插件接入各家 STT/LLM/TTS
  • 传输层支持 WebRTC、WebSocket 等
  • 可本地运行或拆分到多进程、多机部署

已知限制

  • 实时语音链路依赖第三方服务,延迟与成本受其影响
  • 内置集成以海外厂商为主,国内需自行接入合规服务
  • 框架不含实名认证、内容审核等合规能力
  • 生产级并发与可用性需自行做工程加固

接入与使用事实

部署方式
本地运行、自托管
实现语言
Python
中文界面
待确认
中文文档
待确认
定价方式
开源
许可证
BSD-2-Clause
国内可达性
国内可达
可达性观察
待补充

权限、依赖与维护信号

这些字段记录公开可见信号,不等同于安全审计结论。

权限信号

暂无公开信号。

依赖信号

暂无公开信号。

维护信号

暂无公开信号。

公开来源与证据

暂无可公开的来源链接。

访问官网