返回 AI 工具目录

Promptfoo

开发框架人工精选最近核验 2026年7月23日

Promptfoo 是一款用于评测与红队测试大模型应用的开源命令行工具兼代码库,目标是用可复现的自动化评测替代反复试错。它支持对提示词与模型做批量测试、并排对比多家模型输出,通过红队与漏洞扫描发现越狱、注入等安全问题,并可接入 CI/CD 在合并请求中自动校验。评测默认在本地运行,提示词不出机器;结果可用命令行或网页查看。以 TypeScript 为主,通过 npm、brew 或 pip 安装,可对接 OpenAI、Anthropic、Azure、Bedrock、Gemini、DeepSeek、Ollama 等多家模型。采用 MIT 许可。

定价开源部署本地运行、自托管国内可达国内可达许可MIT

解决什么问题

  • 用自动化评测替代提示词与模型的反复试错
  • 并排对比多家模型在同一批用例上的表现
  • 红队与漏洞扫描发现越狱、提示注入等风险
  • 接入 CI/CD 在合并请求中自动校验模型质量

适合

  • 上线前需要对提示词与模型做回归评测的团队
  • 需要对大模型应用做安全红队测试
  • 希望评测在本地运行、数据不出机器
  • 要在 CI 流水线里卡质量门禁的工程团队

不适合

  • 不提供模型本身,需自备可调用的模型或 API
  • 非技术人员想要图形化零代码评测时门槛偏高
  • 生产环境实时监控并非其核心定位
  • 测海外模型时需自行解决网络与合规前提

如何接入

  • 命令行工具,经 npm、brew 或 pip 安装
  • 可作为 Node.js 库嵌入自有测试流程
  • 对接 OpenAI、Anthropic、Gemini、DeepSeek、Ollama 等
  • 提供网页视图与 CI/CD、PR 扫描集成

已知限制

  • 本身不含模型,依赖外部模型或推理服务
  • 评测质量取决于用例与断言设计
  • 红队能力覆盖常见风险,非等同完整安全审计
  • 调用海外模型 API 在国内需自备网络

接入与使用事实

部署方式
本地运行、自托管
实现语言
TypeScript
中文界面
待确认
中文文档
待确认
定价方式
开源
许可证
MIT
国内可达性
国内可达
可达性观察
待补充

权限、依赖与维护信号

这些字段记录公开可见信号,不等同于安全审计结论。

权限信号

暂无公开信号。

依赖信号

暂无公开信号。

维护信号

暂无公开信号。

公开来源与证据

  1. 代码仓库仅作事实索引

访问官网