返回 AI 工具目录

Giskard

基础设施人工精选最近核验 2026年7月23日

Giskard 是用于测试和评估智能体系统的开源 Python 库,可包裹 LLM、黑盒智能体与多步流水线进行评测。它提供两部分能力:Giskard Checks 以场景化 API、内置检查项和 LLM-as-Judge 做质量与一致性评估,支持多轮对话与 RAG 评测;Giskard Scan 做红队与漏洞扫描,自动生成对抗测试,覆盖提示注入、数据泄露等 OWASP LLM 风险类别。当前 v3 为重写后的测试版,v2 仍可用但不再积极维护;需 Python 3.12 以上,Apache 2.0 许可。

定价开源部署本地运行国内可达国内可达许可Apache-2.0

解决什么问题

  • 缺乏系统化的 LLM 与智能体质量评测手段
  • 上线前难以发现提示注入等安全漏洞
  • RAG 与多轮对话效果难以量化回归
  • 人工评审成本高、难以持续复用

适合

  • 需要为 LLM 应用建自动化评测与回归的团队
  • 关注提示注入、数据泄露等安全风险
  • 做 RAG 或多轮智能体、需可复用测试

不适合

  • v3 尚为测试版,接口可能变动
  • v2 可用但官方不再积极维护
  • LLM-as-Judge 依赖外部模型,有额外成本
  • 面向工程集成,非零代码可视化产品

如何接入

  • 通过 pip 安装,作为 Python 库在测试中调用
  • 以场景 API 定义检查项与评审逻辑
  • 接入自选 LLM 作为评审与红队模型

已知限制

  • 需 Python 3.12 以上环境
  • 评审质量随所选 LLM 与提示而变
  • 正文未含官方基准,效果需按场景验证

接入与使用事实

部署方式
本地运行
实现语言
Python
中文界面
待确认
中文文档
待确认
定价方式
开源
许可证
Apache-2.0
国内可达性
国内可达
可达性观察
待补充

权限、依赖与维护信号

这些字段记录公开可见信号,不等同于安全审计结论。

权限信号

暂无公开信号。

依赖信号

暂无公开信号。

维护信号

暂无公开信号。

公开来源与证据

  1. 代码仓库仅作事实索引

访问官网