返回 AI 工具目录

Rhesis

基础设施人工精选最近核验 2026年7月24日

Rhesis 是面向 AI 团队的测试平台,帮助工程师、产品经理与领域专家协作,为 LLM 与智能体应用生成测试、模拟(含对抗性)多轮对话,并把每个失败追溯到根因。它能从自然语言需求合成大量测试场景,用 Penelope 智能体模拟多轮对话,用 Polyphemus 智能体与 Garak 做对抗测试,内置 60 多种评测指标(涵盖 RAGAS、DeepEval、Garak),并通过 OpenTelemetry 追踪 LLM 调用、把链路与测试结果关联。基于 LiteLLM 支持 OpenAI、Anthropic、Google、Ollama 等上百种模型。提供托管云、Docker 与 Kubernetes 自建以及 rhesis-sdk。核心 MIT 许可,另有企业版。

定价开源部署SaaS 云服务、自托管国内可达国内可达性待核验

解决什么问题

  • 从自然语言需求批量生成测试场景
  • 模拟多轮及对抗性对话验证应用
  • 用 60 多种指标评测输出质量
  • 借 OpenTelemetry 追踪调用并定位根因
  • 让工程、产品、领域专家协同测试

适合

  • 需要系统化测试 LLM 或智能体应用
  • 关注对抗测试与安全性验证
  • 想统一管理测试用例与评测指标
  • 用 LiteLLM 生态、需接多家模型

不适合

  • 托管云为海外 SaaS,数据出域需评估
  • 自建需 Docker 或 Kubernetes 运维能力
  • 偏重测试评测,非生产运行时框架
  • 企业版功能需单独授权

如何接入

  • 可选托管云或用 ./rh 自建部署
  • pip install rhesis-sdk 接入代码
  • 经 LiteLLM 对接上百种模型
  • 集成 LangChain、LangGraph、CrewAI 等

已知限制

  • Rhesis Cloud 数据存于海外,存在出域
  • 自建对运维与资源有一定要求
  • 指标质量依赖底层框架与所选模型
  • 企业能力与开源版存在功能差异

接入与使用事实

部署方式
SaaS 云服务、自托管
实现语言
Python、TypeScript
中文界面
待确认
中文文档
待确认
定价方式
开源
许可证
待确认
国内可达性
国内可达性待核验
可达性观察
待补充

权限、依赖与维护信号

这些字段记录公开可见信号,不等同于安全审计结论。

权限信号

暂无公开信号。

依赖信号

暂无公开信号。

维护信号

暂无公开信号。

公开来源与证据

暂无可公开的来源链接。

访问官网