返回 AI 工具目录

Auto-evaluator

开发框架人工精选最近核验 2026年7月23日

Auto-evaluator 是一个用于评估大模型问答链的开源工具,由 LangChain 团队的 Lance Martin 开发。它先从用户提供的文档自动生成问答对作为测试集,再在不同配置(嵌入模型、检索方式、大模型等)下运行问答链,并用大模型作为评审给回答打分,从而横向比较各配置的效果,替代人工逐条评测。项目以 Python 实现,可作为 Streamlit 应用本地运行,过去也提供过托管版本。它面向在检索增强问答上做选型与调参、需要快速比较多种组合的研发团队。需注意项目更新停留在 2023 年,仓库亦未附带明确开源许可证。

定价免费部署本地运行国内可达国内可达性待核验

解决什么问题

  • 从文档自动生成问答对作为评测集
  • 在不同配置下运行并比较问答链效果
  • 用大模型作为评审给回答自动打分
  • 替代人工逐条评测,加快选型与调参
  • 横向对比嵌入、检索与模型的组合

适合

  • 在检索增强问答上做选型的研发团队
  • 需要快速比较多种配置效果的项目
  • 已用 LangChain 搭建问答链的场景
  • 希望自动生成评测集减少人工的团队

不适合

  • 项目更新停留在 2023 年,需评估维护风险
  • 仓库未附明确开源许可证,商用需谨慎
  • 评审与生成默认依赖 OpenAI,国内访问受限
  • 自动生成的评测集质量仍需人工抽检

如何接入

  • 克隆仓库并以 Streamlit 应用本地运行
  • 上传文档自动生成问答测试集
  • 配置嵌入、检索方式与待测模型
  • 查看打分结果比较各配置

已知限制

  • 最近更新停留在 2023 年,基本停止维护
  • 仓库未附带明确开源许可证
  • 托管演示版本可能已不可用
  • 依赖的 OpenAI 等服务在国内访问受限

接入与使用事实

部署方式
本地运行
实现语言
Python
中文界面
待确认
中文文档
待确认
定价方式
免费
许可证
待确认
国内可达性
国内可达性待核验
可达性观察
待补充

权限、依赖与维护信号

这些字段记录公开可见信号,不等同于安全审计结论。

权限信号

暂无公开信号。

依赖信号

暂无公开信号。

维护信号

暂无公开信号。

公开来源与证据

暂无可公开的来源链接。

访问官网