返回 AI 工具目录
Auto-evaluator
开发框架人工精选最近核验 2026年7月23日
Auto-evaluator 是一个用于评估大模型问答链的开源工具,由 LangChain 团队的 Lance Martin 开发。它先从用户提供的文档自动生成问答对作为测试集,再在不同配置(嵌入模型、检索方式、大模型等)下运行问答链,并用大模型作为评审给回答打分,从而横向比较各配置的效果,替代人工逐条评测。项目以 Python 实现,可作为 Streamlit 应用本地运行,过去也提供过托管版本。它面向在检索增强问答上做选型与调参、需要快速比较多种组合的研发团队。需注意项目更新停留在 2023 年,仓库亦未附带明确开源许可证。
定价免费部署本地运行国内可达国内可达性待核验
解决什么问题
- 从文档自动生成问答对作为评测集
- 在不同配置下运行并比较问答链效果
- 用大模型作为评审给回答自动打分
- 替代人工逐条评测,加快选型与调参
- 横向对比嵌入、检索与模型的组合
适合
- 在检索增强问答上做选型的研发团队
- 需要快速比较多种配置效果的项目
- 已用 LangChain 搭建问答链的场景
- 希望自动生成评测集减少人工的团队
不适合
- 项目更新停留在 2023 年,需评估维护风险
- 仓库未附明确开源许可证,商用需谨慎
- 评审与生成默认依赖 OpenAI,国内访问受限
- 自动生成的评测集质量仍需人工抽检
如何接入
- 克隆仓库并以 Streamlit 应用本地运行
- 上传文档自动生成问答测试集
- 配置嵌入、检索方式与待测模型
- 查看打分结果比较各配置
已知限制
- 最近更新停留在 2023 年,基本停止维护
- 仓库未附带明确开源许可证
- 托管演示版本可能已不可用
- 依赖的 OpenAI 等服务在国内访问受限
接入与使用事实
- 部署方式
- 本地运行
- 实现语言
- Python
- 中文界面
- 待确认
- 中文文档
- 待确认
- 定价方式
- 免费
- 许可证
- 待确认
- 国内可达性
- 国内可达性待核验
- 可达性观察
- 待补充
权限、依赖与维护信号
这些字段记录公开可见信号,不等同于安全审计结论。
权限信号
暂无公开信号。
依赖信号
暂无公开信号。
维护信号
暂无公开信号。
公开来源与证据
暂无可公开的来源链接。
