返回 AI 工具目录

UQLM

开发框架人工精选最近核验 2026年7月23日

UQLM(Uncertainty Quantification for Language Models)是 CVS Health 开源的 Python 库,用不确定性量化方法检测大模型输出中的幻觉。它提供四类打分器:黑盒(对多次采样做一致性比较)、白盒(基于 token 概率)、以 LLM 作为评审,以及把多种打分器加权组合的集成方式,另有面向长文本的逐条主张打分与代码生成评估。库对接 LangChain 聊天模型,兼容 OpenAI、Google Vertex AI、Azure、Ollama 等后端,采用 Apache-2.0 许可,可通过 pip 安装。它面向需要在上线前评估回答可信度、为高风险场景设置置信度阈值的团队。

定价开源部署本地运行国内可达国内可达

解决什么问题

  • 为大模型回答给出可量化的可信度分数
  • 在缺少标准答案时通过多次采样一致性发现幻觉
  • 用 token 概率等白盒信号评估回答稳定性
  • 支持长文本逐条主张与代码生成的评估
  • 多种打分器可加权集成提升判别效果

适合

  • 上线前需要评估回答可信度的 LLM 应用团队
  • 已用 LangChain 组织模型调用的项目
  • 高风险问答需设置置信度阈值与人工复核的场景
  • 研究或对比不同幻觉检测方法的团队

不适合

  • 只需简单关键词校验的场景显得偏重
  • 白盒打分需模型返回 token 概率,闭源 API 未必支持
  • 多次采样会增加调用成本与延迟
  • 不替代人工审核,仅提供风险信号

如何接入

  • 通过 pip install uqlm 安装到 Python 环境
  • 传入 LangChain 兼容的聊天模型作为后端
  • 选择黑盒、白盒、评审或集成打分器
  • 将输出分数接入自有阈值与告警逻辑

已知限制

  • 需自备可用的大模型后端,能力与成本自担
  • 依赖的海外模型服务在国内访问可能受限
  • 白盒方法要求可获取 token 概率
  • 采样与评审类方法带来额外时延和费用

接入与使用事实

部署方式
本地运行
实现语言
Python
中文界面
待确认
中文文档
待确认
定价方式
开源
许可证
待确认
国内可达性
国内可达
可达性观察
待补充

权限、依赖与维护信号

这些字段记录公开可见信号,不等同于安全审计结论。

权限信号

暂无公开信号。

依赖信号

暂无公开信号。

维护信号

暂无公开信号。

公开来源与证据

暂无可公开的来源链接。

访问官网