返回 AI 工具目录
UQLM
开发框架人工精选最近核验 2026年7月23日
UQLM(Uncertainty Quantification for Language Models)是 CVS Health 开源的 Python 库,用不确定性量化方法检测大模型输出中的幻觉。它提供四类打分器:黑盒(对多次采样做一致性比较)、白盒(基于 token 概率)、以 LLM 作为评审,以及把多种打分器加权组合的集成方式,另有面向长文本的逐条主张打分与代码生成评估。库对接 LangChain 聊天模型,兼容 OpenAI、Google Vertex AI、Azure、Ollama 等后端,采用 Apache-2.0 许可,可通过 pip 安装。它面向需要在上线前评估回答可信度、为高风险场景设置置信度阈值的团队。
定价开源部署本地运行国内可达国内可达
解决什么问题
- 为大模型回答给出可量化的可信度分数
- 在缺少标准答案时通过多次采样一致性发现幻觉
- 用 token 概率等白盒信号评估回答稳定性
- 支持长文本逐条主张与代码生成的评估
- 多种打分器可加权集成提升判别效果
适合
- 上线前需要评估回答可信度的 LLM 应用团队
- 已用 LangChain 组织模型调用的项目
- 高风险问答需设置置信度阈值与人工复核的场景
- 研究或对比不同幻觉检测方法的团队
不适合
- 只需简单关键词校验的场景显得偏重
- 白盒打分需模型返回 token 概率,闭源 API 未必支持
- 多次采样会增加调用成本与延迟
- 不替代人工审核,仅提供风险信号
如何接入
- 通过 pip install uqlm 安装到 Python 环境
- 传入 LangChain 兼容的聊天模型作为后端
- 选择黑盒、白盒、评审或集成打分器
- 将输出分数接入自有阈值与告警逻辑
已知限制
- 需自备可用的大模型后端,能力与成本自担
- 依赖的海外模型服务在国内访问可能受限
- 白盒方法要求可获取 token 概率
- 采样与评审类方法带来额外时延和费用
接入与使用事实
- 部署方式
- 本地运行
- 实现语言
- Python
- 中文界面
- 待确认
- 中文文档
- 待确认
- 定价方式
- 开源
- 许可证
- 待确认
- 国内可达性
- 国内可达
- 可达性观察
- 待补充
权限、依赖与维护信号
这些字段记录公开可见信号,不等同于安全审计结论。
权限信号
暂无公开信号。
依赖信号
暂无公开信号。
维护信号
暂无公开信号。
公开来源与证据
暂无可公开的来源链接。
