返回 AI 工具目录

Doc Search

AI 应用人工精选最近核验 2026年7月23日

Doc Search(dr-doc-search)是一个命令行应用,让你用自然语言向 PDF 提问并得到基于文档内容的回答。它分两步工作:先做索引,把 PDF 每页转成图片、做 OCR 并生成文本嵌入;再在提问时检索相关片段、交给语言模型作答。默认走 OpenAI 的嵌入与模型,1.5.0 起也支持用 HuggingFace 做嵌入与回答;OCR 依赖本机的 Tesseract 与 ImageMagick。通过 pip 安装,采用 MIT 许可。它属于较早期的「与书对话」类工具,适合个人对单本资料做检索问答;版本更新停留在较早时间,用于生产需自行评估依赖与效果。

定价开源部署本地运行国内可达国内可达性待核验

解决什么问题

  • 把 PDF 转成可被自然语言检索问答的知识源
  • 对扫描件先 OCR 再嵌入,处理无文本层的资料
  • 以命令行本地建索引,做单本资料的问答

适合

  • 个人对单本书或长文档做问答式检索
  • 能接受配置 OpenAI 或 HuggingFace 与 OCR 依赖
  • 偏好命令行、愿本地建索引的技术用户

不适合

  • 版本停留较早,长期维护性需自行评估
  • 依赖 Tesseract、ImageMagick,环境搭建有门槛
  • 默认调用 OpenAI,涉及数据出域与调用费用
  • 非多用户 Web 服务,不适合团队级知识库

如何接入

  • 以命令行建索引与提问,便于脚本化
  • 基于 LangChain,可接 OpenAI 或 HuggingFace 模型
  • OCR 环节依赖本机 Tesseract 与 ImageMagick

已知限制

  • 默认走 OpenAI,国内直连不稳,数据出域需评估
  • OCR 与嵌入质量决定回答上限,扫描件误差偏大
  • 面向单文档场景,缺少大规模语料管理
  • 项目更新较早,新依赖兼容性需自测

接入与使用事实

部署方式
本地运行
实现语言
English
中文界面
待确认
中文文档
待确认
定价方式
开源
许可证
待确认
国内可达性
国内可达性待核验
可达性观察
待补充

权限、依赖与维护信号

这些字段记录公开可见信号,不等同于安全审计结论。

权限信号

暂无公开信号。

依赖信号

暂无公开信号。

维护信号

暂无公开信号。

公开来源与证据

暂无可公开的来源链接。

访问官网