返回 AI 工具目录
Doc Search
AI 应用人工精选最近核验 2026年7月23日
Doc Search(dr-doc-search)是一个命令行应用,让你用自然语言向 PDF 提问并得到基于文档内容的回答。它分两步工作:先做索引,把 PDF 每页转成图片、做 OCR 并生成文本嵌入;再在提问时检索相关片段、交给语言模型作答。默认走 OpenAI 的嵌入与模型,1.5.0 起也支持用 HuggingFace 做嵌入与回答;OCR 依赖本机的 Tesseract 与 ImageMagick。通过 pip 安装,采用 MIT 许可。它属于较早期的「与书对话」类工具,适合个人对单本资料做检索问答;版本更新停留在较早时间,用于生产需自行评估依赖与效果。
定价开源部署本地运行国内可达国内可达性待核验
解决什么问题
- 把 PDF 转成可被自然语言检索问答的知识源
- 对扫描件先 OCR 再嵌入,处理无文本层的资料
- 以命令行本地建索引,做单本资料的问答
适合
- 个人对单本书或长文档做问答式检索
- 能接受配置 OpenAI 或 HuggingFace 与 OCR 依赖
- 偏好命令行、愿本地建索引的技术用户
不适合
- 版本停留较早,长期维护性需自行评估
- 依赖 Tesseract、ImageMagick,环境搭建有门槛
- 默认调用 OpenAI,涉及数据出域与调用费用
- 非多用户 Web 服务,不适合团队级知识库
如何接入
- 以命令行建索引与提问,便于脚本化
- 基于 LangChain,可接 OpenAI 或 HuggingFace 模型
- OCR 环节依赖本机 Tesseract 与 ImageMagick
已知限制
- 默认走 OpenAI,国内直连不稳,数据出域需评估
- OCR 与嵌入质量决定回答上限,扫描件误差偏大
- 面向单文档场景,缺少大规模语料管理
- 项目更新较早,新依赖兼容性需自测
接入与使用事实
- 部署方式
- 本地运行
- 实现语言
- English
- 中文界面
- 待确认
- 中文文档
- 待确认
- 定价方式
- 开源
- 许可证
- 待确认
- 国内可达性
- 国内可达性待核验
- 可达性观察
- 待补充
权限、依赖与维护信号
这些字段记录公开可见信号,不等同于安全审计结论。
权限信号
暂无公开信号。
依赖信号
暂无公开信号。
维护信号
暂无公开信号。
公开来源与证据
暂无可公开的来源链接。
