返回 AI 工具目录

Vision agent

开发框架人工精选最近核验 2026年7月23日

Vision Agent 是 LandingAI 开源的视觉 AI Agent 库:给定一段自然语言指令和图像,它自动挑选合适的视觉模型(目标检测、计数、视频跟踪等)并生成可直接运行的 Python 代码,降低搭建视觉流水线的门槛。它底层调用 Anthropic 与 Google 的模型完成推理与代码生成,并需要 LandingAI、Anthropic、Google 三方 API Key。官方已将该仓库标记为弃用,建议改用其 Agentic Document Extraction(面向文档解析的后继方案)。采用 Apache-2.0,以 Python 包形式使用,适合作为视觉自动化的参考实现。

定价开源部署API 接入、本地运行国内可达国内可达性待核验许可Apache-2.0

解决什么问题

  • 用自然语言把图像任务转成可运行代码
  • 自动选型并编排目标检测、计数、跟踪等视觉模型
  • 减少手工拼接视觉模型与调参
  • 内置常用视觉工具便于快速试验

适合

  • 需要快速验证视觉任务可行性的研发
  • 把图像或视频分析原型化为 Python 代码
  • 文档解析类需求可评估其后继方案
  • 愿意接受依赖海外模型 API 的团队

不适合

  • 仓库已弃用,不宜用于新的生产系统
  • 需 LandingAI、Anthropic、Google 三方 Key,国内直连受限
  • 图像数据经海外 API 处理,合规敏感场景不适用
  • 离线或纯本地部署无法满足

如何接入

  • 以 Python 包引入,传入指令与图像调用
  • 需配置 LandingAI、Anthropic、Google API Key
  • 输出可运行的视觉处理代码供二次集成
  • 新项目建议对接 Agentic Document Extraction

已知限制

  • 项目已被官方标记弃用,维护停止
  • 强依赖海外模型 API,存在延迟与数据出域
  • 免费额度有限,规模化需付费
  • 生成代码质量需人工复核

接入与使用事实

部署方式
API 接入、本地运行
实现语言
Python
中文界面
待确认
中文文档
待确认
定价方式
开源
许可证
Apache-2.0
国内可达性
国内可达性待核验
可达性观察
待补充

权限、依赖与维护信号

这些字段记录公开可见信号,不等同于安全审计结论。

权限信号

暂无公开信号。

依赖信号

暂无公开信号。

维护信号

暂无公开信号。

公开来源与证据

  1. 代码仓库仅作事实索引

访问官网