返回 AI 工具目录

MM ReAct

AI 应用人工精选最近核验 2026年7月23日

MM-REACT 是微软发布的多模态推理与行动研究项目,把 ChatGPT 与一组视觉专家(Azure 认知服务)组合起来处理复杂视觉任务。它用文件路径作为图像占位符,由语言模型规划并把具体视觉问题分派给对应专家,涵盖目标检测、OCR、人脸与名人识别、密集描述、图像编辑等能力,并支持围绕图像的多轮对话。项目基于 LangChain,配套 arXiv 论文,属于验证多模态 ReAct 范式的研究原型,而非面向生产的成品服务。

定价开源部署本地运行国内可达国内可达性待核验

解决什么问题

  • 用 ChatGPT 规划并调度多个视觉专家
  • 处理目标检测、OCR、人脸等视觉任务
  • 以文件路径作占位符让语言模型引用图像
  • 支持围绕图像的多轮对话式交互
  • 演示多模态推理与行动的 ReAct 范式

适合

  • 研究多模态智能体与视觉工具调用的范式
  • 想参考 ChatGPT 编排视觉专家的实现
  • 已有 Azure 认知服务,做多模态原型
  • 用于学习或复现论文中的方法

不适合

  • 属 2023 年研究原型,不适合直接上生产
  • 强依赖 Azure 与 Bing 等境外服务
  • 需自备多项 Azure 密钥,配置成本高
  • 更新停滞,功能以论文演示为界

如何接入

  • 基于 LangChain 编排语言模型与视觉工具
  • 对接 Azure 计算机视觉、表单识别等服务
  • 调用 Azure OpenAI 提供语言推理
  • 需配置 Bing 搜索等外部 API 密钥

已知限制

  • 依赖的 Azure、Bing、OpenAI 服务均在境外
  • 2023 年后基本停更,仅作研究参考
  • 需较多云服务密钥,起步门槛高
  • 文档与代码以英文为主

接入与使用事实

部署方式
本地运行
实现语言
English
中文界面
待确认
中文文档
待确认
定价方式
开源
许可证
待确认
国内可达性
国内可达性待核验
可达性观察
待补充

权限、依赖与维护信号

这些字段记录公开可见信号,不等同于安全审计结论。

权限信号

暂无公开信号。

依赖信号

暂无公开信号。

维护信号

暂无公开信号。

公开来源与证据

暂无可公开的来源链接。

访问官网