返回 AI 工具目录

Self-operating computer

开发框架人工精选最近核验 2026年7月23日

Self-Operating Computer Framework 是一个让多模态模型操作电脑的开源框架:模型查看屏幕截图,再输出鼠标与键盘动作以完成给定目标。2023 年 11 月发布,是较早的通用「计算机使用」(computer-use)示例之一。以 Python 实现,MIT 许可,pip 安装后用 operate 命令在 macOS、Windows、Linux(需 X server)运行。默认使用 GPT-4o,也支持 Gemini Pro Vision、Claude 3、Qwen-VL 及经 Ollama 的本地 LLaVA,另含 OCR、Set-of-Mark 视觉提示与语音输入。

定价开源部署本地运行国内可达国内可达许可MIT

解决什么问题

  • 让模型看屏幕并操作鼠标键盘以完成目标任务
  • 以自然语言目标驱动跨应用的界面操作
  • 提供 OCR 与 Set-of-Mark 提升元素定位准确度
  • 支持语音输入下达指令
  • 可在 macOS、Windows、Linux 上本地运行

适合

  • 想试验通用计算机使用/界面自动化的开发者
  • 需要在多个视觉模型间对比操作效果的研究场景
  • 愿意接受实验性项目、自行承担稳定性的用户
  • 可用 Qwen-VL 或本地 LLaVA 以降低对境外模型依赖

不适合

  • 计算机使用仍属实验阶段,复杂任务成功率不稳定
  • 默认 GPT-4o 需 OpenAI 额度(至少约 5 美元消费)
  • LLaVA 等本地模型错误率偏高
  • 涉及敏感操作时需人工监督,不宜无人值守

如何接入

  • 支持 GPT-4o、Gemini Pro Vision、Claude 3、Qwen-VL 等视觉模型
  • 经 Ollama 运行本地 LLaVA
  • pip 安装,operate 命令行启动
  • 跨 macOS、Windows、Linux(需 X server)运行

已知限制

  • 通用计算机使用可靠性有限,任务越复杂越易出错
  • 默认依赖 OpenAI,需额度与境外网络
  • 本地模型精度不足,错误率高
  • 界面操作有误触风险,需人工监督

接入与使用事实

部署方式
本地运行
实现语言
Python
中文界面
待确认
中文文档
待确认
定价方式
开源
许可证
MIT
国内可达性
国内可达
可达性观察
待补充

权限、依赖与维护信号

这些字段记录公开可见信号,不等同于安全审计结论。

权限信号

暂无公开信号。

依赖信号

暂无公开信号。

维护信号

暂无公开信号。

公开来源与证据

  1. 代码仓库仅作事实索引

访问官网