返回 AI 工具目录
Self-operating computer
开发框架人工精选最近核验 2026年7月23日
Self-Operating Computer Framework 是一个让多模态模型操作电脑的开源框架:模型查看屏幕截图,再输出鼠标与键盘动作以完成给定目标。2023 年 11 月发布,是较早的通用「计算机使用」(computer-use)示例之一。以 Python 实现,MIT 许可,pip 安装后用 operate 命令在 macOS、Windows、Linux(需 X server)运行。默认使用 GPT-4o,也支持 Gemini Pro Vision、Claude 3、Qwen-VL 及经 Ollama 的本地 LLaVA,另含 OCR、Set-of-Mark 视觉提示与语音输入。
定价开源部署本地运行国内可达国内可达许可MIT
解决什么问题
- 让模型看屏幕并操作鼠标键盘以完成目标任务
- 以自然语言目标驱动跨应用的界面操作
- 提供 OCR 与 Set-of-Mark 提升元素定位准确度
- 支持语音输入下达指令
- 可在 macOS、Windows、Linux 上本地运行
适合
- 想试验通用计算机使用/界面自动化的开发者
- 需要在多个视觉模型间对比操作效果的研究场景
- 愿意接受实验性项目、自行承担稳定性的用户
- 可用 Qwen-VL 或本地 LLaVA 以降低对境外模型依赖
不适合
- 计算机使用仍属实验阶段,复杂任务成功率不稳定
- 默认 GPT-4o 需 OpenAI 额度(至少约 5 美元消费)
- LLaVA 等本地模型错误率偏高
- 涉及敏感操作时需人工监督,不宜无人值守
如何接入
- 支持 GPT-4o、Gemini Pro Vision、Claude 3、Qwen-VL 等视觉模型
- 经 Ollama 运行本地 LLaVA
- pip 安装,operate 命令行启动
- 跨 macOS、Windows、Linux(需 X server)运行
已知限制
- 通用计算机使用可靠性有限,任务越复杂越易出错
- 默认依赖 OpenAI,需额度与境外网络
- 本地模型精度不足,错误率高
- 界面操作有误触风险,需人工监督
接入与使用事实
- 部署方式
- 本地运行
- 实现语言
- Python
- 中文界面
- 待确认
- 中文文档
- 待确认
- 定价方式
- 开源
- 许可证
- MIT
- 国内可达性
- 国内可达
- 可达性观察
- 待补充
权限、依赖与维护信号
这些字段记录公开可见信号,不等同于安全审计结论。
权限信号
暂无公开信号。
依赖信号
暂无公开信号。
维护信号
暂无公开信号。
公开来源与证据
- 代码仓库仅作事实索引
