self-operating-computer

使多模态模型能够操作计算机的框架

Self-Operating Computer 多模态模型 GPT-4o 键盘鼠标操作 API接口 Github 开源项目

Self-Operating Computer Framework通过模拟人类的视觉和手动操作，实现计算机的自动化控制。当前支持GPT-4o、Gemini Pro Vision、Claude 3和LLaVa多模态模型，并计划对更多模型开放兼容。适用于Mac OS, Windows和Linux系统。

文档

Open-Interface - 利用LLM实现计算机自驱动操作

GPT-4VGithubOpen Interface开源项目机器学习自动化自驾电脑软件

Open Interface通过向LLM后端（如GPT-4V）发送用户请求来实现计算机的全自动驾驶功能。系统通过模拟键盘和鼠标输入自动执行任务，并在必要时发送当前屏幕截图进行调整。此项目支持MacOS、Linux和Windows，并允许连接不同的LLM后端进行自定义配置，带来了提高效率和自动化的新选择。

OS-Copilot - 通用计算机代理的开源自我提升框架

AI助手GithubOS-Copilot开源项目操作系统自我改进

OS-Copilot是一个开源框架，用于构建Linux和MacOS上的通用计算机代理。它提供统一接口，实现异构操作系统生态中的应用程序交互。该项目包含FRIDAY，一个可自我改进的AI助手，能处理常见计算机任务。OS-Copilot支持Web交互、代码终端操作、文件管理和多媒体处理等功能，为开发通用AI代理提供了基础平台。

ScreenAgent - 由视觉语言大模型驱动的电脑控制工具

GithubIJCAI 2024ScreenAgentVLM Agent开源项目数据集自动控制

ScreenAgent项目创建了一个由视觉语言模型驱动的电脑控制环境，允许代理通过截图与真实屏幕互动并操作GUI。自动控制流程分为规划、执行和反思三个阶段，使代理能够完成多步骤任务。项目包含丰富的截图和操作序列数据集，支持包括GPT-4V、LLaVA-1.5、CogAgent和ScreenAgent在内的多种模型，并提供简化体验的网页版客户端。

SeeAct - 基于多模态GPT模型的网页任务自动化解决方案

GPT-4V(ision)GithubMind2WebSeeActweb代理多模态模型开源项目

SeeAct采用多模态GPT模型（如GPT-4V(ision)），提供网页任务自动化的解决方案，支持OpenAI和Google的多种语言模型，并与Playwright浏览器无缝集成。适用于网页代理测试与评估，支持多种配置和自定义任务，实现安全操作和实时监控。Multimodal-Mind2Web数据集提供丰富的网页截图和HTML文本，便于实验和评估。

GPT4Tools - 大语言模型自学使用多模态工具的创新系统

GPT4ToolsGithub多模态交互大语言模型开源项目自我指导视觉基础模型

GPT4Tools是基于Vicuna (LLaMA)的创新系统,通过71K自建指令数据实现对多个视觉基础模型的智能控制。该系统能自动决策和利用不同视觉模型,实现对话中的图像交互。项目支持通过自我指导和LoRA微调教授大语言模型使用工具,为图像相关需求提供高效解决方案。GPT4Tools的开源性和灵活性使其成为AI研究与应用的重要工具。

GPT-4o - OpenAI多模态AI平台GPT-4o革新人机交互

AI工具ChatGPTGPT-4oOpenAI人工智能多模态

Auto-GPT-ZH - GPT-4驱动的自主AI实验探索

Auto-GPTGPT-4Github人工智能实验应用开源项目自主AI

Auto-GPT-ZH是一个基于GPT-4的开源实验项目，展示了AI的自主功能。该系统能自动执行网页开发、商业调查等复杂任务，无需人工干预。项目为AI研究提供实践平台，同时提醒使用者注意其局限性和潜在风险，建议谨慎使用API并遵守相关规定。

OpenAdapt - 具有大型多模态模型（LMM）的 AI 优先流程自动化

AI-First Process AutomationGUI AutomationGithubLarge Multimodal ModelsOpenAdaptPython开源项目

OpenAdapt项目利用大型多模态模型（LMMs）实现与桌面和网页图形用户界面的无缝集成。这个开源Python库通过录制和分析用户操作，自动生成任务提示并执行任务回放，减少重复性工作，提高效率。项目特点包括模型无关性、自动提示生成和广泛的系统兼容性，支持所有类型的GUI，包括虚拟化和网页。项目遵守MIT开源许可证。了解更多关于安装、使用和贡献的信息，并加入开发者社区优化流程自动化技术。

vimGPT - 基于GPT-4V的无鼠标网页浏览器

AI浏览器GPT-4VGithubVimiumvimGPT多模态模型开源项目

vimGPT是一个创新的网页浏览项目，结合了GPT-4V的视觉能力和Vimium扩展。该项目实现了无需鼠标的网页浏览，用户可通过键盘或语音命令操控浏览器。vimGPT探索了多模态模型在网络交互中的应用，提高了网页访问的便利性。项目正在开发更多功能，如集成高级API和提升图像分辨率，以增强整体用户体验。

multimodal-maestro - 多模态AI模型控制与高效提示策略框架

AI提示GithubMultimodal-MaestroPython图像处理大型多模态模型开源项目

multimodal-maestro是一个开源框架，旨在增强对大型多模态AI模型的控制能力。该项目提供先进的提示策略，使模型能够执行复杂的视觉理解任务。支持图像标注、掩码生成等功能，并具有简洁的API设计。multimodal-maestro能够充分发挥GPT-4V等多模态模型的潜力，实现更精准的视觉分析和处理。

相关项目

推荐项目

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手，通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能，支持100+编程语言，与主流编辑器无缝集成，显著提升开发效率和代码质量。

AI写歌

Suno AI是一个革命性的AI音乐创作平台，能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐，Suno AI都是音乐爱好者和专业人士的理想选择。

有言AI

有言平台提供一站式AIGC视频创作解决方案，通过智能技术简化视频制作流程。无论是企业宣传还是个人分享，有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Kimi

Kimi AI助手提供多语言对话支持，能够阅读和理解用户上传的文件内容，解析网页信息，并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题，Kimi都能以友好、专业的方式提供帮助。

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术，为商家提供一键生成商品图和营销文案的服务，显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台，让商品第一时间被种草。

吐司

探索Tensor.Art平台的独特AI模型，免费访问各种图像生成与AI训练工具，从Stable Diffusion等基础模型开始，轻松实现创新图像生成。体验前沿的AI技术，推动个人和企业的创新发展。

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器，它将改变您观看视频的方式！SubCat结合了先进的人工智能技术，为您提供即时视频字幕翻译，无论是本地视频还是网络流媒体，让您轻松享受各种语言的内容。

美间AI

美间AI创意设计平台，利用前沿AI技术，为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图，再到文案生成，美间让创意设计更简单、更高效。

稿定AI

稿定设计是一个多功能的在线设计和创意平台，提供广泛的设计工具和资源，以满足不同用户的需求。从专业的图形设计师到普通用户，无论是进行图片处理、智能抠图、H5页面制作还是视频剪辑，稿定设计都能提供简单、高效的解决方案。该平台以其用户友好的界面和强大的功能集合，帮助用户轻松实现创意设计。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com