#CogVLM
CogVLM - 开源视觉语言模型,提升图像理解与跨模态对话功能
CogVLMCogAgent跨模态基准测试图像理解多回合对话Github开源项目
CogVLM和CogAgent是领先的开源视觉语言模型,专注于图像理解和跨模态任务。CogVLM-17B拥有100亿视觉参数和70亿语言参数,并在NoCaps、Flicker30k等十个经典跨模态基准测试上表现出色。CogAgent在CogVLM的基础上改进,增添了GUI图像代理能力,支持1120*1120分辨率的图像理解,并在VQAv2、TextVQA等九个基准测试中表现优秀。该项目提供详细的技术文档、示例代码和Web演示,用户可以方便地进行模型推理和微调。了解更多信息,请访问项目主页。
cogvlm-chat-hf - 开源视觉语言模型CogVLM在多项跨模态基准测试中超越PaLI-X 55B
模型开源GithubCogVLM图像识别视觉语言模型Huggingface开源项目多模态
CogVLM是一款开源视觉语言模型,具有100亿视觉参数和70亿语言参数。在NoCaps、Flicker30k等10个经典跨模态基准测试中,CogVLM实现了最先进的性能,部分超越PaLI-X 55B。其架构包括视觉变换器编码器、MLP适配器、预训练语言模型和视觉专家模块。CogVLM能进行多模态对话,适用于图像描述和视觉问答等任务。该模型对学术研究开放,经登记后可免费用于商业用途。
cogagent-chat-hf - 视觉多轮对话及GUI代理开源模型
CogAgentGUI操作Huggingface跨模态基准Github开源项目模型CogVLM图像理解
CogAgent是一款基于CogVLM改进的开源视觉语言模型,支持超高分辨率图像输入与OCR任务。在VQAv2等跨模态测试表现优秀,免费供学术研究,商业使用需注册许可。