MobileVLM-1.7B

移动设备优化的高效多模态视觉语言模型

多模态 MobileVLM 性能评估移动设备模型 Github 开源项目模型推理 Huggingface

MobileVLM-1.7B是一种专为移动设备设计的多模态视觉语言模型，通过多种优化技术实现高效推理，支持跨模态交互。该模型在标准基准测试中表现出色，并经过CLIP方式的预训练。在Qualcomm Snapdragon 888和NVIDIA Jeston Orin设备上的处理速度分别为每秒21.5个和65.3个令牌。

Github

Huggingface

介绍相关项目

llava-v1.6-34b-hf - 图像与文本交互的多模态AI模型

GithubHuggingfaceLLaVa-NeXTNous-Hermes-2-Yi-34B光学字符识别多模态聊天机器人开源项目模型视觉指令微调

LLaVa-NeXT模型结合大规模语言模型与视觉编码器，通过提高图像分辨率和优化数据集，增强了OCR和常识推理能力，适用于多模态对话应用场景。支持图像字幕生成和视觉问答，提供双语功能与商业许可保障。

cogvlm2-llama3-chinese-chat-19B - 双语视觉语言模型，支持大规模文本和图像解析

CogVLM2GithubHuggingface中文支持开源模型开源项目文本生成模型视觉理解

CogVLM2-LLaMA3-Chinese 是一个开源模型，支持中文和英文，表现出显著性能提升，比如在 TextVQA 和 DocVQA 基准测试中。这一模型支持最大8K的文本长度和1344*1344的图像分辨率，特别适合文本和图像的理解与对话任务。构建于Meta-Llama-3-8B-Instruct基础之上，用户可在ZhipuAI开放平台进行实际体验，适用于需要强大图像解析和多语言支持的场景。

Mono-InternVL-2B - 原生多模态大语言模型融合视觉与文本能力

GithubHuggingfaceInternLM2原生模型多模态大语言模型开源项目模型视觉识别语言模型

Mono-InternVL是一个融合视觉编码和文本解码的原生多模态大语言模型。它通过专家混合机制和内生视觉预训练方法优化视觉理解能力，同时保持强大的语言能力。该模型基于InternLM2构建，拥有1.8B激活参数，在多项视觉语言基准测试中表现优异，并将首个token的延迟降低67%，大幅提升了部署效率。

mobilenetv3_small_075.lamb_in1k - 移动网络V3小型模型的图像分类与优化方法

GithubHuggingfaceImageNet-1kMobileNet-v3timm图像分类开源项目模型特征提取

该项目采用MobileNet-v3模型进行图像分类，在ImageNet-1k数据集上通过LAMB优化器和RMSProp优化器进行微调。利用指数衰减学习率调度和EMA权重平均，提高性能表现。模型在特征提取和图像嵌入方面表现出色，适合开发轻量级视觉识别应用。

Qwen2-VL-2B-Instruct-GPTQ-Int4 - Qwen2-VL推动多模态与自动化的跨语言视觉处理进步

GithubHuggingfaceQwen2-VL多模态多语言支持开源项目机器人人工智能模型视频理解

Qwen2-VL具备先进的多模态处理能力，支持高分辨率图像和长时视频理解，适用于视频问答及自动化设备控制。支持包括欧洲语言、日语、韩语、阿拉伯语等多语言文本理解。更新的分辨率处理和位置嵌入技术提升了视觉感知性能。

Qwen2-VL-72B-Instruct-GPTQ-Int4 - 多语言支持与视觉语义分析增强

GithubHuggingfaceQwen2-VL多语言支持开源项目模型视觉理解视频理解跨设备集成

Qwen2-VL在多模态处理技术上取得进展，增强了多语言支持、图像和视频解析能力。在视觉理解测试中表现优异，可处理超过20分钟的视频，实现高质量问答和内容创作，并具备移动设备与机器人操作能力。多维位置嵌入提升了多模态处理效能，可识别多种语言文本，适用于复杂视觉场景。

ai-hub-models - 一系列性能优化的机器学习模型

GithubPythonQualcomm AI Hub开源项目性能优化机器学习模型设备部署

Qualcomm® AI Hub Models提供了一系列性能优化的机器学习模型，适用于视觉、语音、文本和生成式AI。这些模型可以在Qualcomm设备上高效部署，并提供开源的量化、优化和部署指南。用户可以通过Hugging Face访问模型，并通过示例应用程序在本地设备上部署。支持多种操作系统和计算单元，兼容多款Snapdragon芯片，并提供详细的性能指标和文档。

Llama-3.2-90B-Vision - 前沿视觉语言模型助力图像识别和推理

GithubHuggingfaceLlama 3.2Meta多模态大语言模型开源项目模型自然语言处理计算机视觉

Llama-3.2-90B-Vision是Meta开发的多模态大语言模型,支持图像和文本输入并输出文本。该模型在视觉识别、图像推理、描述和问答等任务中表现优异,性能超越多个开源和闭源多模态模型。基于Llama 3.1文本模型,通过视觉适配器实现图像理解,支持128K上下文长度。经指令微调后可用于商业和研究,适用于多种视觉语言任务。使用需遵守Llama 3.2社区许可协议。

llava-onevision-qwen2-0.5b-si - 多模态AI模型实现图像、多图和视频的智能交互

GithubHuggingfaceLLaVA-OneVisionQwen2图像处理多模态开源项目模型视觉语言模型

LLaVA-OneVision是一个基于Qwen2的多模态AI模型，能够处理图像、多图和视频输入。它具有32K tokens的上下文窗口，支持英文和中文交互。该模型在AI2D、ChartQA和DocVQA等多项任务中表现优异，为视觉语言应用提供了强大的基础。LLaVA-OneVision采用LLaVA-OneVision数据集进行训练，可轻松集成到各类视觉语言项目中。

mlx-llm - 在Apple Silicon上实时运行的高级语言模型应用与工具

Apple SiliconGithubHuggingFaceLarge Language ModelsQuantizationmlx-llm开源项目

mlx-llm支持用户在Apple Silicon设备上实时运行高级语言模型（LLMs）的应用和工具。该项目支持多种预训练模型，并提供简便的安装方法。用户可以加载新版预训练权重、进行模型量化及嵌入提取。此外，mlx-llm还覆盖了多种应用场景，包括命令行聊天、LoRA或QLoRA微调及检索增强生成（RAG）等。

项目侧边栏1

项目侧边栏2

推荐项目

Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手，通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能，支持100+编程语言，与主流编辑器无缝集成，显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台，能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐，Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案，通过智能技术简化视频制作流程。无论是企业宣传还是个人分享，有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持，能够阅读和理解用户上传的文件内容，解析网页信息，并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题，Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术，为商家提供一键生成商品图和营销文案的服务，显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台，让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型，免费访问各种图像生成与AI训练工具，从Stable Diffusion等基础模型开始，轻松实现创新图像生成。体验前沿的AI技术，推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器，它将改变您观看视频的方式！SubCat结合了先进的人工智能技术，为您提供即时视频字幕翻译，无论是本地视频还是网络流媒体，让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台，利用前沿AI技术，为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图，再到文案生成，美间让创意设计更简单、更高效。

Project Cover

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具，简化了选题、文献检索至论文撰写的整个过程。通过简单设定，平台可快速生成高质量论文大纲和全文，配合图表、参考文献等一应俱全，同时提供开题报告和答辩PPT等增值服务，保障数据安全，有效提升写作效率和论文质量。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com

@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号