mobilenetv4_conv_aa_large.e230_r448_in12k_ft_in1k

高效图像分类与特征提取模型支持移动设备应用

MobileNetV4 ImageNet Github 开源项目图像分类 timm Huggingface 预训练模型模型

MobileNet-V4图像分类模型经过ImageNet-12k预训练和ImageNet-1k精细调整，优化了参数和图像处理能力。该模型适用于移动设备，并支持特征提取和图像嵌入。凭借出色的Top-1准确率和参数效率，它在同类模型中表现突出，提供快速准确的图像识别能力。

文档

nsfw_image_detection - 基于ViT的NSFW图像检测模型

GithubHugging FaceHuggingfaceNSFWVision Transformer内容审核图像分类开源项目模型

这是一个基于Vision Transformer (ViT)的NSFW图像分类模型。经过80,000张多样化图像训练，模型能有效区分正常和不适当内容。采用224x224像素分辨率，16批量大小和5e-5学习率，评估准确率达98%。该模型主要用于内容安全和审核，但仅限于NSFW图像分类。

llava-v1.6-34b-hf - 图像与文本交互的多模态AI模型

GithubHuggingfaceLLaVa-NeXTNous-Hermes-2-Yi-34B光学字符识别多模态聊天机器人开源项目模型视觉指令微调

LLaVa-NeXT模型结合大规模语言模型与视觉编码器，通过提高图像分辨率和优化数据集，增强了OCR和常识推理能力，适用于多模态对话应用场景。支持图像字幕生成和视觉问答，提供双语功能与商业许可保障。

Florence-2-large - 多任务视觉AI的统一解决方案

Florence-2GithubHuggingface人工智能图像处理多任务学习开源项目模型计算机视觉

Florence-2是一个由微软开发的视觉基础模型，能够处理多种视觉和视觉-语言任务。该模型通过解释简单的文本提示，可以执行图像描述、目标检测和分割等任务。Florence-2基于FLD-5B数据集进行训练，在零样本和微调场景下均表现优异。模型提供不同规模的版本，支持多种视觉任务，为研究人员和开发者提供了一个versatile的视觉AI工具。

tiny-dnn - 轻量级C++14深度学习库，适用于嵌入式系统和物联网设备

C++14Githubtiny-dnn嵌入式系统开源项目深度学习物联网设备

tiny-dnn是一个为计算资源有限的嵌入式系统和物联网设备设计的C++14深度学习库。该库无需GPU，通过TBB线程和SSE/AVX向量化实现了高效性能，在13分钟内达到了98.8%的MNIST准确率。其便携的头文件形式使其易于集成，支持多种网络层类型、激活函数、损失函数和优化算法。tiny-dnn还能导入Caffe模型，适合学习和构建神经网络应用。

ViTamin - 推动计算机视觉进入新时代的可扩展视觉语言模型

GithubViTamin图像处理开源项目深度学习视觉语言模型计算机视觉

ViTamin是一系列可扩展的视觉语言模型,在图像分类、开放词汇检测和分割等任务上取得突破。以436M参数量在DataComp-1B数据集训练,实现82.9%的ImageNet零样本准确率。在7个开放词汇分割基准测试中创新纪录,并提升大型多模态模型能力。获timm和OpenCLIP官方支持,提供简单接口。ViTamin为计算机视觉领域带来新的可能性。

nomic-embed-vision-v1 - 共享文本空间的先进视觉嵌入模型

GithubHuggingfaceTransformersnomic-embed-vision-v1图像嵌入多模态开源项目模型视觉模型

nomic-embed-vision-v1是一款先进的视觉嵌入模型，与nomic-embed-text-v1共享嵌入空间。在ImageNet零样本和Datacomp基准测试中，该模型表现优异，超越OpenAI CLIP和Jina CLIP等同类产品。支持多模态检索功能，适用于文本到图像检索等应用场景。开发者可通过Nomic嵌入API或Transformers库便捷地集成该模型，实现图像嵌入生成。

timesformer-base-finetuned-k600 - 采用空间时间注意力的视频分类技术，提升视频理解能力

GithubHuggingfaceKinetics-600TimeSformer开源项目模型深度学习空间时间注意力视频分类

TimeSformer模型运用空间时间注意力机制进行视频分类，能够识别Kinetics-600中的600种标签。该工具旨在提升视频理解的准确性，提供简便的视觉分析能力。

Efficient-Computing - 华为诺亚方舟实验室开发的AI模型优化技术集合

GithubHuawei Noah's Ark Lab开源项目模型压缩深度学习神经网络高效计算

Efficient-Computing项目旨在提高AI模型的计算效率和性能。这个由华为诺亚方舟实验室开发的高效计算方法集合包含多个子项目，涵盖了模型压缩、二值神经网络、知识蒸馏、网络剪枝、模型量化、自监督学习、训练加速、目标检测和低层视觉等领域的技术。该项目为AI研究和开发提供了多样化的工具和资源。

cogvlm2-llama3-chat-19B - 支持8K内容长度和高分辨率图像的开源多模态AI模型

CogVLM2GithubHuggingface人工智能图像理解对话模型开源项目模型视觉语言模型

CogVLM2是基于Meta-Llama-3-8B-Instruct的开源多模态AI模型，支持8K内容长度和1344*1344图像分辨率。该模型在TextVQA、DocVQA等多项基准测试中表现优异，具备图像理解和对话能力。CogVLM2提供英文和中英双语版本，在开源模型中表现突出，部分任务性能可与非开源模型媲美。

TNN - 轻量级、高效能、多平台支持的开源深度学习框架

GithubTNN人工智能开源项目性能优化模型转换跨平台

TNN，腾讯优图实验室开源的神经网络推理框架，提供针对移动设备和X86/NV GPUs的高效性能优化。该框架已被QQ、微视等多款应用使用，并支持各大平台包括TensorFlow、Pytorch、MxNet。

推荐项目

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手，通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能，支持100+编程语言，与主流编辑器无缝集成，显著提升开发效率和代码质量。

AI写歌

Suno AI是一个革命性的AI音乐创作平台，能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐，Suno AI都是音乐爱好者和专业人士的理想选择。

有言AI

有言平台提供一站式AIGC视频创作解决方案，通过智能技术简化视频制作流程。无论是企业宣传还是个人分享，有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Kimi

Kimi AI助手提供多语言对话支持，能够阅读和理解用户上传的文件内容，解析网页信息，并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题，Kimi都能以友好、专业的方式提供帮助。

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术，为商家提供一键生成商品图和营销文案的服务，显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台，让商品第一时间被种草。

吐司

探索Tensor.Art平台的独特AI模型，免费访问各种图像生成与AI训练工具，从Stable Diffusion等基础模型开始，轻松实现创新图像生成。体验前沿的AI技术，推动个人和企业的创新发展。

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器，它将改变您观看视频的方式！SubCat结合了先进的人工智能技术，为您提供即时视频字幕翻译，无论是本地视频还是网络流媒体，让您轻松享受各种语言的内容。

美间AI

美间AI创意设计平台，利用前沿AI技术，为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图，再到文案生成，美间让创意设计更简单、更高效。

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具，简化了选题、文献检索至论文撰写的整个过程。通过简单设定，平台可快速生成高质量论文大纲和全文，配合图表、参考文献等一应俱全，同时提供开题报告和答辩PPT等增值服务，保障数据安全，有效提升写作效率和论文质量。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com