Depth-Anything-V2

单目深度估计新突破，高精度与快速推理并重

Depth Anything V2 深度估计计算机视觉预训练模型开源项目 Github

Depth-Anything-V2是单目深度估计领域的新进展。该模型在细节表现和鲁棒性上显著优于V1版本，并在推理速度、参数量和深度精度方面超越了基于SD的模型。项目提供四种预训练模型，适用于相对和度量深度估计，可处理图像和视频。此外，发布的DA-2K基准为深度估计研究设立了新标准。

文档

dinov2-giant - 无监督大规模视觉特征学习模型

DINOv2GithubHuggingfaceVision Transformer图像处理开源项目模型特征提取自监督学习

DINOv2-giant是一款基于Vision Transformer架构的大规模视觉模型，采用DINOv2无监督学习方法训练。该模型能够从未标注的图像中提取强大的视觉特征，将图像分割为固定大小的块序列作为输入，通过Transformer编码器处理后输出图像的隐含表示。研究人员可利用此预训练模型作为基础，添加简单的线性层即可完成各种下游视觉任务的微调，为计算机视觉领域提供了强大的基础工具。

InternImage - 突破大规模视觉基础模型性能极限

GithubInternImage图像分类大规模视觉模型开源项目目标检测语义分割

InternImage是一款采用可变形卷积技术的大规模视觉基础模型。它在ImageNet分类任务上实现90.1%的Top1准确率,创下开源模型新纪录。在COCO目标检测基准测试中,InternImage达到65.5 mAP,成为唯一突破65.0 mAP的模型。此外,该模型在涵盖分类、检测和分割等任务的16个重要视觉基准数据集上均展现出卓越性能,树立了多个领域的新标杆。

detr-resnet-50-panoptic - DETR模型：结合ResNet-50的端到端目标检测与全景分割

DETRGithubHuggingfaceTransformer开源项目模型目标检测计算机视觉语义分割

DETR-ResNet-50是一种创新的目标检测模型，融合了Transformer和卷积神经网络技术。该模型在COCO数据集上训练，支持端到端的目标检测和全景分割。通过100个对象查询机制，DETR实现了高效准确的目标识别。在COCO 2017验证集上，模型展现出优秀性能：框AP为38.8，分割AP为31.1，全景质量(PQ)达43.4。这一模型为计算机视觉任务提供了新的解决方案。

DeepSeek-VL - 高性能开源视觉语言模型多模态理解与复杂场景应用

DeepSeek-VLGithub人工智能多模态理解开源开源项目视觉语言模型

DeepSeek-VL是一个开源视觉语言模型，为实际应用场景而设计。它能处理逻辑图表、网页、公式、科学文献、自然图像等，并在复杂场景中展现智能。模型提供1.3B和7B两种参数规模，支持基础和对话应用，可用于学术研究和商业用途。DeepSeek-VL采用MIT许可证，为研究人员和开发者提供了强大的视觉语言处理工具。

CV-VAE - 兼容预训练模型的视频生成技术

CV-VAEGithubVAE兼容性开源项目潜在空间视频生成

CV-VAE是一种视频变分自编码器，专为潜在生成视频模型设计。它与预训练图像和视频模型（如SD 2.1和SVD）兼容，用于视频重建和生成。项目提供代码实现和预训练模型权重，支持视频重建和文本到视频转换。CV-VAE为视频生成技术研究提供了新的工具和方向。

DAMO-YOLO - 基于YOLO系列和嵌入包括神经网络架构搜索及轻量级算法在内的多项新技术的对象检测算法

DAMO-YOLOGithub开源项目性能优化检测模型目标检测算法更新

DAMO-YOLO, 阿里巴巴DAMO实验室的先进对象检测技术，基于YOLO系列和嵌入包括神经网络架构搜索及轻量级算法在内的多项新技术，以优化性能和效率。针对广泛行业场景，提供一站式解决方案，从训练到部署全面支持。

DenseCL - 改进密集预测任务的视觉预训练方法

DenseCLGithub密集预测对比学习开源项目自监督学习视觉预训练

DenseCL是一种自监督视觉预训练方法，通过密集对比学习提升模型在密集预测任务中的表现。该方法实现简洁，核心部分仅需10行代码，适配多种数据增强技术。实验表明，DenseCL在目标检测和语义分割任务中性能显著提升，同时保持训练效率。项目开源了预训练模型和使用指南，便于研究者在视觉任务中应用。

Vision-RWKV - 基于RWKV架构的高效视觉感知模型

GithubVision-RWKV图像处理开源项目深度学习神经网络计算机视觉

Vision-RWKV是一种基于RWKV架构的视觉感知模型。该模型可高效处理高分辨率图像，具有全局感受野，并通过大规模数据集预训练实现良好扩展性。在图像分类任务中，Vision-RWKV性能超越ViT模型；在密集预测任务中，它以更低计算量和更快速度胜过基于窗口的ViT，并与全局注意力ViT相当。Vision-RWKV展现出成为多种视觉任务中ViT替代方案的潜力。

DreamlikePhotoReal2 - 高细节增强的超现实图像生成模型

AI绘图Dreamlike PhotoRealGithubHuggingface开源项目模型稳定扩散视觉效果高细节

Dreamlike PhotoReal 2模型通过集成840K VAE进行优化，突出细节。该项目结合稳定扩散与文本转图像技术，使其有能力生成高细节和照片级逼真的图像，如乡间别墅的少女或东京街头的时尚女性。该模型专为需要更高精度图像生成的艺术与设计工作者设计，兼容diffusers库。

相关项目

推荐项目

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手，通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能，支持100+编程语言，与主流编辑器无缝集成，显著提升开发效率和代码质量。

AI写歌

Suno AI是一个革命性的AI音乐创作平台，能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐，Suno AI都是音乐爱好者和专业人士的理想选择。

有言AI

有言平台提供一站式AIGC视频创作解决方案，通过智能技术简化视频制作流程。无论是企业宣传还是个人分享，有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Kimi

Kimi AI助手提供多语言对话支持，能够阅读和理解用户上传的文件内容，解析网页信息，并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题，Kimi都能以友好、专业的方式提供帮助。

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术，为商家提供一键生成商品图和营销文案的服务，显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台，让商品第一时间被种草。

吐司

探索Tensor.Art平台的独特AI模型，免费访问各种图像生成与AI训练工具，从Stable Diffusion等基础模型开始，轻松实现创新图像生成。体验前沿的AI技术，推动个人和企业的创新发展。

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器，它将改变您观看视频的方式！SubCat结合了先进的人工智能技术，为您提供即时视频字幕翻译，无论是本地视频还是网络流媒体，让您轻松享受各种语言的内容。

美间AI

美间AI创意设计平台，利用前沿AI技术，为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图，再到文案生成，美间让创意设计更简单、更高效。

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具，简化了选题、文献检索至论文撰写的整个过程。通过简单设定，平台可快速生成高质量论文大纲和全文，配合图表、参考文献等一应俱全，同时提供开题报告和答辩PPT等增值服务，保障数据安全，有效提升写作效率和论文质量。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com