AdelaiDepth

开源单目深度预测工具箱推进3D场景重建研究

AdelaiDepth 单目深度预测 3D场景重建计算机视觉深度学习 Github 开源项目

AdelaiDepth是开源单目深度预测工具箱，整合3D场景形状重建等多种算法。项目聚焦单一图像深度学习和3D场景恢复，相关成果入围CVPR'21最佳论文。通过提供训练代码和数据集，AdelaiDepth为计算机视觉领域研究提供了重要资源。

Github

论文

介绍相关项目

AdelaiDet - 多任务实例级识别开源工具包

AdelaiDetGithub实例分割开源项目深度学习目标检测计算机视觉

AdelaiDet是基于Detectron2的开源工具包,实现了FCOS、BlendMask、MEInst、ABCNet等多种实例级识别算法。它为目标检测、实例分割、场景文本识别等任务提供高性能解决方案,包含预训练模型和训练接口,便于研究和开发。

UniDepth - 单目深度测量的通用算法，兼容多种数据集

CVPR 2024GithubHugging FacePython包UniDepth开源项目深度估计

UniDepth项目提出了通用的单目深度测量方法，支持多个数据集如NYUv2、KITTI和SUN-RGBD。通过训练模型，该方法可直接从RGB图像生成深度和内参预测，无需预先深度数据。其高精度、低延迟的推理能力在多个基准测试中表现优秀。支持多种输入形状和比例，适合机器人视觉和自动驾驶等应用。

Depth-Anything - 大规模无标注数据驱动的强大单目深度估计模型

Depth AnythingGithub人工智能图像处理开源项目深度估计计算机视觉

Depth Anything是一款基于大规模数据训练的单目深度估计模型。它利用150万标注图像和6200万无标注图像进行训练,提供小型、中型和大型三种预训练模型。该模型不仅支持相对深度和度量深度估计,还可用于ControlNet深度控制、场景理解和视频深度可视化等任务。在多个基准数据集上,Depth Anything的性能超越了此前最佳的MiDaS模型,展现出优异的鲁棒性和准确性。

monodepth2 - 基于自监督学习的单目深度估计实现

GithubMonodepth2PyTorch开源项目深度估计自监督学习计算机视觉

本项目提供了PyTorch实现的代码，用于训练和测试深度估计模型。代码采用自监督学习方法，支持单目和立体图像的深度预测。提供多种预训练模型和自定义数据集，兼容不同的图像分辨率。适用于研究和非商业用途，包含详细的设置指南、训练和评估说明。用户可通过此项目高效开发和优化深度估计模型。

sc_depth_pl - 通过自我监督学习实现视频中的单目深度估计

ARNGithubSC-Depthmonocular depthpytorchself-supervised learning开源项目

SC-Depth项目提供了SC-DepthV1, V2和V3版本的PyTorch Lightning实现，专注于从视频中进行自我监督的单目深度估计。SC-DepthV1引入了几何一致性损失和自发现蒙板，提高了深度预测的准确性。SC-DepthV2通过引入自动矫正网络（ARN）解决了手持相机视频中大相对旋转的问题。SC-DepthV3利用外部预训练的深度估计网络，在动态场景中显著提升了单目深度估计的准确性。该项目提供了详细的安装指南、数据集组织和训练流程，支持多种数据集和自定义数据的训练。了解更多关于SC-Depth的详细信息以及其在多个挑战性数据集上的评估结果。

Depth-Anything-V2 - 单目深度估计新突破，高精度与快速推理并重

Depth Anything V2Github开源项目深度估计计算机视觉预训练模型

Depth-Anything-V2是单目深度估计领域的新进展。该模型在细节表现和鲁棒性上显著优于V1版本，并在推理速度、参数量和深度精度方面超越了基于SD的模型。项目提供四种预训练模型，适用于相对和度量深度估计，可处理图像和视频。此外，发布的DA-2K基准为深度估计研究设立了新标准。

depthai - 深度学习与视频录制的多功能演示应用

DepthAIDockerGithubLuxonisPython依赖安装开源项目

这个项目提供了一个多功能的深度学习API演示程序，支持加载多种神经网络、创建管道和录制视频等功能。附有详细的安装指南和多种使用案例（包括QT GUI界面和命令行模式），用户能够轻松上手和测试DepthAI的功能。项目还支持多种AI模型，并可通过Docker运行，适用于开发者和机器学习爱好者。

Real3D - 基于真实图像的大规模3D重建模型

3D重建GithubReal3D开源项目深度学习自监督学习计算机视觉

Real3D是一种创新的大规模3D重建模型系统，首次实现了使用单视图真实图像进行训练。该系统采用自训练框架，结合3D/多视图合成数据和单视图真实图像，并引入两种无监督损失函数，实现像素和语义层面的模型监督。在包含真实和合成数据、域内和域外形状的四种评估场景中，Real3D均显著优于现有方法。

Far3D - 突破远距离3D目标检测的新框架，提升环视感知能力

3D目标检测Far3DGithub开源项目深度学习自动驾驶计算机视觉

这是一个创新的稀疏查询框架，专注于解决远距离3D目标检测问题。该项目通过2D目标先验生成自适应3D查询，并利用透视感知聚合模块处理多视角和多尺度特征。还开发了范围调制的3D去噪技术，有效解决了查询错误传播和收敛问题。在Argoverse 2和nuScenes数据集上，展现出优异的性能，推动了环视3D目标检测技术的发展。

dreamscene4d - 从单目视频生成动态多目标3D场景的突破性技术

3D场景生成DreamScene4DGithub多目标跟踪开源项目视频处理计算机视觉

DreamScene4D是一种从单目视频生成动态多目标3D场景的开源技术。它采用3D高斯和形变优化方法，能处理不同长度的视频和多个目标。项目提供自动化和分阶段优化脚本，支持处理有遮挡和无遮挡的视频。DreamScene4D在复杂场景和长视频序列处理方面表现优异，为计算机视觉和图形学研究提供了新思路。

相关项目

推荐项目

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手，通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能，支持100+编程语言，与主流编辑器无缝集成，显著提升开发效率和代码质量。

AI写歌

Suno AI是一个革命性的AI音乐创作平台，能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐，Suno AI都是音乐爱好者和专业人士的理想选择。

有言AI

有言平台提供一站式AIGC视频创作解决方案，通过智能技术简化视频制作流程。无论是企业宣传还是个人分享，有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Kimi

Kimi AI助手提供多语言对话支持，能够阅读和理解用户上传的文件内容，解析网页信息，并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题，Kimi都能以友好、专业的方式提供帮助。

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术，为商家提供一键生成商品图和营销文案的服务，显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台，让商品第一时间被种草。

吐司

探索Tensor.Art平台的独特AI模型，免费访问各种图像生成与AI训练工具，从Stable Diffusion等基础模型开始，轻松实现创新图像生成。体验前沿的AI技术，推动个人和企业的创新发展。

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器，它将改变您观看视频的方式！SubCat结合了先进的人工智能技术，为您提供即时视频字幕翻译，无论是本地视频还是网络流媒体，让您轻松享受各种语言的内容。

美间AI

美间AI创意设计平台，利用前沿AI技术，为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图，再到文案生成，美间让创意设计更简单、更高效。

稿定AI

稿定设计是一个多功能的在线设计和创意平台，提供广泛的设计工具和资源，以满足不同用户的需求。从专业的图形设计师到普通用户，无论是进行图片处理、智能抠图、H5页面制作还是视频剪辑，稿定设计都能提供简单、高效的解决方案。该平台以其用户友好的界面和强大的功能集合，帮助用户轻松实现创意设计。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com