Project Icon

SparseTrack

多目标跟踪新方法:基于伪深度的场景分解技术

SparseTrack提出了一种新的多目标跟踪方法,通过伪深度估计和深度级联匹配策略来分解密集场景。这种方法在MOT17和MOT20基准测试中表现出色,仅使用IoU匹配就达到了与复杂算法相当的性能。SparseTrack为解决拥挤场景中的多目标跟踪问题提供了新的思路,展示了简单方法在复杂任务中的潜力。

flowmap - 基于梯度下降的相机姿态、内参和深度优化技术
FlowMapGithub光流开源项目深度学习相机姿态估计计算机视觉
FlowMap是一种创新的相机姿态、内参和深度估计技术,通过梯度下降优化获得高质量结果。该开源项目提供完整代码实现、预训练模型和评估数据集,支持多种数据集并提供丰富的实验配置。FlowMap在多个基准测试中表现出色,为计算机视觉和3D重建研究提供了有力支持。
lotus-depth-g-v1-0 - 新一代视觉深度预测与密集估计模型
GithubHuggingfaceLotus密集预测开源项目扩散模型模型深度预测视觉基础模型
Lotus是一个开源的视觉基础模型,主要用于图像深度估计和密集预测任务。该项目提供完整的模型实现和在线演示平台,可应用于3D场景重建、深度感知等计算机视觉领域。模型采用Apache-2.0许可协议发布,支持学术研究和商业应用开发。
3D-deformable-attention - 3D可变形注意力技术提升自动驾驶物体检测精度
3D目标检测BEVFormerDFA3DGithub开源项目深度估计特征提升
3D-deformable-attention项目提出了3D可变形注意力(DFA3D)操作符,用于2D到3D特征提升。该方法首先利用深度估计将2D特征扩展到3D空间,再通过DFA3D聚合3D特征。这种方法缓解了深度歧义问题,并支持逐层特征细化。在多个基准测试中,DFA3D平均提高1.41 mAP,高质量深度信息下最高提升15.1 mAP。研究结果显示DFA3D在自动驾驶3D目标检测等任务中具有较大潜力。
SparseTransformer - PyTorch库实现可变长度稀疏Transformer用于3D点云处理
3D识别GithubPyTorchSpTr开源项目点云处理稀疏变压器
SparseTransformer (SpTr)是一个PyTorch库,专门用于实现可变长度稀疏Transformer,主要应用于3D点云数据处理。该库具有快速、内存高效和易用的特点,支持窗口Transformer等技术。SpTr已在多个计算机视觉研究中应用,包括LiDAR的球形Transformer和3D点云分割的分层Transformer。它能够轻松集成到基于Transformer的3D点云网络中,仅需少量修改即可使用。
sparseml - 神经网络优化工具,简化代码实现高效稀疏模型
GithubSparseML开源项目推理优化模型优化神经网络稀疏化
SparseML是开源模型压缩工具包,使用剪枝、量化和蒸馏算法优化推理稀疏模型。可导出到ONNX,并与DeepSparse结合,在CPU上实现GPU级性能。适用于稀疏迁移学习和从零开始的稀疏化,兼容主流NLP和CV模型,如BERT、YOLOv5和ResNet-50,实现推理速度和模型大小的显著优化。
objectsdf_plus - 物体组合式神经隐式表面重建技术的进阶版本
3D重建GithubObjectSDF++开源项目深度学习神经隐式表面计算机视觉
ObjectSDF++是物体组合式神经隐式表面重建技术的改进版本。该技术通过引入遮挡感知的不透明度渲染公式和物体区分正则化项,提高了实例掩码监督的利用效率,从而在场景和物体层面实现更精确的表面重建。项目提供了适用于Replica和ScanNet数据集的训练和评估代码,为3D场景理解和重建研究提供了新的工具。
multispectral-object-detection - 多光谱图像融合的高效目标检测方法
GithubTransformerYOLOv5多光谱目标检测开源项目计算机视觉跨模态融合
该项目提出了Cross-Modality Fusion Transformer (CFT)多光谱目标检测方法,利用Transformer架构融合RGB和热红外图像信息。CFT在FLIR、LLVIP等数据集上取得了优秀的检测结果,尤其在夜间场景表现突出。这为多光谱目标检测提供了一种新的解决方案。
MagicDrive - 多样化3D几何控制的街景生成框架
3D几何控制GithubMagicDrive开源项目扩散模型街景生成计算机视觉
MagicDrive是一个创新街景生成框架,提供多样化的3D几何控制,包括相机姿态、道路地图和3D边界框。通过结合文本描述、定制编码策略和跨视图注意力模块,实现了多相机视角的一致性。该框架能生成高保真街景图像和视频,精确捕捉3D几何特征和场景细节,有助于提升BEV分割和3D物体检测等任务的性能。
U-2-Net - 深度嵌套U结构助力显著对象精准检测
GithubU2-Net人像分割图像背景移除开源项目模型训练视觉应用
U-2-Net,一项荣获2020年模式识别最佳论文奖的创新技术,通过其深度嵌套U结构显著提升对象检测精准度。此技术广泛适用于图像处理、视频分析、背景移除及人像生成等领域,并提供丰富的开发资源助力应用的快速迭代。
S3Gaussian - 自监督3D高斯模型提升自动驾驶动态场景解析
3D高斯GithubS3Gaussian场景分解开源项目无人驾驶自监督学习
S3Gaussian使用3D高斯模型进行自监督动态街景解析,增强了自动驾驶的场景分解和渲染效果。该项目采用多分辨率hexplane编码器和多头高斯解码器,将4D网格编码为特征平面,并解码为4D高斯模型。无需额外注释即可优化模型。最新代码和评估已发布,详细介绍了环境配置、数据准备、训练和可视化过程。
项目侧边栏1项目侧边栏2
推荐项目
Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手,通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能,支持100+编程语言,与主流编辑器无缝集成,显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台,能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐,Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案,通过智能技术简化视频制作流程。无论是企业宣传还是个人分享,有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持,能够阅读和理解用户上传的文件内容,解析网页信息,并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题,Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术,为商家提供一键生成商品图和营销文案的服务,显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台,让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型,免费访问各种图像生成与AI训练工具,从Stable Diffusion等基础模型开始,轻松实现创新图像生成。体验前沿的AI技术,推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器,它将改变您观看视频的方式!SubCat结合了先进的人工智能技术,为您提供即时视频字幕翻译,无论是本地视频还是网络流媒体,让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台,利用前沿AI技术,为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图,再到文案生成,美间让创意设计更简单、更高效。

Project Cover

稿定AI

稿定设计 是一个多功能的在线设计和创意平台,提供广泛的设计工具和资源,以满足不同用户的需求。从专业的图形设计师到普通用户,无论是进行图片处理、智能抠图、H5页面制作还是视频剪辑,稿定设计都能提供简单、高效的解决方案。该平台以其用户友好的界面和强大的功能集合,帮助用户轻松实现创意设计。

投诉举报邮箱: service@vectorlightyear.com
@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号