Project Icon

UniRepLKNet

统一架构的大核卷积网络,提升多模态识别与时间序列预测精度

UniRepLKNet项目提出了一个适用于图像、音频、视频、点云和时间序列的大核卷积网络统一架构。通过提供四个设计大核卷积网络的架构指南,显著提升了多模态数据的识别性能。特别是在全球温度和风速预测等挑战性的时间序列预测任务中,UniRepLKNet表现优异,超过了现有系统。这一项目不仅重振了卷积神经网络在传统领域的表现,还展示了其在新兴领域的广泛应用潜力。

UniTS - 统一时间序列模型实现多领域任务处理
GithubUniTS多任务学习开源项目时间序列模型迁移学习零样本学习
UniTS是一种统一的时间序列模型,可处理多领域的分类、预测、插补和异常检测任务。该模型使用共享参数方法,无需任务特定模块,在38个多领域数据集上表现优异。UniTS具有零样本、少样本和提示学习能力,能适应新的数据领域和任务。其创新的统一网络主干融合了序列和变量注意力机制以及动态线性运算符,为时间序列分析提供了灵活的解决方案。
UniTR - 多模态变换器网络推动3D感知进展
3D感知BEV分割GithubUniTR多模态转换器开源项目目标检测
UniTR是一种新型统一多模态变换器网络,用于3D感知任务。它通过共享权重处理相机和激光雷达等多传感器数据,实现高效多模态融合。在nuScenes数据集上,UniTR在3D目标检测和BEV地图分割任务中均达到最新水平,且降低推理延迟。该研究为提升自动驾驶系统的感知能力提供了新思路。
UnsupervisedScalableRepresentationLearningTimeSeries - 多变量时间序列的无监督可扩展表示学习方法
GithubPyTorchUCR数据集UEA数据集开源项目无监督学习时间序列表示学习
UnsupervisedScalableRepresentationLearningTimeSeries项目提出了一种无监督可扩展表示学习方法,专门用于处理多变量时间序列数据。该方法基于三元组损失训练编码器,能够处理等长或不等长时间序列。项目提供了UCR和UEA数据集实验代码,包括迁移学习和稀疏标记实验。此外,还包含预训练模型和结果可视化工具。在多个基准数据集上,该方法展现出优秀的性能,为时间序列分析领域提供了创新解决方案。
univnet - 具有多分辨率频谱图鉴别器的神经声码器
GANGithubUnivNet开源项目神经合成器音频样本高保真波形生成
UnivNet是一种利用多分辨率频谱鉴别器的神经声码器,旨在提供高保真波形生成。本项目包括一个非官方PyTorch实现,并可与原始研究的客观评分相匹敌。它在主观评测中胜过HiFi-GAN,推理速度也比HiFi-GAN快1.5倍。项目还提供预置的训练参数和预训练模型,支持高度自定义和不同的音频数据源。
unilm - Unilm项目实现跨任务、语言和模态的大规模自监督预训练
Foundation ModelsGithubLarge-scaleMulti-modalTorchScale开源项目预训练
Unilm项目跨越100多种语言及包括语言、视觉、语音及其交互的多种模态,专注于基础模型和普适AI的研究。该项目已开发多种新型架构如DeepNet、Magneto,并通过稳定高效的训练方法增强模型的通用性和能力。此外,项目已发布关键技术如E5、BEiT-3,涵盖自然语言处理、机器翻译、文档AI及多模态AI等领域,为AI技术的前沿发展和实际应用做出了显著进展。
ULIP - 多模态预训练框架实现3D数据理解
3D理解GithubULIP多模态预训练开源项目点云分类零样本分类
ULIP是一种多模态预训练框架,集成了语言、图像和点云数据以增强3D理解能力。该框架适用于多种3D骨干网络,如Pointnet2和PointBERT等,无需增加处理延迟。ULIP-2在此基础上进行了扩展,提高了预训练的可扩展性。项目开源了预训练模型、数据集和使用指南,为3D数据分析奠定了基础。
LLM-Codec - 跨模态音频处理新方案:LLM驱动音频编解码模型
GithubLLM-CodecUniAudio 1.5大语言模型开源项目跨模态学习音频处理
LLM-Codec是一种创新音频编解码模型,将音频转换为文本空间,实现跨模态学习。基于LLM-Codec的UniAudio 1.5能通过少量示例执行多种音频任务,包括语音情感分类、音频分类和语音增强。该开源项目为少样本音频任务学习和多模态LLM研究开辟了新途径。
Uni3D - 突破性统一3D表示学习框架
3D表示GithubUni3D开源项目点云零样本分类预训练
Uni3D是一个创新的3D预训练框架,致力于大规模3D表示学习。该框架采用2D预训练模型初始化,通过端到端训练实现3D点云与图像-文本特征对齐。Uni3D凭借简洁架构和高效预训练,成功将模型规模扩展至10亿参数,在多项3D任务中取得突破性进展,展现了将2D深度学习优势迁移至3D领域的巨大潜力。
UniRef - 跨空间时间的统一视觉对象分割模型
GithubUniRef++参考对象分割开源项目深度学习目标分割视频对象分割
UniRef++是一个统一的视觉模型,可同时处理指代图像分割、少样本分割、指代视频对象分割和视频对象分割四种任务。其核心UniFusion模块能高效注入多种参考信息,不仅性能优异,还可作为SAM等基础模型的插件组件使用。该模型在多个benchmark上展现出色表现,体现了其在对象分割领域的通用性和扩展性。
Chat-UniVi - 统一视觉表示赋能大语言模型理解图像和视频
Chat-UniViGithub图像视频统一多模态大语言模型开源项目视觉理解
Chat-UniVi是一个多模态AI模型,采用统一的视觉表示方法实现图像和视频的同步理解。该模型运用动态视觉令牌技术,有效捕捉图像空间细节和视频时序关系。经过联合训练,Chat-UniVi在图像和视频理解任务中表现优异,性能超过专门设计的单一模态模型。模型支持多轮对话,能处理包含多个图像或视频的复杂场景,为视觉AI研究提供新思路。
项目侧边栏1项目侧边栏2
推荐项目
Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手,通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能,支持100+编程语言,与主流编辑器无缝集成,显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台,能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐,Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案,通过智能技术简化视频制作流程。无论是企业宣传还是个人分享,有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持,能够阅读和理解用户上传的文件内容,解析网页信息,并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题,Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术,为商家提供一键生成商品图和营销文案的服务,显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台,让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型,免费访问各种图像生成与AI训练工具,从Stable Diffusion等基础模型开始,轻松实现创新图像生成。体验前沿的AI技术,推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器,它将改变您观看视频的方式!SubCat结合了先进的人工智能技术,为您提供即时视频字幕翻译,无论是本地视频还是网络流媒体,让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台,利用前沿AI技术,为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图,再到文案生成,美间让创意设计更简单、更高效。

Project Cover

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具,简化了选题、文献检索至论文撰写的整个过程。通过简单设定,平台可快速生成高质量论文大纲和全文,配合图表、参考文献等一应俱全,同时提供开题报告和答辩PPT等增值服务,保障数据安全,有效提升写作效率和论文质量。

投诉举报邮箱: service@vectorlightyear.com
@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号