Project Icon

PointMamba

用于点云分析的简单状态空间模型

该项目提出了一种名为PointMamba的模型,它通过借鉴Mamba模型在自然语言处理中的成功经验,应用在点云分析中。PointMamba采用了线性复杂度算法,在有效减少计算成本的同时,提供了卓越的全局建模能力。该模型通过空间填充曲线进行点云标记,并使用非分层结构的Mamba编码器作主干网络。综合评估表明,PointMamba在多个数据集上的表现优异,显著降低了GPU内存使用和计算量,为未来的研究提供了一个简单而有效的基准。

trading-momentum-transformer - 深度学习驱动的Momentum Transformer及其在交易中的应用
GithubLSTMMomentum Transformer交易策略变点检测开源项目深度学习
Momentum Transformer和Slow Momentum with Fast Reversion模型利用深度学习和变革点检测,在波动市场中表现出众。通过多头注意力机制和可解释变量选择网络,这些模型在趋势转折点上展现很强的适应力。经过优化,模型在1995至2020年期间的表现显著提升,尤其在2015至2020年间,有效应对市场不稳定性,提高风险调整后的收益率。
VisionLLaMA - 基于LLaMA的统一视觉模型,为图像生成和理解设立新基准
GithubVisionLLaMA图像理解图像生成开源项目计算机视觉预训练模型
VisionLLaMA是一个基于LLaMA架构的统一视觉Transformer模型,专为处理2D图像而设计。该模型提供平面和金字塔两种形式,适用于广泛的视觉任务,包括图像感知和生成。通过各种预训练范式的广泛评估,VisionLLaMA在多项图像生成和理解任务中展现出卓越性能,超越了现有最先进的视觉Transformer模型,为计算机视觉领域提供了新的基准。
Mantis-8B-siglip-llama3-pretraind - 非功能性模型的实验再现及Llama3性能优化探索
GithubHuggingfaceMantis-InstructTIGER-Labllama3实验开源项目模型
llava_siglip_llama3_8b_pretrain_8192是一个用于实验再现的非功能性模型,旨在探索Llama3模型的性能改进。该项目提供了Mantis-Instruct微调版本的参考,帮助研究人员进行实验再现与分析。通过这一预训练检查点,研究人员可以了解模型的结构和潜在的优化方向。尽管该模型不适用于实际应用,但其在研究与开发中可作为有意义的基础。
4DMOS - 3D LiDAR数据中的稀疏4D卷积移动物体分割
4DMOSGithubLiDAR开源项目移动物体分割稀疏4D卷积语义KITTI
4DMOS是一个基于稀疏4D卷积的3D LiDAR数据移动物体分割项目。该方法通过MinkowskiEngine处理点云序列,提取时空特征实现移动目标识别。项目开源了预训练模型、Docker环境和使用说明,支持在SemanticKITTI数据集上应用。研究成果发表于IEEE RA-L,为自动驾驶和机器人导航提供了新的技术方案。
MMVP - 探索多模态大语言模型的视觉局限
GithubInterleaved-MoFMMVP基准测试多模态LLM开源项目视觉模式视觉能力
MMVP基准测试揭示了多模态大语言模型在视觉理解方面的局限。即使是顶尖模型也难以准确完成基本视觉定位任务。项目开发的Interleaved-MoF模型旨在改善这些问题。MMVP还提供了开放的评估工具和数据集,为多模态AI技术的发展做出了贡献。
One-2-3-45 - 2D扩散模型在3D AIGC中的创新应用
3D建模GithubHuggingFaceNeurIPS 2023One-2-3-45开源项目深度学习
One-2-3-45项目创新性地提出了一种2D扩散模型在3D AIGC中的正向操作方法,无需耗时的优化过程。项目提供详细的安装说明和多种演示方式,包括在线互动演示和完整的配置指南。通过整合Hugging Face的Gradio API,用户可以方便地进行图像预处理和3D网格重建。该项目已被NeurIPS 2023接受,并提供了详细的训练代码和数据集,促进单图像到3D模型的快速生成。
languagemodels - 轻松实现低内存大语言模型推理的Python库
GPU加速GithubLanguage ModelsPython大语言模型开源项目语义搜索
该Python库简化了大语言模型的使用,最低内存需求仅为512MB,确保所有推理在本地完成以保障数据隐私。支持GPU加速及多种模型配置,功能涵盖文本翻译、代码补全、语义搜索等,适合教育和商业用途。用户可通过简单的pip命令安装,在REPL、笔记本或脚本中使用。详见官方网站的文档与示例程序。
InferLLM - 轻量化语言模型推理框架,兼容多种模型格式和设备
GithubInferLLMllama.cpp多模型兼容开源项目模型推理高效率
InferLLM 是一个高效简洁的语言模型推理框架,源于 llama.cpp 项目。主要特点包括结构简单、高性能、易于上手,并支持多模型格式。目前兼容 CPU 和 GPU,可优化 Arm、x86、CUDA 和 riscv-vector,并支持移动设备部署。InferLLM 引入了专有 KVstorage 类型以简化缓存和管理,适合多种应用场景。最新支持的模型包括 LLama-2-7B、ChatGLM、Alpaca 等。
MiniCPM-Llama3-V-2_5 - 手机端多模态大语言模型突破性进展:8B参数达GPT-4V水平
GithubHuggingfaceMiniCPM-Llama3-VOCR能力多模态大语言模型多语言支持开源项目模型边缘设备部署
MiniCPM-Llama3-V-2_5是一款创新型多模态大语言模型,仅使用8B参数即达到GPT-4V级性能。该模型具备出色的OCR能力、可靠的行为表现和广泛的多语言支持,可高效部署于手机等边缘设备。支持30多种语言,并提供多种灵活部署方式,如llama.cpp、GGUF格式和LoRA微调。MiniCPM-Llama3-V-2_5标志着端侧多模态大语言模型的重要进展。
项目侧边栏1项目侧边栏2
推荐项目
Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手,通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能,支持100+编程语言,与主流编辑器无缝集成,显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台,能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐,Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

白日梦AI

白日梦AI提供专注于AI视频生成的多样化功能,包括文生视频、动态画面和形象生成等,帮助用户快速上手,创造专业级内容。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案,通过智能技术简化视频制作流程。无论是企业宣传还是个人分享,有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持,能够阅读和理解用户上传的文件内容,解析网页信息,并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题,Kimi都能以友好、专业的方式提供帮助。

Project Cover

讯飞绘镜

讯飞绘镜是一个支持从创意到完整视频创作的智能平台,用户可以快速生成视频素材并创作独特的音乐视频和故事。平台提供多样化的主题和精选作品,帮助用户探索创意灵感。

Project Cover

讯飞文书

讯飞文书依托讯飞星火大模型,为文书写作者提供从素材筹备到稿件撰写及审稿的全程支持。通过录音智记和以稿写稿等功能,满足事务性工作的高频需求,帮助撰稿人节省精力,提高效率,优化工作与生活。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术,为商家提供一键生成商品图和营销文案的服务,显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台,让商品第一时间被种草。

Project Cover

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具,简化了选题、文献检索至论文撰写的整个过程。通过简单设定,平台可快速生成高质量论文大纲和全文,配合图表、参考文献等一应俱全,同时提供开题报告和答辩PPT等增值服务,保障数据安全,有效提升写作效率和论文质量。

投诉举报邮箱: service@vectorlightyear.com
@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号