Project Icon

AttentionDeepMIL

深度多实例学习的注意力机制算法实现

AttentionDeepMIL是一个开源的深度多实例学习算法项目,基于PyTorch框架实现。它在LeNet-5模型基础上创新性地添加了注意力机制的MIL池化层,适用于图像分类等多实例学习任务。该项目提供完整的实验环境,包括MNIST-BAGS数据集处理、模型架构和训练脚本,支持CPU和GPU运行。此外,AttentionDeepMIL还展示了在医学图像分析领域的应用潜力,包括对乳腺癌和结肠癌组织病理学数据集的实验支持。

sebotnet33ts_256.a1h_in1k - 结合ResNet与自注意力的高性能图像分类模型
BotNetGithubHuggingfaceImageNet-1ktimm图像分类开源项目模型深度学习
sebotnet33ts_256.a1h_in1k是一个融合ResNet架构和BotNet设计的图像分类模型,整合了Squeeze-and-Excitation通道注意力机制。该模型在ImageNet-1k数据集上训练,通过timm库实现。它采用LAMB优化器、强化的dropout和随机深度技术,以及余弦学习率调度。模型提供灵活的配置选项,包括块/阶段布局和注意力层等,适用于图像分类和特征提取任务。其平衡了性能和训练效率,为计算机视觉领域提供了实用的解决方案。
parti-pytorch - Google Parti模型的PyTorch实现 基于注意力的文本到图像生成
GithubPartiPytorch开源项目文本到图像生成深度学习计算机视觉
本项目是Google Parti模型的PyTorch实现,Parti是一种基于纯注意力机制的文本到图像生成神经网络。项目包含ViT VQGan VAE训练代码和视觉Transformer的优化,提高了训练效率。实现了简便的安装和使用流程,支持条件生成和分类器引导。这为研究人员和开发者提供了探索和改进文本到图像生成技术的平台。
Awesome-Transformer-in-Medical-Imaging - Transformer在医学图像分析中的应用进展综述
GithubVision Transformer医学图像分析图像分割图像分类开源项目深度学习
本项目整理了Transformer模型在医学图像分析中的最新研究进展。内容涵盖图像分类、分割、重建、合成等多个领域,系统地归纳和分类了相关论文。项目提供了医学图像分析中Transformer应用的分类体系,详细的参考文献,以及开源代码库链接,为研究人员提供了全面的学习和实践资源。
open-metric-learning - 开源的PyTorch度量学习框架 支持多模态嵌入训练
GithubPyTorchopen-metric-learning嵌入向量度量学习开源项目检索系统
open-metric-learning是一个基于PyTorch的开源度量学习框架,用于训练和验证高质量嵌入模型。它提供端到端流水线、实用案例和预训练模型库,支持图像和文本等多种模态。该框架具有统一的检索结果处理和评估方法,适用于人脸识别、商品搜索等嵌入学习任务。已被多家知名公司和机构采用,是一个功能丰富、易于上手的度量学习工具。
awesome-multi-task-learning - 精选多任务学习资源集合 涵盖数据集代码库和研究论文
Github多任务学习开源项目机器学习神经网络自然语言处理计算机视觉
此项目汇集了多任务学习(MTL)领域的精选资源,包含数据集、代码库和研究论文。涉及计算机视觉、自然语言处理、强化学习等多个领域的MTL基准测试和数据集。另外还收录了MTL架构、优化方法和任务关系学习等相关研究。对于研究人员和工程师深入学习和应用MTL技术而言,这是一个极具参考价值的资源库。
computer-vision-in-action - 计算机视觉实战指南:涵盖基础理论及前沿技术
CharmveGithubL0CVMaiwei AI Lab开源项目机器学习计算机视觉
本项目提供全面且前沿的计算机视觉学习资源,涵盖深度学习基础、神经网络模型及其优化方法。核心内容包括卷积神经网络、循环神经网络以及现代技术如Transformer、强化学习和迁移学习。通过实战项目和详细的代码实现,用户可以学习图像分类、目标检测、语义分割和3D重建等应用。此外,项目提供在线运行的notebook,简化本地调试过程。
gluon-cv - 计算机视觉领域的深度学习模型工具包,支持PyTorch和MXNet框架
GithubGluonCV图像分类对象检测开源项目深度学习计算机视觉
GluonCV是一个面向工程师、研究人员和学生的计算机视觉深度学习工具包,支持快速原型设计。其主要功能包括可复现SOTA结果的训练脚本、对PyTorch和MXNet框架的支持、大量预训练模型,以及简化实现的API设计和社区支持。用户还可以通过AutoGluon执行图像分类和目标检测任务。
ml-mdm - 开源框架实现高分辨率文本到图像生成模型
GithubMatryoshka Diffusion Models开源项目文本到图像生成深度学习神经网络模型高分辨率图像合成
ml_mdm是一个Python开源项目,实现了Matryoshka扩散模型技术用于文本到图像生成。该框架支持训练单个像素空间模型生成高达1024x1024分辨率的图像,开源了U-Net和嵌套U-Net的实现。项目提供预训练模型、Web演示和CC12M数据集上的训练教程,为高分辨率图像和视频合成提供完整解决方案。
awesome-transformers-in-medical-imaging - Transformer在医学影像分析中的最新应用进展
GithubTransformer分割医学图像分析开源项目深度学习计算机视觉
本项目汇总了Transformer在医学影像分析领域的最新研究成果,包括图像分割、分类、重建等多个任务。资源库按时间顺序整理相关论文和开源实现,为研究人员提供全面参考。内容定期更新,旨在促进Transformer在医学影像分析中的应用与发展。
T-GATE - 研究了在文本到图像扩散模型中的时序注意机制
GithubTGATE图像生成开源项目扩散模型自注意力跨注意力
TGATE项目研究了在文本到图像扩散模型中的时序注意机制。研究发现,交叉注意输出在几步推理后可以收敛到固定点,通过采用缓存和重用这些输出的方式,无需额外训练,即可提升现有模型的运行速度10%–50%。TGATE易于集成,提供快速图像生成,适用于CNN U-Net、Transformer和Consistency Model。
项目侧边栏1项目侧边栏2
推荐项目
Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手,通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能,支持100+编程语言,与主流编辑器无缝集成,显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台,能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐,Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案,通过智能技术简化视频制作流程。无论是企业宣传还是个人分享,有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持,能够阅读和理解用户上传的文件内容,解析网页信息,并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题,Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术,为商家提供一键生成商品图和营销文案的服务,显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台,让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型,免费访问各种图像生成与AI训练工具,从Stable Diffusion等基础模型开始,轻松实现创新图像生成。体验前沿的AI技术,推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器,它将改变您观看视频的方式!SubCat结合了先进的人工智能技术,为您提供即时视频字幕翻译,无论是本地视频还是网络流媒体,让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台,利用前沿AI技术,为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图,再到文案生成,美间让创意设计更简单、更高效。

Project Cover

稿定AI

稿定设计 是一个多功能的在线设计和创意平台,提供广泛的设计工具和资源,以满足不同用户的需求。从专业的图形设计师到普通用户,无论是进行图片处理、智能抠图、H5页面制作还是视频剪辑,稿定设计都能提供简单、高效的解决方案。该平台以其用户友好的界面和强大的功能集合,帮助用户轻松实现创意设计。

投诉举报邮箱: service@vectorlightyear.com
@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号