HAT

激活更多像素的图像超分辨率转换器

图像超分辨率 HAT Transformer 深度学习计算机视觉 Github 开源项目

HAT是一个开源的图像超分辨率项目，采用混合注意力转换器架构。它在Set5、Urban100等数据集上达到了最先进水平，参数量为20.8M。HAT还提供了小型模型版本和用于真实世界超分辨率的GAN模型，能够处理各种图像重建任务。

Github

论文

介绍相关项目

stable-cascade - 基于高压缩率架构的新一代AI图像生成模型

GithubHuggingfaceStable Cascade人工智能图像生成开源项目机器学习模型深度学习

Stable Cascade采用三阶段级联架构设计，实现了42倍的图像压缩率，可将1024x1024图像压缩至24x24尺寸。模型在保持图像重建质量的同时，显著提升了处理效率，支持LoRA、ControlNet等主流扩展功能。当前发布了两个Stage C版本，分别为10亿和36亿参数规模。

pyHGT - 大规模异构和动态图的图神经网络解决方案

Deep Graph LibraryGithubHeterogeneous Graph TransformerOAG DataSetWWW 2020pytorch_geometric开源项目

Heterogeneous Graph Transformer (HGT) 是一种基于 Pytorch Geometric 的图神经网络架构，设计用于处理大规模异构和动态图。项目主要包含核心模型代码、数据接口、训练和验证脚本。用户可以使用预处理好的 OAG 数据集或其他异构图进行训练。关键功能包括异构图卷积层、并行采样和深度图模型训练。安装简单，只需通过 pip 安装相关依赖即可运行。

Depth-Anything-V2-Small - 先进高效的开源深度估计工具

Depth-Anything-V2GithubHuggingface图像处理开源项目机器学习模型深度估计计算机视觉

Depth-Anything-V2-Small是一个开源的单目深度估计模型，基于大规模合成和真实图像数据训练。相比前代产品，该模型提供更精细的深度细节和更强的鲁棒性。它比同类基于稳定扩散的模型运行速度快10倍，且更加轻量化。模型支持高效的图像深度推断，可用于各种计算机视觉应用场景。

GiT - 通用视觉Transformer模型实现多任务统一

GiTGithub多任务学习开源项目视觉Transformer计算机视觉语言接口

GiT是一种通用视觉Transformer模型,采用单一ViT架构处理多种视觉任务。该模型设计简洁,无需额外视觉编码器和适配器。通过统一语言接口,GiT实现了从目标检测到图像描述等多任务能力。在多任务训练中,GiT展现出任务间协同效应,性能超越单任务训练且无负迁移。GiT在零样本和少样本测试中表现优异,并随模型规模和数据量增加而持续提升性能。

stable-cascade-prior - 探索高效图像生成与文本到图像转换模型

GithubHuggingfaceStable Cascade图像压缩开源项目文本生成图像模型模型效率生成模型

Stable Cascade Prior基于Würstchen架构，是一种高效的图像生成模型。其显著优势在于快速的推理速度和低昂的训练成本。依靠卓越的图像压缩能力，该模型可以将1024x1024图像压缩至24x24而不丢失细节，非常适合需要高效生成的场景。支持包括finetuning在内的多种扩展，并在提示对齐和美学质量上表现出色，适用于研究、教育、艺术设计等领域。访问其GitHub仓库，了解更多功能与使用案例。

distrifuser - 高效分布式并行推理助力高分辨率图像生成

DistriFusionGPU加速Githubdiffusion模型并行推理开源项目高分辨率

DistriFusion是一种用于高分辨率扩散模型的分布式并行推理算法。该方法无需额外训练，通过多GPU协同工作加速推理过程，同时保持图像质量。其创新的补丁交互技术解决了传统方法的碎片化问题，在高分辨率图像生成任务中显著提升了性能。该项目已在CVPR 2024被评为亮点工作，并开源了相关代码。

happy-transformer - 便捷调优与推理NLP Transformer模型

GithubHappy TransformerNLP开源项目文本分类文本生成词预测

Happy Transformer提供简单的方法来调优和推理NLP Transformer模型，主要功能包括DeepSpeed训练、Apple的MPS训练及推理、WandB训练追踪以及直接推送模型到Hugging Face的Model Hub。支持的任务涵盖文本生成、文本分类、单词预测、问答、文本到文本、下一句预测和标记分类。

swin-base-patch4-window7-224-in22k - 基于shifted windows的分层视觉Transformer图像处理模型

GithubHuggingfaceSwin Transformer图像分类图像识别开源项目模型深度学习计算机视觉

Swin Transformer是一个在ImageNet-21k数据集上预训练的视觉模型，通过shifted windows机制实现局部特征提取，降低计算复杂度。模型采用分层特征图构建和局部注意力计算方式，适用于图像分类和密集识别任务，计算复杂度与输入图像大小呈线性关系

ImgUpscaler - AI在线图像放大和增强工具

AI图像放大AI工具免费使用在线工具批量处理高清增强

ImgUpscaler是一款先进的AI图像放大工具，能将图片分辨率提升400%，最高支持16000x16000像素。支持批量处理JPG、PNG等格式，保证放大后的图像质量。工具还具备重新构想功能，可根据提示词生成修改版图像。提供免费额度和付费计划，适用于动漫、卡通、人像等多种图片优化场景。

相关项目

推荐项目

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手，通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能，支持100+编程语言，与主流编辑器无缝集成，显著提升开发效率和代码质量。

AI写歌

Suno AI是一个革命性的AI音乐创作平台，能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐，Suno AI都是音乐爱好者和专业人士的理想选择。

有言AI

有言平台提供一站式AIGC视频创作解决方案，通过智能技术简化视频制作流程。无论是企业宣传还是个人分享，有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Kimi

Kimi AI助手提供多语言对话支持，能够阅读和理解用户上传的文件内容，解析网页信息，并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题，Kimi都能以友好、专业的方式提供帮助。

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术，为商家提供一键生成商品图和营销文案的服务，显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台，让商品第一时间被种草。

吐司

探索Tensor.Art平台的独特AI模型，免费访问各种图像生成与AI训练工具，从Stable Diffusion等基础模型开始，轻松实现创新图像生成。体验前沿的AI技术，推动个人和企业的创新发展。

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器，它将改变您观看视频的方式！SubCat结合了先进的人工智能技术，为您提供即时视频字幕翻译，无论是本地视频还是网络流媒体，让您轻松享受各种语言的内容。

美间AI

美间AI创意设计平台，利用前沿AI技术，为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图，再到文案生成，美间让创意设计更简单、更高效。

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具，简化了选题、文献检索至论文撰写的整个过程。通过简单设定，平台可快速生成高质量论文大纲和全文，配合图表、参考文献等一应俱全，同时提供开题报告和答辩PPT等增值服务，保障数据安全，有效提升写作效率和论文质量。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com