benchmark_VAE

统一实现常见变分自编码器并提供基准比较

pythae 变分自编码器分布式训练深度学习自动编码器 Github 开源项目

pythae库实现多种常见的变分自编码器模型，提供相同自编码神经网络架构下的基准实验和比较。用户可以用自己的数据和编码器、解码器网络训练这些模型，并集成wandb、mlflow和comet-ml等实验监控工具。最新版本支持PyTorch DDP分布式训练，提高训练速度和处理大数据集的能力。支持从HuggingFace Hub进行模型共享和加载，代码简洁高效。涵盖多种已实现模型和采样器，满足不同研究需求。

访问官网

Github

介绍相关项目

pythia-70m-deduped - 促进语言模型可解释性的研究工具

GithubHuggingfacePythia人工智能开源项目机器学习模型自然语言处理语言模型

Pythia-70m-deduped是Pythia模型套件中的一个7000万参数的语言模型，由EleutherAI开发。该模型在去重的Pile数据集上训练，提供154个训练检查点，便于研究模型在不同阶段的行为。尽管主要用于可解释性研究，Pythia-70m-deduped在下游任务上的表现也与同等规模模型相当。基于Transformer架构，这个模型为语言建模实验和分析提供了理想的研究平台。

pythia-410m-deduped - 专为语言模型可解释性研究设计的先进工具

GithubHuggingfacePythia人工智能开源项目机器学习模型自然语言处理语言模型

Pythia-410M-deduped是EleutherAI开发的语言模型系列之一,旨在推动可解释性研究。该模型在去重后的Pile数据集上训练,拥有3亿多参数,24层结构和1024维度。它提供多个训练检查点,便于研究模型行为和局限性。Pythia-410M-deduped使用Apache 2.0许可,主要面向科学研究,不适合直接部署应用。

VBench - 视频生成模型多维度质量评估套件

GithubPython包VBench基准套件开源项目视频生成模型评价

VBench项目提供一个全面的基准测试套件，专用于评估视频生成模型的多维质量。通过分层的评估维度，VBench可以细化并客观地评估视频生成质量的多个方面。套件包含详细的提示和评估方法，并提供人类偏好注释，确保结果与人类感知一致。用户可以选择对自定义视频或标准提示进行评估，以确保模型间的公平对比。

mae_st - 掩码自编码器在时空学习和视频重建中的应用

GithubMasked AutoencodersPyTorch实现开源项目时空学习视频处理预训练模型

mae_st项目是一个基于PyTorch实现的掩码自编码器时空学习框架。该项目提供预训练模型、微调和测试代码，支持在Kinetics数据集上进行训练和评估。项目特色包括交互式可视化演示，展示不同掩码率下的MAE输出效果。研究人员可借助此工具开展视频理解和重建相关研究，深入探索时空学习领域。

taef1 - 高效微型自动编码器增强FLUX.1实时预览

FLUX.1GithubHuggingfaceTAEF1实时预览开源项目模型深度学习自动编码器

TAEF1是与FLUX.1 VAE共享“latent API”的微型自动编码器，旨在提升实时生成过程的预览体验。该模型轻量化设计，可在FLUX.1-schnell管道中使用，并与PyTorch和diffusers库兼容。TAEF1支持`.safetensors`格式的权重文件，并通过预训练的AutoencoderTiny整合。加载时支持bfloat16精度及CPU顺序卸载，适合有经验的用户。通过简便的Python代码，用户可以生成关于美味纽约风格浆果芝士蛋糕的图像。

diffae - 基于扩散模型的自编码器框架实现图像生成与编辑

Diffusion AutoencodersGithub图像处理开源项目深度学习生成模型计算机视觉

diffae项目实现了基于扩散模型的自编码器框架，用于高质量图像的生成和编辑。该项目提供多个预训练模型，支持FFHQ、LSUN等数据集，实现了无条件生成、图像操作和插值等功能。项目包含使用说明、模型检查点和针对不同数据集的训练脚本，为图像生成和编辑研究提供了完整的工具链。

vit-pytorch - 通过PyTorch实现多种视觉Transformer变体

GithubPytorchVision Transformer卷积神经网络图像分类开源项目深度学习

本项目展示了如何在PyTorch中实现和使用视觉Transformer（ViT）模型，包括Simple ViT、NaViT、Distillation、Deep ViT等多种变体。利用基于Transformer架构的简单编码器，本项目在视觉分类任务中达到了先进水平。用户可以通过pip进行安装，并参考提供的代码示例进行模型加载和预测。项目还支持高级功能如知识蒸馏、变分图像尺寸训练和深度模型优化，适用于多种视觉任务场景。

sd-vae-ft-mse - 改进稳定扩散自编码器提升图像重建效果

GithubHuggingfaceStable Diffusion图像生成开源项目模型模型微调深度学习自动编码器

sd-vae-ft-mse是一款经过微调的稳定扩散自编码器，在LAION-Aesthetics和LAION-Humans数据集上训练。该模型旨在提高图像重建质量，尤其是人脸细节。相比原始模型，它在PSNR和SSIM等指标上有明显提升，能够生成更平滑的图像。该模型可作为VAE组件轻松集成到现有的diffusers工作流中，用于稳定扩散图像生成。

Parameter-Efficient-Transfer-Learning-Benchmark - 统一视觉参数高效迁移学习评测基准

GithubV-PETL Bench参数高效迁移学习基准测试开源项目模型评估计算机视觉

V-PETL Bench是一个统一的视觉参数高效迁移学习评测基准。该项目选择30个多样化数据集，涵盖图像识别、视频动作识别和密集预测任务，评估25种主流PETL算法。提供模块化代码库和完整训练资源，为计算机视觉研究提供全面评测平台。

veScale - 基于PyTorch的大规模语言模型训练框架

GithubLLM训练框架PyTorch分布式训练并行计算开源项目模型执行

veScale是一个基于PyTorch的大规模语言模型训练框架，专为简化LLM训练过程而设计。它支持零代码修改、单设备抽象和自动并行规划，实现了张量并行、序列并行和数据并行等多种策略。框架还提供自动检查点重分片和nD分布式时间线功能，大幅提升了训练效率。作为一个持续发展的项目，veScale计划在未来引入更多先进功能，为研究人员和开发者提供全面的LLM训练解决方案。

相关项目

项目侧边栏1

项目侧边栏2

推荐项目

Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手，通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能，支持100+编程语言，与主流编辑器无缝集成，显著提升开发效率和代码质量。

Project Cover

问小白

问小白是一个基于 DeepSeek R1 模型的智能对话平台，专为用户提供高效、贴心的对话体验。实时在线，支持深度思考和联网搜索。免费不限次数，帮用户写作、创作、分析和规划，各种任务随时完成！

Project Cover

白日梦AI

白日梦AI提供专注于AI视频生成的多样化功能，包括文生视频、动态画面和形象生成等，帮助用户快速上手，创造专业级内容。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案，通过智能技术简化视频制作流程。无论是企业宣传还是个人分享，有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

讯飞绘镜

讯飞绘镜是一个支持从创意到完整视频创作的智能平台，用户可以快速生成视频素材并创作独特的音乐视频和故事。平台提供多样化的主题和精选作品，帮助用户探索创意灵感。

Project Cover

讯飞文书

讯飞文书依托讯飞星火大模型，为文书写作者提供从素材筹备到稿件撰写及审稿的全程支持。通过录音智记和以稿写稿等功能，满足事务性工作的高频需求，帮助撰稿人节省精力，提高效率，优化工作与生活。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术，为商家提供一键生成商品图和营销文案的服务，显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台，让商品第一时间被种草。

Project Cover

Trae

Trae是一种自适应的集成开发环境（IDE），通过自动化和多元协作改变开发流程。利用Trae，团队能够更快速、精确地编写和部署代码，从而提高编程效率和项目交付速度。Trae具备上下文感知和代码自动完成功能，是提升开发效率的理想工具。

Project Cover

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具，简化了选题、文献检索至论文撰写的整个过程。通过简单设定，平台可快速生成高质量论文大纲和全文，配合图表、参考文献等一应俱全，同时提供开题报告和答辩PPT等增值服务，保障数据安全，有效提升写作效率和论文质量。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com

@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号