SlowFast

开源视频理解框架提供多种先进模型架构

PySlowFast 视频理解神经网络模型深度学习计算机视觉 Github 开源项目

PySlowFast是FAIR开发的开源视频理解代码库，提供高效训练的先进视频分类模型。支持SlowFast、Non-local Neural Networks、X3D和Multiscale Vision Transformers等多种架构。该框架便于快速实现和评估视频研究创新，涵盖分类、检测等任务。PySlowFast兼具高性能和轻量级特点，适用于广泛的视频理解研究。

Github

介绍相关项目

Fast-SRGAN - 基于Pixel Shuffle的SR-GAN实时超分辨率视频放大

Fast-SRGANGithubPython 3.10像素洗牌开源项目超分辨率预训练模型

Fast-SRGAN是一个开源项目，基于SR-GAN架构和Pixel Shuffle技术，旨在实现实时超分辨率视频放大。实验证明，在MacBook M1 Pro GPU上可以达到720p视频的30fps处理速度。项目提供预训练模型并支持自定义训练参数，用户可通过配置文件或命令行参数进行设置并在Tensorboard上监控训练进度。欢迎社区贡献意见和改进。

GPTFast - Hugging Face Transformers模型推理加速工具

GPTFastGithubHugging Face开源项目推理加速量化静态键值缓存

GPTFast是一个为Hugging Face Transformers模型优化推理速度的开源Python库。它集成了多种加速技术,如静态键值缓存、int4量化和推测解码,可将模型推理速度提升7.6-9倍。GPTFast支持torch.compile、int8量化、GPTQ int4量化等优化方法,通过简单的API调用即可应用于各类Hugging Face模型。该项目持续更新,未来计划引入更多先进的加速技术。

VideoProcessingFramework - GPU加速视频处理框架提供编解码和格式转换功能

GPU加速GithubNVIDIAPyNvVideoCodecVideoProcessingFramework开源项目视频处理

VideoProcessingFramework是一个开源的视频处理框架，由C++库和Python绑定组成。它利用GPU硬件加速实现高效的视频解码、编码、转码以及色彩空间和像素格式转换。该框架支持将GPU内存中的视频帧直接导出为PyTorch张量，避免了额外的数据传输。适用于Linux和Windows平台，依赖NVIDIA驱动、CUDA和FFMPEG。目前正逐步被功能类似但API更简洁的PyNvVideoCodec库取代。

FastAI.jl - Julia深度学习流程的高效简化工具

FastAI.jlGithubJulia图像分类开源项目深度学习计算机视觉

FastAI.jl是一个Julia深度学习库，旨在简化从数据处理到模型训练的全过程。它提供可重用组件，支持计算机视觉和表格数据任务，同时保持灵活定制性。该库整合了Julia生态系统中的多个包，通过高级工作流程和API，提高了深度学习项目的效率。FastAI.jl适用于各类深度学习应用，为研究人员和开发者提供了便捷的工具。

super-gradients - 开源工具库简化SOTA计算机视觉模型的训练与部署

GithubSuperGradients开源项目模型训练深度学习计算机视觉预训练模型

Super-Gradients是一个专注于计算机视觉的开源深度学习库。它提供预训练SOTA模型和易用训练工具,支持分类、分割、检测等任务。该项目集成多种训练技巧,兼容主流部署框架,可快速将模型应用于生产。Super-Gradients适用于学术研究和工业应用,是一个高效的计算机视觉开发工具。

FasterViT - 高效分层注意力的视觉transformer新突破

FasterViTGithub图像分类层级注意力机制开源项目目标检测视觉Transformer

FasterViT是一种创新的视觉transformer模型,采用分层注意力机制高效捕获短程和长程信息。在ImageNet分类任务中,FasterViT实现了精度和吞吐量的新平衡,无需额外训练数据即达到最先进水平。该项目提供多种预训练模型,适应不同计算资源和精度需求,支持任意分辨率输入,为目标检测、分割等下游任务提供灵活选择。

EFG - 高效灵活的深度学习框架支持多项计算机视觉任务

3D目标检测EFGGithub开源项目深度学习框架目标跟踪计算机视觉

EFG是一个高效、灵活且通用的深度学习框架，采用最小化设计。该框架支持2D和3D目标检测、全景分割等多种计算机视觉任务，并在Waymo和nuScenes等数据集上展现优异性能。EFG集成了多个最新研究成果，如TrajectoryFormer和ConQueR，为3D目标检测和跟踪领域提供创新解决方案。研究人员可利用EFG的项目模板探索各种研究主题。

deepface - 面部识别与属性分析Python框架

DeepFaceGithub人脸属性分析人脸识别年龄预测开源项目表情识别

deepface是一个综合多模态面部识别和属性分析的Python框架，整合了多种先进模型，如VGG-Face、FaceNet等，实现了从面部检测到验证的自动化处理流程，支持简单到复杂的面部识别任务，适用于多种应用场景。

fast-style-transfer - 快速将照片和视频转换为名画风格

GithubTensorFlow图像风格化开源项目机器学习视频风格化风格迁移

本项目利用TensorFlow技术，快速将照片和视频转换为多种名画风格。通过深度学习算法实现毫秒级风格迁移，并提供详细文档和示例，适用于研究和开发。项目采用实例归一化和感知损失优化，确保转换效果精美且实时。

FasterLivePortrait - 高效实时AI人像动画生成框架

AI换脸FasterLivePortraitGithubONNXTensorRT实时渲染开源项目

FasterLivePortrait是一个高效的实时AI人像动画生成框架。基于TensorRT优化，在RTX 3090 GPU上可实现30+ FPS的速度。支持ONNX模型转换，便于跨平台部署。主要特性包括原生gradio应用支持、多人脸同时推理和动物模型。项目提供Docker环境，支持Windows一键运行，并兼容macOS系统。该框架为开发者提供了灵活高效的实时人像动画生成功能。

相关项目

项目侧边栏1

项目侧边栏2

推荐项目

Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手，通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能，支持100+编程语言，与主流编辑器无缝集成，显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台，能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐，Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案，通过智能技术简化视频制作流程。无论是企业宣传还是个人分享，有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持，能够阅读和理解用户上传的文件内容，解析网页信息，并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题，Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术，为商家提供一键生成商品图和营销文案的服务，显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台，让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型，免费访问各种图像生成与AI训练工具，从Stable Diffusion等基础模型开始，轻松实现创新图像生成。体验前沿的AI技术，推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器，它将改变您观看视频的方式！SubCat结合了先进的人工智能技术，为您提供即时视频字幕翻译，无论是本地视频还是网络流媒体，让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台，利用前沿AI技术，为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图，再到文案生成，美间让创意设计更简单、更高效。

Project Cover

稿定AI

稿定设计是一个多功能的在线设计和创意平台，提供广泛的设计工具和资源，以满足不同用户的需求。从专业的图形设计师到普通用户，无论是进行图片处理、智能抠图、H5页面制作还是视频剪辑，稿定设计都能提供简单、高效的解决方案。该平台以其用户友好的界面和强大的功能集合，帮助用户轻松实现创意设计。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com

@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号