AVDC

从无动作视频学习行为的AI训练框架

AVDC是一个创新的AI训练框架，能够从无动作视频中学习行为策略。该项目支持Meta-World、iTHOR等多个环境，提供完整的代码库、预训练模型和详细文档。AVDC具有灵活的训练和推理功能，方便研究人员快速上手和复现实验结果，为计算机视觉和机器人学习领域带来新的可能性。

访问官网

文档

Human-Video-Generation - 人工智能视频生成技术的演进与应用

3D建模Github人体视频生成人工智能开源项目深度学习计算机视觉

Human-Video-Generation项目收录了2018年以来人工智能视频生成领域的重要研究成果。该项目涵盖面部重演、动作迁移和语音驱动动画等多个方向，提供了前沿论文、代码实现和演示视频。从早期的PSGAN到最新的Real3D-Portrait，项目全面展示了AI视频生成技术的快速进展，为相关领域的研究者和开发者提供了丰富的参考资源。

dvc - 提升机器学习项目可重复性和快速迭代的命令行工具

DVCGithubVS Code扩展开源项目数据版本控制机器学习版本管理

DVC是一个命令行工具和VS Code扩展，用于管理机器学习项目的数据和模型版本控制。数据存储在云端，版本信息保存在Git仓库，通过轻量级管道实现快速迭代。DVC还支持本地实验跟踪和对比，允许在无服务器的情况下分享和重现实验结果。

Awesome_Long_Form_Video_Understanding - 长视频理解研究前沿进展与资源综述

Github人工智能开源项目深度学习视频分析计算机视觉长视频理解

这是一个综合性长视频理解研究资源库,涵盖表征学习、高效建模、大语言模型等多个子领域。项目汇总了前沿研究论文、数据集和工具,对各子任务进行了系统梳理。为长视频理解研究者提供了全面的参考资源,有助于推动该领域的发展。

MotionDirector - 自定义文本到视频模型的动作生成

AI视频生成GithubMotionDirector开源项目扩散模型文本到视频运动定制

MotionDirector是一款文本到视频扩散模型定制工具,可根据视频样本学习特定动作概念并应用于视频生成。该工具支持单个或多个参考视频,能准确捕捉动作特征,实现外观和动作的同步定制。此外,MotionDirector还具备图像动画和电影镜头效果功能,为AI视频创作提供更多可能性。

ai2thor - AI智能体交互研究的高仿真仿真环境

AI2-THORGithub交互式环境人工智能开源项目机器人学习计算机视觉

AI2-THOR是一个高仿真的交互式AI研究框架。它包含200多个精细场景、2600多个家居物品和200多种交互动作,支持多类智能体和图像模态。框架具备逼真的物理交互,适用于导航和操作任务研究。同时提供丰富元数据和自定义奖励功能。AI2-THOR为体现式AI研究提供了功能全面的仿真环境。

MindVideo - 大脑活动视频重建技术取得重大突破

GithubMinD-VideofMRI开源项目神经科学脑活动视频重建

MinD-Video是一种从大脑记录重建高质量视频的新型框架。该技术利用掩蔽大脑建模、多模态对比学习和增强稳定扩散模型，从fMRI数据中学习时空信息。MinD-Video可重建任意帧率的视频，在语义分类任务中准确率达85%，结构相似性指数达0.19，较先前技术提升45%。这项研究在NeurIPS 2023获得口头报告资格，为理解人类认知过程提供了新的途径。

VNext - 高级视频实例分割框架，支持在线和离线模式

GithubIDOLInstMoveSeqFormerVNext开源项目视频实例分割

VNext是一个基于Detectron2的视频实例识别框架，提供先进的在线和离线实例分割算法及对象中心的视频分割运动模型。用户可参考官方教程进行安装、训练和评估。最新算法InstMove、IDOL和SeqFormer在国际会议上获得认可并取得优异成绩。

acezero - 基于增量学习的图像集合场景重建与姿态估计方法

ACE0GithubPyTorch场景坐标重建开源项目深度估计相机注册

该项目提出了一种基于增量学习的场景坐标重建方法，结合了RANSAC和DSAC*算法，实现了高精度的图像姿态估计。ACE0提供了丰富的实验数据和可视化工具，支持部分重建和自监督重定位等高级用例。项目代码基于PyTorch实现，并已在Ubuntu 20.04和多种GPU环境下测试。

AutoAct - 自主规划驱动的智能体学习框架

AutoActGithub人工智能大语言模型开源项目机器学习自然语言处理

AutoAct是一个创新的智能体学习框架，无需大规模标注数据或闭源模型。该框架通过自主规划合成轨迹，并自动分化子智能体群组完成任务。实验结果显示，AutoAct在多种语言模型上的表现与强基线相当或更优。这种方法为智能体学习提供了高效、可复现的新途径。

videollm-online - 流式视频实时理解与交互的先进模型

GithubVideoLLM-online大语言模型实时交互开源项目流媒体视频视频处理

VideoLLM-online是一款针对流媒体视频的在线大语言模型。该模型支持视频流实时交互，可主动更新响应，如记录活动变化和提供实时指导。项目通过创新的数据合成方法将离线注释转化为流式对话数据，并采用并行化推理技术实现高速处理，在A100 GPU上处理速度可达10-15 FPS。VideoLLM-online在在线和离线环境中均表现出色，能高效处理长达10分钟的视频，为视频理解与交互领域带来新的可能性。

相关项目

推荐项目

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手，通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能，支持100+编程语言，与主流编辑器无缝集成，显著提升开发效率和代码质量。

AI写歌

Suno AI是一个革命性的AI音乐创作平台，能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐，Suno AI都是音乐爱好者和专业人士的理想选择。

白日梦AI

白日梦AI提供专注于AI视频生成的多样化功能，包括文生视频、动态画面和形象生成等，帮助用户快速上手，创造专业级内容。

有言AI

有言平台提供一站式AIGC视频创作解决方案，通过智能技术简化视频制作流程。无论是企业宣传还是个人分享，有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Kimi

Kimi AI助手提供多语言对话支持，能够阅读和理解用户上传的文件内容，解析网页信息，并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题，Kimi都能以友好、专业的方式提供帮助。

讯飞绘镜

讯飞绘镜是一个支持从创意到完整视频创作的智能平台，用户可以快速生成视频素材并创作独特的音乐视频和故事。平台提供多样化的主题和精选作品，帮助用户探索创意灵感。

讯飞文书

讯飞文书依托讯飞星火大模型，为文书写作者提供从素材筹备到稿件撰写及审稿的全程支持。通过录音智记和以稿写稿等功能，满足事务性工作的高频需求，帮助撰稿人节省精力，提高效率，优化工作与生活。

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术，为商家提供一键生成商品图和营销文案的服务，显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台，让商品第一时间被种草。

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具，简化了选题、文献检索至论文撰写的整个过程。通过简单设定，平台可快速生成高质量论文大纲和全文，配合图表、参考文献等一应俱全，同时提供开题报告和答辩PPT等增值服务，保障数据安全，有效提升写作效率和论文质量。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com