i-Code

打造集成可组合的多模态人工智能框架

Project i-Code 多模态人工智能基础模型文档智能视觉问答 Github 开源项目

i-Code是一个致力于多模态人工智能研究的开源项目。它提供了多个版本的多模态基础模型，包括i-Code V1、V2和V3(CoDi)，以及i-Code Studio框架。项目还涉及多模态文档智能和基于知识的视觉问答技术。i-Code为AI领域提供了集成视觉、语言和语音的多模态工具，促进了人工智能的跨领域发展。

访问官网

Github

介绍相关项目

Scoopika - 开源平台助力多模态AI应用开发

AI代理AI工具API工具数据提取知识库语音交互

Scoopika开源平台为开发者提供多模态AI应用构建工具。支持LLM和AI代理，适用于AI聊天界面和数据提取。平台具备实时交互能力，内置流式处理、内存加密和错误恢复。集成语音交互、知识库和视觉处理，API简洁，类型安全，提升开发效率和可靠性。

ai-devices - 智能语音助手现支持多语音模型和视觉推断技术

AI设备GPT-4GithubOpenAI开源项目语音输入镜像处理

本项目是AI驱动的智能语音助手，集成多种AI模型和服务。支持语音输入、文字转语音、图片处理及功能调用，提供高级视觉推断，保障用户获得全面的智能交互体验。主要支持最新的gpt-4o和gemini-1.5-flash-latest视觉模型，满足现代科技需求。

DeepSeek-Coder-V2-Instruct - 高性能开源MoE代码语言模型支持338种编程语言

AI编程DeepSeek-Coder-V2GithubHuggingface大型语言模型开源模型开源项目模型混合专家模型

DeepSeek-Coder-V2是一个开源的MoE代码语言模型，通过6万亿token的额外预训练，大幅提升了编码和数学推理能力。该模型支持338种编程语言，具有128K的上下文长度，在多项标准基准测试中表现优异。DeepSeek-Coder-V2不仅在代码相关任务中媲美GPT4-Turbo，还在某些方面超越了多个知名闭源模型。

CosyVoice - 提升智能语音体验的创新技术和多语言支持

CosyVoiceGithub在线演示多语言支持开源项目语音模型跨语言推理

CosyVoice是一个先进的多语言语音生成技术，致力于提升语音交互的流畅性和实时反馈。该项目支持广泛的语言，提供灵活的下载和安装选项，包括跨语言和指令式语音合成，满足不同用户需求。通过预训练模型和定制选项，用户可以实现从简短语句到完整语音输出的自然转换，优化整体交互体验。

Generative-AI - 多模态图像合成与编辑技术及其分类

Data ModalityGenerative AIGithubMultimodal Image Synthesis and EditingTaxonomyVisual AIGC开源项目

该项目附有一篇综述论文，全面分析了多模态图像合成与编辑（MISE）和视觉AIGC的发展情况，并根据数据模态和模型架构进行了分类研究。通过此项研究，科研人员和技术开发者可以深入了解神经渲染、扩散方法、自回归方法及对抗生成网络（GAN）等不同技术及其应用，帮助更好地掌握多模态图像合成技术的前沿进展与实际应用。

99AI - 集成多模态AI服务的开源Web应用，支持对话、绘画、音乐和视频创作

99AIAI应用Github人工智能多模态对话模型开源项目

99AI是一个开源的AI Web应用项目，提供易部署、低门槛的集成化人工智能服务。项目支持智能对话、多模态模型、应用广场、联网搜索等功能，并集成了AI绘画、音乐和视频创作能力。已编译为整合包，支持多种快速部署方式，便于个人和企业用户搭建AI服务平台。

uform - 用于内容理解和生成的袖珍型多模态 AI

GithubONNXUForm多模态AI嵌入模型开源项目生成模型

UForm是一个全面的多模态AI库，涵盖了从文本到图像，乃至视频剪辑的生成与理解等多种功能。支持多种语言，包含轻量级生成模型及高效的预训练变压模型，能够广泛应用于从服务器到智能手机等不同设备。主要优势包括快速的搜索性能、简易的模型部署过程及卓越的多语言应用能力，适用于快速嵌入、语义搜索、图像标题生成和视觉问答等多种场景。

LanguageBind_Image - 基于语言实现多模态预训练绑定

GithubHuggingfaceICLRLanguageBind多模态开源项目数据集模型视频语言预训练

LanguageBind是一种创新的多模态预训练方法,通过语言将视频、音频、深度图像等不同模态绑定。该项目提出了包含1000万条多模态数据的VIDAL-10M数据集,并在多个模态任务上实现了领先性能。LanguageBind无需中间模态即可扩展到检测等任务,开源了全部模态预处理代码和API接口,为多模态AI研究提供了有力工具。

llava-onevision-qwen2-72b-ov-sft - 基于Qwen2的多模态AI模型支持图像和视频交互

GithubHuggingfaceLLaVA-OneVisionQwen2图像识别多模态模型开源项目模型视频处理

LLaVA-OneVision是基于Qwen2的多模态AI模型，支持图像、多图和视频交互。模型在专用数据集上训练，具有32K tokens上下文窗口，提供0.5B、7B和72B三种规模。支持英语和中文，可处理单图、多图和视频输入。项目开源了代码、在线演示和论文，为AI研究和开发提供了实用工具。

CLIP-ViT-B-32-256x256-DataComp-s34B-b86K - 基于DataComp训练的CLIP多模态视觉语言模型

CLIPDataComp-1BGithubHuggingfaceViT-B-32图像分类开源项目机器学习模型

CLIP ViT-B/32是一个在DataComp-1B数据集上训练的视觉语言模型，通过OpenCLIP框架实现。模型在ImageNet-1k分类任务中实现72.7%零样本准确率，支持图像分类、跨模态检索等研究任务。该开源项目为计算机视觉研究提供了重要的实验基础

相关项目

项目侧边栏1

项目侧边栏2

推荐项目

Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手，通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能，支持100+编程语言，与主流编辑器无缝集成，显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台，能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐，Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案，通过智能技术简化视频制作流程。无论是企业宣传还是个人分享，有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持，能够阅读和理解用户上传的文件内容，解析网页信息，并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题，Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术，为商家提供一键生成商品图和营销文案的服务，显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台，让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型，免费访问各种图像生成与AI训练工具，从Stable Diffusion等基础模型开始，轻松实现创新图像生成。体验前沿的AI技术，推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器，它将改变您观看视频的方式！SubCat结合了先进的人工智能技术，为您提供即时视频字幕翻译，无论是本地视频还是网络流媒体，让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台，利用前沿AI技术，为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图，再到文案生成，美间让创意设计更简单、更高效。

Project Cover

稿定AI

稿定设计是一个多功能的在线设计和创意平台，提供广泛的设计工具和资源，以满足不同用户的需求。从专业的图形设计师到普通用户，无论是进行图片处理、智能抠图、H5页面制作还是视频剪辑，稿定设计都能提供简单、高效的解决方案。该平台以其用户友好的界面和强大的功能集合，帮助用户轻松实现创意设计。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com

@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号