Awesome-Multimodal-LLM

大语言模型（LLM）在多模态学习中的最新研究趋势

LLM 多模态学习神经网络模型微调开源 Github 开源项目

本页面介绍大语言模型（LLM）在多模态学习中的最新研究趋势，包括文本、视觉（图像和视频）、音频等多种模态。重点讨论如LLaMA、Alpaca和Bloom等开源且适合研究的LLM骨干模型及其学习方法，如全量微调、参数有效微调、上下文学习等。同时列举了具体的多模态LLM模型实例，如OpenFlamingo和MiniGPT-4，以及评估方法，如MultiInstruct和POPE，提供科研人员了解和研究LLM引导多模态学习的资源。

Github

Huggingface

介绍相关项目

LLM-FineTuning-Large-Language-Models - LLM微调实践与技术应用指南

Fine-tuningGithubLLMPEFTQLoRA开源项目量化

本项目介绍了如何使用ORPO、QLoRA、GPTQ等技术对大型语言模型（LLM）进行微调，包含具体实例和代码片段。项目还提供与这些技术相关的YouTube视频链接，提供全面的学习资料。此外，项目还包含各类实用工具和技术说明，帮助用户更好地理解和应用这些前沿技术。适合有一定编程基础的研究人员和开发者参考。

Awesome-LLM-Tabular - 大型语言模型与表格数据处理研究进展

GithubLLM人工智能开源项目机器学习自然语言处理表格数据

Awesome-LLM-Tabular汇集了大型语言模型在表格数据处理领域的研究论文，涵盖数据表示、问答和推理等方面。项目提供论文详细信息、相关工作坊和博客文章，为研究人员提供全面的参考资源，助力快速了解该领域的最新进展。

awesome-llm-security - 发现LLM安全工具和资源，了解大语言模型的安全挑战

Black-box attackDefenseGithubLLM SecurityToolsWhite-box attack开源项目

收集了与LLM安全相关的顶级工具、文档和项目，包括白盒攻击、黑盒攻击、后门攻击和防御策略的研究论文，以及安全测试和保障工具。提供丰富资源，助力深入了解和应对大语言模型的安全问题，为研究人员和开发者提供实用指导。

awesome-llm-json - 大语言模型生成结构化数据的资源

GithubJSONLLMPydanticfunction callingstructured outputs开源项目

本资源列表提供了丰富的资源，用于使用大语言模型（LLMs）生成JSON或其他结构化输出。内容包括术语解释、托管模型、本地模型、Python库、博客文章、视频和Jupyter笔记本，介绍了函数调用（Function Calling）、指导生成（Guided Generation）和工具使用等多种技术和工具，探索高效生成和处理结构化数据的方法。

awesome-japanese-llm - 日本语言学习模型的最新动态与综合信息

GitHub管理Github事前学乒参数大小开源项目日本語LLM模型开发

awesome-japanese-llm汇集全面的日语预训练语言模型和指令调优信息，包括性能评估基准和各类型模型开发动态。提供详尽的技术文档、开源许可信息，是日语技术开发者和研究人员的重要资源。

open-llms - 开放源代码大型语言模型及其商业应用全景解析

Apache 2.0GithubLarge Language Models商业使用许可开源开源项目模型发布

Open-llms 项目展示了众多采用开源许可证的大型语言模型（LLMs），支持商业应用，涵盖如T5、GPT-NeoX、YaLM等模型。每款模型设有详细说明及许可信息，鼓励社区交流与贡献，是机器学习研究和应用的重要资源库。

LLMGA - 用于精确图像生成和编辑的多模态大语言模型

ECCV2024GithubLLMGA图像生成多模态大模型开源项目

LLMGA基于多模态大语言模型，提供图像生成与编辑解决方案。结合Stable Diffusion和详细语言生成提示，项目提升了上下文理解并减少生成过程中的噪音，增强图像内容的精度。LLMGA支持文本到图像（T2I）、补画、扩画及指令编辑，适用于Logo设计、海报制作和故事绘本生成，支持中英文指令。广泛的模型和数据集选择满足不同需求，是理想的图像生成和编辑助手。

awesome-llm-agents - LLM代理资源一览，涵盖框架、应用与平台

Awesome LLM agentsGithubHaystackLangchainLlama IndexVisualGPT开源项目

本列表收录了优秀的LLM代理资源，涵盖开源框架、实用应用、平台及重要论文和讲座。关键工具包括Langchain、Llama Index、Haystack等，旨在为开发者提供高效的NLP解决方案。用户还可以提交和建议更多资源，支持社区开发。

VLM_survey - 用于视觉任务的 AWESOME 视觉语言模型集合

GithubVision-Language Models开源项目数据集知识蒸馏视觉识别任务预训练方法

本页面详尽介绍了视觉语言模型(VLM)在视觉识别任务中的应用和发展。内容涵盖VLM的起源、常用架构、预训练目标、主流数据集及不同的预训练方式、迁移学习和知识蒸馏方法，并针对这些方法进行了详细的基准测试和分析。页面还讨论了未来研究的挑战和方向，让用户掌握VLM技术在图像分类、对象检测和语义分割等任务中的最新应用进展。

PointLLM - 多模态大语言模型理解点云数据的突破性进展

3D点云GithubPointLLM多模态大语言模型开源项目计算机视觉

PointLLM是一个创新的多模态大语言模型，可理解物体的彩色点云数据。该模型能够感知物体类型、几何结构和外观，而不受深度模糊、遮挡或视角依赖等问题影响。项目团队收集了包含660K简单和70K复杂点云-文本指令对的数据集，并采用两阶段训练策略。为评估模型的感知和泛化能力，研究人员建立了生成式3D物体分类和3D物体描述两个基准，并使用三种评估方法进行测试。

相关项目

项目侧边栏1

项目侧边栏2

推荐项目

Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手，通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能，支持100+编程语言，与主流编辑器无缝集成，显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台，能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐，Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案，通过智能技术简化视频制作流程。无论是企业宣传还是个人分享，有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持，能够阅读和理解用户上传的文件内容，解析网页信息，并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题，Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术，为商家提供一键生成商品图和营销文案的服务，显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台，让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型，免费访问各种图像生成与AI训练工具，从Stable Diffusion等基础模型开始，轻松实现创新图像生成。体验前沿的AI技术，推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器，它将改变您观看视频的方式！SubCat结合了先进的人工智能技术，为您提供即时视频字幕翻译，无论是本地视频还是网络流媒体，让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台，利用前沿AI技术，为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图，再到文案生成，美间让创意设计更简单、更高效。

Project Cover

稿定AI

稿定设计是一个多功能的在线设计和创意平台，提供广泛的设计工具和资源，以满足不同用户的需求。从专业的图形设计师到普通用户，无论是进行图片处理、智能抠图、H5页面制作还是视频剪辑，稿定设计都能提供简单、高效的解决方案。该平台以其用户友好的界面和强大的功能集合，帮助用户轻松实现创意设计。

使用协议隐私政策广告服务

投诉举报邮箱: service@vectorlightyear.com

@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号