ComfyUI_VLM_nodes
ComfyUI_VLM_nodes项目简化了多种生成式视觉语言模型(VLM)如LLaVa、AudioLDM-2和Chat Musician的集成,支持Windows、Linux和macOS平台。项目提供多功能节点,实现结构化输出、自动提示生成、图像转音乐等功能。还包含了如UForm-Gen2 Qwen节点和moondream2模型节点,适用于快速图像字幕生成和视觉问答。该工具显著提高了研究与开发效率,适合广泛的图像处理任务,专为研究和非商业用途设计。