Project Icon

visionscript

抽象编程语言,用于快速执行计算机视觉任务

VisionScript是一个基于Python的编程语言,专门用于快速执行目标检测、分类和分割等常见计算机视觉任务。其简洁的语法允许用户通过少量代码完成复杂的视觉操作,并支持在交互式网络笔记本中运行。VisionScript兼容多个知名模型,包括CLIP、YOLOv8和BLIP,适合新手上手。无论是执行零样本分类,还是在照片中替换特定对象,VisionScript均能提供高效解决方案。

humanscript - 自然语言命令的动态解析与执行
GithubOpenAIhumanscript代码生成大语言模型开源项目自然语言脚本
humanscript使用大型语言模型解析并执行自然语言编写的脚本命令。无需预定义语法,支持OpenAI GPT-3.5和GPT-4以及本地开源模型如Llama 2等多种LLM后端。用户命令会自动转化为代码并即时执行,首次运行生成的代码会被缓存,后续执行更快。该工具可在Docker沙箱环境或通过Homebrew等方式安装,确保安全使用。
CV - 全面的计算机视觉深度学习模型集合
Github图像分类开源项目深度学习目标检测计算机视觉语义分割
这个项目收集了多个计算机视觉领域的深度学习模型,包括图像分类、目标检测、语义分割和生成模型。项目为每个模型提供论文链接、详细解析和代码实现,涵盖从AlexNet到YOLO系列等经典算法。这是一个面向研究人员和开发者的综合性学习资源,有助于理解和应用先进的计算机视觉技术。
Vision-RWKV - 基于RWKV架构的高效视觉感知模型
GithubVision-RWKV图像处理开源项目深度学习神经网络计算机视觉
Vision-RWKV是一种基于RWKV架构的视觉感知模型。该模型可高效处理高分辨率图像,具有全局感受野,并通过大规模数据集预训练实现良好扩展性。在图像分类任务中,Vision-RWKV性能超越ViT模型;在密集预测任务中,它以更低计算量和更快速度胜过基于窗口的ViT,并与全局注意力ViT相当。Vision-RWKV展现出成为多种视觉任务中ViT替代方案的潜力。
VisionLLM - 面向视觉任务的开放式多模态大语言模型
GithubVisionLLM人工智能多模态大语言模型开源项目视觉语言任务计算机视觉
VisionLLM 系列是一种多模态大语言模型,专注于视觉相关任务。该模型利用大语言模型作为开放式解码器,支持数百种视觉语言任务,包括视觉理解、感知和生成。VisionLLM v2 进一步提升了模型的通用性,扩展了其在多模态应用场景中的能力,推动了计算机视觉与自然语言处理的融合。
viser - Python 交互式 3D 可视化库 支持 Web 客户端和丰富 API
3D可视化GUI构建GithubPython库viser场景交互开源项目
viser 是一个 Python 交互式 3D 可视化库,提供丰富 API 用于 3D 图元可视化。它包含 GUI 构建组件,支持场景交互和相机控制。基于 Web 的客户端便于远程使用。viser 支持点云、高斯散射和 SMPLX 可视化。该项目借鉴多个开源工具,采用 React 等现代 Web 技术构建客户端。
ML-DL-scripts - 机器学习和深度学习的全面脚本库 从分类到部署的解决方案
GitHubGithubPython开源项目数据科学机器学习深度学习
ML-DL-scripts是一个综合性的机器学习和深度学习Python脚本库。这个项目涵盖了从分类、回归到聚类和时间序列分析等多个领域,同时提供了PyTorch、Fastai和Keras等主流深度学习框架的使用示例。项目还包括图像处理、自然语言处理和异常检测等实际应用案例,以及基于Docker的模型部署配置。这个代码库为数据科学研究和机器学习应用提供了丰富的技术参考资源。
VisionVision - 优化图像合成质量,通过模型融合实现多元风格
AI绘图GithubHuggingfaceStable DiffusionVisionVision动漫开源项目模型真实感
该项目结合realistic-vision-v1.3和ZootVisionBeta模型,优化图像生成的质量与细节,尤其是在合成和眼部细节方面。VisionVision支持多种风格,包括写实与艺术表现,适用于动漫与真实感艺术创作。项目使用SuperMerger技术,提供丰富样例与提示,帮助用户生成优质图像。
openscene - 零样本3D场景理解和任务执行工具
3D场景理解CVPR 2023GithubOpenScene开源项目语义分割零样本
OpenScene是一个实时交互的3D场景理解工具,支持使用开放词汇进行查询。用户可输入任意短语,系统会自动高亮相应区域。支持多种数据集和预处理选项,可执行零样本3D语义分割、稀有物体搜索和基于图像的3D物体检测。其特点包括无需GPU运行、支持多视角特征融合和模型蒸馏。所有代码和数据集均可在GitHub获取,适用于广泛的研究和开发应用。
yolov5 - 视觉AI对象检测和图像分类技术
YOLOv5,一款由Ultralytics开源的视觉AI模型,支持对象检测、图像分割与分类。提供全面文档及社区支持,适合各级用户使用,并定期更新以集成最新技术。
llavavision - 利用多模态AI实现视觉描述的简易网络应用
GithubLLaVaVisionWeb应用llama.cpp图像描述开源项目机器学习模型
LLaVaVision是一个基于llama.cpp和llava后端的“Be My Eyes”简易网络应用,通过ChatGPT和Copilot快速开发。应用了SkunkworksAI BakLLaVA-1模型进行视觉描述,并通过Web Speech API朗读文本。适用于拥有约5 GB RAM/VRAM的设备,提供详细的服务器搭建和启动指南,支持GPU和CPU运行模式。灵感源自Fuzzy-Search/realtime-bakllava,旨在提供便捷的视觉辅助功能。
项目侧边栏1项目侧边栏2
推荐项目
Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手,通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能,支持100+编程语言,与主流编辑器无缝集成,显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台,能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐,Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

白日梦AI

白日梦AI提供专注于AI视频生成的多样化功能,包括文生视频、动态画面和形象生成等,帮助用户快速上手,创造专业级内容。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案,通过智能技术简化视频制作流程。无论是企业宣传还是个人分享,有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持,能够阅读和理解用户上传的文件内容,解析网页信息,并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题,Kimi都能以友好、专业的方式提供帮助。

Project Cover

讯飞绘镜

讯飞绘镜是一个支持从创意到完整视频创作的智能平台,用户可以快速生成视频素材并创作独特的音乐视频和故事。平台提供多样化的主题和精选作品,帮助用户探索创意灵感。

Project Cover

讯飞文书

讯飞文书依托讯飞星火大模型,为文书写作者提供从素材筹备到稿件撰写及审稿的全程支持。通过录音智记和以稿写稿等功能,满足事务性工作的高频需求,帮助撰稿人节省精力,提高效率,优化工作与生活。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术,为商家提供一键生成商品图和营销文案的服务,显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台,让商品第一时间被种草。

Project Cover

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具,简化了选题、文献检索至论文撰写的整个过程。通过简单设定,平台可快速生成高质量论文大纲和全文,配合图表、参考文献等一应俱全,同时提供开题报告和答辩PPT等增值服务,保障数据安全,有效提升写作效率和论文质量。

投诉举报邮箱: service@vectorlightyear.com
@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号