#图像嵌入
相关项目
clip-retrieval
clip-retrieval 提供一个建立语义搜索系统的强大工具,使得用户能够迅速实现图像和文本的嵌入计算及索引构建。该项目能在20小时内处理超过1亿的图文嵌入,支持远程查询、数据过滤以及简洁的前端用户界面,适用于学术研究和商业应用。
clip-as-service
CLIP-as-service是一款以神经网络为基础,专注于提供高效且易于扩展的图像和文本嵌入服务。其面向大规模数据处理,支持多种并发请求,适合集成到各种神经网络搜索框架中。这个服务通过简洁的API和自动负载均衡,让用户无需深厚技术背景即可便捷使用。同时,该服务能与Jina和DocArray等神经搜索生态系统紧密结合,助力开发者快速部署多模态和跨模态应用。
Gemini
Gemini项目实现了一个可处理文本、音频、图像和视频输入的多模态变换器,具备特殊解码功能来生成图像。其架构类似于Fuyu,但扩展至多种模态,并通过直接将图像嵌入输入变换器来处理。组件Codi也采用条件生成策略,初步实现图像嵌入,后续将集成音频和视频嵌入。