Project Icon

sparkling-water

Apache Spark与H2O-3的机器学习集成框架

Sparkling Water是一个开源项目,将H2O-3机器学习引擎与Apache Spark集成。它提供了Spark和H2O数据结构间的转换工具,支持使用Spark数据作为H2O算法输入,并提供构建机器学习应用的基础模块。项目还包含PySparkling接口,支持从PySpark直接使用。Sparkling Water支持Spark Shell集成、Spark Submit应用、以及通过Maven包使用。它提供多种后端部署模式,适应不同使用场景。项目致力于简化大规模数据处理和机器学习任务的开发流程,在Spark环境中优化机器学习解决方案的开发和部署过程。

fondant - 旨在协同构建和共享数据集的开源数据框架
FondantGithub共享操作开源项目数据处理数据框架数据集构建
Fondant是一个开源数据框架,旨在协同构建和共享数据集。它允许用户无需移动源数据即可进行数据初始化、处理和加载,支持可插拔的工作流、自定义组件以及版本追踪与数据浏览。Fondant适用于跨云端环境(如Google Cloud的Vertex和AWS的Sagemaker),使数据处理简单、可扩展,是生产环境中处理和共享数据集的理想选择。
beam - 统一批处理和流处理的数据并行处理模型
Apache BeamGithub分布式计算开源项目批处理数据处理流处理
Apache Beam是一个统一的数据处理模型,用于定义批处理和流处理的并行数据处理管道。它提供多语言SDK构建管道,并可在Apache Flink、Spark等分布式处理后端上执行。Beam支持Java、Python和Go等语言,为各类开发者提供灵活的开发环境。该项目采用统一模型处理批处理和流处理数据,支持多种编程语言,并可在多个分布式处理平台上运行。它为不同类型的开发者提供了灵活的工具,简化了大规模数据处理的复杂性。
superset - 现代化企业级数据可视化和探索平台
GithubSuperset商业智能开源软件开源项目数据分析数据可视化
Superset是一个现代化的企业级数据探索和可视化平台。它提供无代码图表构建界面、SQL编辑器、轻量级语义层和广泛的数据库支持。平台具备丰富的可视化类型、可配置缓存、可扩展安全角色和身份验证,以及用于定制的API。其云原生架构支持大规模部署,可作为替代或增强专有商业智能工具的选择。
LakeSail - 统一批处理、流处理和AI工作负载的开源框架
AI工作负载AI工具Sail大数据处理开源框架性能优化
LakeSail是一个统一批处理、流处理和AI工作负载的开源框架。基于Rust开发,相比Spark,它提供4倍处理速度和94%硬件成本节省,无需代码修改即可迁移。该平台具有高互操作性和可观察性,为开发者提供高性能、安全和并发的编程环境,适合大数据和AI应用开发。
shardingsphere - 分布式SQL引擎实现数据库灵活扩展
Apache ShardingSphereGithub分布式SQL开源项目数据分片数据加密数据库扩展
Apache ShardingSphere是开源分布式SQL引擎,支持数据分片、加密和扩展。基于Database Plus理念,它通过标准化层将现有数据库转换为分布式系统。核心概念包括连接、增强和可插拔,能灵活适配各类数据库协议和存储。作为Apache顶级项目,ShardingSphere已被逾10,000个GitHub项目采用,为数据库管理提供全面解决方案。
deeplake - 面向 AI 的数据库,由针对深度学习应用程序优化的存储格式提供支持
AI数据库Deep LakeGithub向量存储开源项目数据版本控制深度学习
Deep Lake是一个为深度学习设计的AI数据库,提供多云和本地数据存储方案,支持动态数据类型如嵌入向量、音频、视频等。它通过即时可视化、高级查询和向量搜索功能,以及与LangChain、Weights & Biases等工具的无缝整合,优化了企业级LLM产品的部署和数据管理。该平台适用于各种规模的数据,支持无服务器架构。
awesome-mlops - 多种自动化机器学习、数据处理、模型部署工具集合
GithubMLOps开源项目数据处理数据管理模型服务自动化机器学习
发掘和运用顶尖MLOps工具:该项目汇集了多种自动化机器学习、数据处理、模型部署工具,供数据科学家和机器学习工程师选择使用,以简化机器学习流程,优化生产活动。
awesome-scala - Scala生态系统资源大全,库、框架与工具
GitHubGithubScala开发工具开源项目数据库
这是一个社区维护的Scala生态系统资源列表,汇集了众多实用库、框架和软件。涵盖范围广泛,从数据库访问、Web开发、测试等常用工具,到人工智能、大数据处理等前沿技术的Scala实现。该项目旨在为Scala开发者提供一个便捷的资源参考,帮助他们快速找到适合项目需求的工具,提高开发效率。
sqlflow - 机器学习与SQL编程的先进集成
GithubKubernetesSQLFlowTensorFlowXGBoost开源项目机器学习热门
SQLFlow 是一款编译器,它将SQL程序编译成在Kubernetes上运行的工作流,支持包括机器学习训练、预测、模型评估等在内的AI作业。此平台支持MySQL、TiDB、Hive等多种数据库系统,以及TensorFlow、Keras、XGBoost等机器学习工具包。SQLFlow 致力于通过SQL增强机器学习模型开发,让拥有SQL技能的工程师也能轻松开发高级机器学习应用。
LakeSoul - 在云存储上为 BI 和 AI 应用程序提供快速数据摄取、并发更新和增量数据分析的Lakehouse框架
ACID事务GithubLakeSoul元数据管理增量更新多计算引擎支持开源项目
LakeSoul是一个云原生的Lakehouse框架,提供灵活高效的Upsert操作、模式演化和统一的流与批处理。支持包括Spark、Flink、Presto和PyTorch在内的多种计算引擎,以及如HDFS和S3的存储系统。具备高写入吞吐量和优化的数据读取性能,支持并发更新和增量插入。拥有自动压缩、数据清理和权限隔离等功能。该项目由DMetaSoul公司创建,并捐赠给Linux Foundation AI & Data作为沙盒项目。
项目侧边栏1项目侧边栏2
推荐项目
Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手,通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能,支持100+编程语言,与主流编辑器无缝集成,显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台,能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐,Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案,通过智能技术简化视频制作流程。无论是企业宣传还是个人分享,有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持,能够阅读和理解用户上传的文件内容,解析网页信息,并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题,Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术,为商家提供一键生成商品图和营销文案的服务,显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台,让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型,免费访问各种图像生成与AI训练工具,从Stable Diffusion等基础模型开始,轻松实现创新图像生成。体验前沿的AI技术,推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器,它将改变您观看视频的方式!SubCat结合了先进的人工智能技术,为您提供即时视频字幕翻译,无论是本地视频还是网络流媒体,让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台,利用前沿AI技术,为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图,再到文案生成,美间让创意设计更简单、更高效。

Project Cover

稿定AI

稿定设计 是一个多功能的在线设计和创意平台,提供广泛的设计工具和资源,以满足不同用户的需求。从专业的图形设计师到普通用户,无论是进行图片处理、智能抠图、H5页面制作还是视频剪辑,稿定设计都能提供简单、高效的解决方案。该平台以其用户友好的界面和强大的功能集合,帮助用户轻松实现创意设计。

投诉举报邮箱: service@vectorlightyear.com
@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号