Project Icon

arrow

高效内存分析引擎 加速大数据处理

Apache Arrow 是一个开源的内存分析开发平台,旨在提高大数据系统的数据处理和传输速度。它提供高效的列式内存格式、IPC格式和Flight RPC协议,并支持多种编程语言。Arrow 的核心技术包括高性能的数据结构、跨语言兼容性和零拷贝数据共享,为现代数据分析应用提供了强大的基础架构支持。

ytsaurus - 开源分布式大数据存储与处理系统
GithubMapReduceNoSQLYTsaurus分布式存储大数据平台开源项目
YTsaurus是一个开源的分布式大数据系统,集成MapReduce模型、分布式文件系统和NoSQL键值数据库。该系统具有多租户架构、高可靠性和强大的扩展能力,可支持高达100万CPU核心和数千GPU,处理EB级数据。YTsaurus提供友好的用户界面,并集成ClickHouse和Apache Spark,为数据分析和ETL工作流程提供全面支持。
awesome-streaming - 全面汇总实时数据流处理框架与资源
Github分布式系统实时处理开源项目数据流流式处理
本项目汇集了实时数据流处理领域的优质资源,涵盖流处理框架、应用、库和工具等。包含Apache Flink、Spark Streaming等知名开源项目,以及IoT和机器学习等领域的专业解决方案。为开发者提供全面参考,便于选择合适的流处理技术。
hop - 开源数据和元数据编排平台
Apache HopGithubJava开源软件开源项目数据处理数据编排平台
Apache Hop是一个开源的数据和元数据编排平台,致力于简化数据处理任务。该平台提供直观界面和丰富功能,包括数据转换、工作流编排和元数据管理。Hop支持多种数据源和插件,适用于数据集成和ETL场景。项目由活跃的社区维护,持续进行开发和改进。
airflow - 可编程的工作流自动化平台
Apache AirflowDAGGithubPython工作流开源项目调度
Apache Airflow是一个开源的工作流自动化平台,支持以Python代码定义工作流。它采用有向无环图(DAG)结构组织任务,提供了可视化界面和命令行工具来管理和监控工作流。Airflow具有动态生成管道、灵活扩展和处理复杂依赖关系的能力,适用于各类数据处理和批处理任务。该平台简化了工作流的版本控制、测试和协作,特别适合处理相对稳定的长期运行工作流。
petastorm - 开源数据访问库,支持单机或分布式训练和评估深度学习模型,直接从Apache Parquet格式数据集中读取数据
Apache ParquetGithubPetastorm分布式训练开源项目机器学习框架深度学习
Petastorm是一个开源数据访问库,支持单机或分布式训练和评估深度学习模型,直接从Apache Parquet格式数据集中读取数据。该库兼容Tensorflow、PyTorch和PySpark等主流Python机器学习框架,也可用于纯Python代码。Petastorm支持多种数据压缩格式,提供方便的API用于数据生成和读取,并支持列选择、并行读取、行过滤等功能。用户可以轻松在单机或Spark集群上生成数据集,是构建高效机器学习管道的理想工具。
parseable - 云原生日志分析平台 专注性能和资源效率
GithubParseable云原生开源项目性能优化数据存储日志分析
Parseable是一款云原生日志分析平台,专注提升性能和资源效率。该平台采用Rust语言开发,相比传统系统能显著降低CPU和内存消耗。Parseable提供单一二进制文件部署方式,支持Apache Arrow和Parquet格式存储,让用户完全掌控数据。此外,Parseable还配备多项企业级功能,包括高可用性、集群模式、OpenTelemetry集成、告警机制和基于角色的访问控制等。该平台特别适合需要安全合规存储和实时分析日志数据的组织使用。
databend - 高性能云数据仓库,基于 Rust 构建,适合大规模数据分析与人工智能
AI分析DatabendGithub云数据仓库开源项目性能基准测试数据格式热门
Databend 是一个开源、高性能的云数据仓库,使用 Rust 构建,专为复杂的数据分析设计。它整合了 AWS S3、Azure Blob 等服务,支持 ACID 事务、版本控制和无模式的数据存储,确保数据完整性与灵活性。Databend 支持多种数据格式,如 JSON、CSV、Parquet 等,提供高速查询执行与数据摄入,是成本效益高的 Snowflake 替代方案。此外,Databend 的 AI 功能支持高级分析,提供社区驱动的用户友好体验,适合企业和开发者快速部署和使用。
awesome-opensource-data-engineering - 全面的数据工程开源项目资源库
Github开源开源项目数据分析数据处理数据工程数据管理
该资源库汇集了数据工程领域的开源项目,覆盖数据分析、业务智能、数据湖和数据治理等方面。包含Apache Spark、Flink等分析工具,Debezium、Kafka等数据捕获和消息系统,以及各种数据格式、集成工具和工作流管理系统。为数据工程实践提供了全面的开源解决方案参考。
feathr - 企业级统一数据和AI工程开源平台
AI模型FeathrGithub开源项目数据处理特征工程平台
Feathr是LinkedIn开源的数据和AI工程平台,经过多年生产环境验证。该平台支持数据转换的定义、注册和共享,尤其适合AI建模场景。Feathr采用原生云集成和可扩展架构,提供丰富的转换API,能够处理大规模数据,并在离线批处理、流处理和在线环境中保持统一的数据转换接口。
logging-flume - 分布式大规模日志收集与传输系统
Apache FlumeGithub分布式系统开源软件开源项目数据聚合日志收集
Apache Flume是一个专门用于大规模日志数据收集、聚合和传输的分布式系统。它采用基于流数据的架构,具有简单灵活、可靠高效的特点。Flume提供强大的容错能力和可调节的可靠性机制,支持集中管理和智能动态管理。其简单可扩展的数据模型支持在线分析应用。作为Apache软件基金会项目,Flume拥有完善的文档和活跃的社区支持。
项目侧边栏1项目侧边栏2
推荐项目
Project Cover

豆包MarsCode

豆包 MarsCode 是一款革命性的编程助手,通过AI技术提供代码补全、单测生成、代码解释和智能问答等功能,支持100+编程语言,与主流编辑器无缝集成,显著提升开发效率和代码质量。

Project Cover

AI写歌

Suno AI是一个革命性的AI音乐创作平台,能在短短30秒内帮助用户创作出一首完整的歌曲。无论是寻找创作灵感还是需要快速制作音乐,Suno AI都是音乐爱好者和专业人士的理想选择。

Project Cover

有言AI

有言平台提供一站式AIGC视频创作解决方案,通过智能技术简化视频制作流程。无论是企业宣传还是个人分享,有言都能帮助用户快速、轻松地制作出专业级别的视频内容。

Project Cover

Kimi

Kimi AI助手提供多语言对话支持,能够阅读和理解用户上传的文件内容,解析网页信息,并结合搜索结果为用户提供详尽的答案。无论是日常咨询还是专业问题,Kimi都能以友好、专业的方式提供帮助。

Project Cover

阿里绘蛙

绘蛙是阿里巴巴集团推出的革命性AI电商营销平台。利用尖端人工智能技术,为商家提供一键生成商品图和营销文案的服务,显著提升内容创作效率和营销效果。适用于淘宝、天猫等电商平台,让商品第一时间被种草。

Project Cover

吐司

探索Tensor.Art平台的独特AI模型,免费访问各种图像生成与AI训练工具,从Stable Diffusion等基础模型开始,轻松实现创新图像生成。体验前沿的AI技术,推动个人和企业的创新发展。

Project Cover

SubCat字幕猫

SubCat字幕猫APP是一款创新的视频播放器,它将改变您观看视频的方式!SubCat结合了先进的人工智能技术,为您提供即时视频字幕翻译,无论是本地视频还是网络流媒体,让您轻松享受各种语言的内容。

Project Cover

美间AI

美间AI创意设计平台,利用前沿AI技术,为设计师和营销人员提供一站式设计解决方案。从智能海报到3D效果图,再到文案生成,美间让创意设计更简单、更高效。

Project Cover

AIWritePaper论文写作

AIWritePaper论文写作是一站式AI论文写作辅助工具,简化了选题、文献检索至论文撰写的整个过程。通过简单设定,平台可快速生成高质量论文大纲和全文,配合图表、参考文献等一应俱全,同时提供开题报告和答辩PPT等增值服务,保障数据安全,有效提升写作效率和论文质量。

投诉举报邮箱: service@vectorlightyear.com
@2024 懂AI·鲁ICP备2024100362号-6·鲁公网安备37021002001498号