#Apache Arrow
datasets - 最大的 ML 模型即用型数据集中心,具有快速、易用且高效的数据操作工具
Hugging Face数据集机器学习APIApache ArrowGithub开源项目
🤗 Datasets是一个高效的轻量级数据处理库,支持一行代码完成数据集的下载和预处理。库支持Numpy、Pandas、PyTorch、TensorFlow和JAX等框架,并提供智能缓存及大规模数据集的流式处理,有效减轻内存限制的压力,简化机器学习和数据分析的前置工作。
arrow-rs - Rust实现的Apache Arrow和Parquet高性能数据处理库
Apache ArrowRustParquet数据处理开源项目Github
arrow-rs是Apache Arrow和Apache Parquet的Rust原生实现,提供高效的列式内存格式和数据处理功能。项目包含Arrow核心数据结构、Flight IPC协议、对象存储、Parquet文件格式等组件。每月发布更新,支持高性能数据分析和处理,适用于构建各类大数据应用。
arrow - 高效内存分析引擎 加速大数据处理
Apache Arrow内存分析列式存储数据处理开源项目Github
Apache Arrow 是一个开源的内存分析开发平台,旨在提高大数据系统的数据处理和传输速度。它提供高效的列式内存格式、IPC格式和Flight RPC协议,并支持多种编程语言。Arrow 的核心技术包括高性能的数据结构、跨语言兼容性和零拷贝数据共享,为现代数据分析应用提供了强大的基础架构支持。
deepscatter - 大规模交互式数据可视化JavaScript库 支持百万级数据点渲染
Deepscatter大数据可视化WebGLApache Arrow交互式图表Github开源项目
deepscatter是一款高性能JavaScript库,专为浏览器中的大规模数据集交互式可视化而设计。该库采用Apache Arrow格式、WebGL渲染和GPU计算技术,实现快速数据处理和渲染,可流畅处理百万级数据点。deepscatter适用于创建地图、文献分析等大规模数据可视化应用,支持静态部署。库提供丰富API,允许自定义颜色、大小、抖动等可视化效果。