#Apache Arrow
datasets-学习资料汇总-一行代码加载和预处理海量数据集
3 个月前
DeepScatter: 支持数十亿数据点的可交互式Web散点图可视化库
3 个月前
相关项目
datasets
🤗 Datasets是一个高效的轻量级数据处理库,支持一行代码完成数据集的下载和预处理。库支持Numpy、Pandas、PyTorch、TensorFlow和JAX等框架,并提供智能缓存及大规模数据集的流式处理,有效减轻内存限制的压力,简化机器学习和数据分析的前置工作。
arrow-rs
arrow-rs是Apache Arrow和Apache Parquet的Rust原生实现,提供高效的列式内存格式和数据处理功能。项目包含Arrow核心数据结构、Flight IPC协议、对象存储、Parquet文件格式等组件。每月发布更新,支持高性能数据分析和处理,适用于构建各类大数据应用。
arrow
Apache Arrow 是一个开源的内存分析开发平台,旨在提高大数据系统的数据处理和传输速度。它提供高效的列式内存格式、IPC格式和Flight RPC协议,并支持多种编程语言。Arrow 的核心技术包括高性能的数据结构、跨语言兼容性和零拷贝数据共享,为现代数据分析应用提供了强大的基础架构支持。
deepscatter
deepscatter是一款高性能JavaScript库,专为浏览器中的大规模数据集交互式可视化而设计。该库采用Apache Arrow格式、WebGL渲染和GPU计算技术,实现快速数据处理和渲染,可流畅处理百万级数据点。deepscatter适用于创建地图、文献分析等大规模数据可视化应用,支持静态部署。库提供丰富API,允许自定义颜色、大小、抖动等可视化效果。