Bigdata Open Source Projects

Browse 164 Bigdata open source projects, ranked by GitHub stars. Find the most popular Bigdata tools and libraries.

Share your experience:✍️ Write a Post❓ Ask a Question
1-60 of 164 projects
42,209 stars

DataEngineer-io/data-engineer-handbook

This is a repo with links to everything you'd ever want to learn about data engineering

Metrics details
Stars42,209
24,968 stars

taosdata/TDengine

High-performance, scalable time-series database designed for Industrial IoT (IIoT) scenarios

Metrics details
Stars24,968
20,760 stars

apache/shardingsphere

Empowering Data Intelligence with Distributed SQL for Sharding, Scalability, and Security Across All Databases.

Metrics details
Stars20,760
16,922 stars

heibaiying/BigData-Notes

大数据入门指南 :star:

Metrics details
Stars16,922
14,487 stars

newTendermint/awesome-bigdata

A curated list of awesome big data frameworks, ressources and other awesomeness.

Metrics details
Stars14,487
14,212 stars

juicedata/juicefs

JuiceFS is a distributed POSIX file system built on top of Redis and S3.

Metrics details
Stars14,212
10,492 stars

wangzhiwubigdata/God-Of-BigData

专注大数据学习面试,大数据成神之路开启。Flink/Spark/Hadoop/Hbase/Hive...

Metrics details
Stars10,492
9,392 stars

datafuselabs/databend

Modern alternative to Snowflake. Cost-effective and simple for massive-scale analytics. Cloud: https://databend.com

Metrics details
Stars9,392
8,509 stars

vaexio/vaex

Out-of-Core hybrid Apache Arrow/NumPy DataFrame for Python, ML, visualization and exploration of big tabular data at a billion rows per second 🚀

Metrics details
Stars8,509
6,193 stars

apache/hudi

Upserts, Deletes And Incremental Processing on Big Data.

Metrics details
Stars6,193
5,785 stars

volcano-sh/volcano

A Cloud Native Batch System (Project under CNCF)

Metrics details
Stars5,785
5,232 stars

iGaoWei/BigDataView

100+套大数据可视化炫酷大屏Html5模板;包含行业:社区、物业、政务、交通、金融银行等,全网最新、最多,最全、最酷、最炫大数据可视化模板。陆续更新中

Metrics details
Stars5,232
4,105 stars

DTStack/chunjun

A data integration framework

Metrics details
Stars4,105
3,435 stars

liyupi/sql-generator

🔨 用 JSON 来生成结构化的 SQL 语句,基于 Vue3 + TypeScript + Vite + Ant Design + MonacoEditor 实现,项目简单(重逻辑轻页面)、适合练手~

Metrics details
Stars3,435
3,289 stars

apache/avro

Apache Avro is a data serialization system.

Metrics details
Stars3,289
3,187 stars

MoRan1607/BigDataGuide

大数据学习,从零开始学习大数据,包含大数据学习各阶段学习视频、面试资料

Metrics details
Stars3,187
2,663 stars

douban/dpark

Python clone of Spark, a MapReduce alike framework in Python

Metrics details
Stars2,663
2,475 stars

griddb/griddb

GridDB is a next-generation open source database that makes time series IoT and big data fast,and easy.

Metrics details
Stars2,475
2,254 stars

h2oai/h2o-2

Please visit https://github.com/h2oai/h2o-3 for latest H2O

Metrics details
Stars2,254
2,097 stars

dotnet/spark

.NET for Apache® Spark™ makes Apache Spark™ easily accessible to .NET developers.

Metrics details
Stars2,097
2,052 stars

DTStack/flinkStreamSQL

基于开源的flink,对其实时sql进行扩展;主要实现了流与维表的join,支持原生flink SQL所有的语法

Metrics details
Stars2,052
1,975 stars

shzlw/poli

An easy-to-use BI server built for SQL lovers. Power data analysis in SQL and gain faster business insights.

Metrics details
Stars1,975
1,951 stars

fluid-cloudnative/fluid

Fluid, elastic data abstraction and acceleration for BigData/AI applications in cloud. (Project under CNCF)

Metrics details
Stars1,951
1,835 stars

byzer-org/byzer-lang

Byzer (former MLSQL): A low-code open-source programming language for data pipeline, analytics and AI.

Metrics details
Stars1,835
1,785 stars

collabH/bigdata-growth

大数据知识仓库涉及到数据仓库建模、实时计算、大数据、数据中台、系统设计、Java、算法等。

Metrics details
Stars1,785
1,763 stars

Netflix/genie

Distributed Big Data Orchestration Service

Metrics details
Stars1,763
1,692 stars

YoongiKim/AutoCrawler

Google, Naver multiprocess image web crawler (Selenium)

Metrics details
Stars1,692
1,659 stars

will-che/BigData-Interview

:dart: :star2:[大数据面试题]分享自己在网络上收集的大数据相关的面试题以及自己的答案总结.目前包含Hadoop/Hive/Spark/Flink/Hbase/Kafka/Zookeeper框架的面试题知识总结

Metrics details
Stars1,659
1,658 stars

jadianes/spark-py-notebooks

Apache Spark & Python (pySpark) tutorials for Big Data Analysis and Machine Learning as IPython / Jupyter notebooks

Metrics details
Stars1,658
1,536 stars

hi-primus/optimus

:truck: Agile Data Preparation Workflows made easy with Pandas, Dask, cuDF, Dask-cuDF, Vaex and PySpark

Metrics details
Stars1,536
1,459 stars

tensorbase/tensorbase

TensorBase is a new big data warehousing with modern efforts.

Metrics details
Stars1,459
1,431 stars

vaquarkhan/vaquarkhan

Metrics details
Stars1,431
1,419 stars

opendatadiscovery/odd-platform

First open-source data discovery and observability platform. We make a life for data practitioners easy so you can focus on your business.

Metrics details
Stars1,419
1,148 stars

NetEase/amoro

Amoro is a Lakehouse management system built on open data lake formats.

Metrics details
Stars1,148
1,089 stars

kubernetes-sigs/kube-batch

A batch scheduler of kubernetes for high performance workload, e.g. AI/ML, BigData, HPC

Metrics details
Stars1,089
1,089 stars

kubernetes-retired/kube-batch

A batch scheduler of kubernetes for high performance workload, e.g. AI/ML, BigData, HPC

Metrics details
Stars1,089
1,082 stars

jacksu/utils4s

scala、spark使用过程中,各种测试用例以及相关资料整理

Metrics details
Stars1,082
1,056 stars

apache/celeborn

Apache Celeborn is an elastic and high-performance service for shuffle and spilled data.

Metrics details
Stars1,056
1,055 stars

josonle/Coding-Now

学习记录的一些笔记,以及所看得一些电子书eBooks、视频资源和平常收纳的一些自己认为比较好的博客、网站、工具。涉及大数据几大组件、Python机器学习和数据分析、Linux、操作系统、算法、网络等

Metrics details
Stars1,055
980 stars

zeromicro/cds

Data syncing in golang for ClickHouse.

Metrics details
Stars980
955 stars

apache/incubator-livy

Apache Livy is an open source REST interface for interacting with Apache Spark from anywhere.

Metrics details
Stars955
947 stars

microsoft/Mobius

C# and F# language binding and extensions to Apache Spark

Metrics details
Stars947
917 stars

visualpython/visualpython

GUI-based Python code generator for data science, extension to Jupyter Lab, Jupyter Notebook and Google Colab.

Metrics details
Stars917
889 stars

pingcap/tispark

TiSpark is built for running Apache Spark on top of TiDB/TiKV

Metrics details
Stars889
829 stars

jadianes/spark-movie-lens

An on-line movie recommender using Spark, Python Flask, and the MovieLens dataset

Metrics details
Stars829
825 stars

intsmaze/flink-boot

懒松鼠Flink-Boot 脚手架让Flink全面拥抱Spring生态体系,使得开发者可以以Java WEB开发模式开发出分布式运行的流处理程序,懒松鼠让跨界变得更加简单。懒松鼠旨在让开发者以更底上手成本(不需要理解分布式计算的理论知识和Flink框架的细节)便可以快速编写业务代码实现。为了进一步提升开发者使用懒松鼠脚手架开发大型项目的敏捷的度,该脚手架默认集成Spring框架进行Bean管理,同时将微服务以及WEB开发领域中经常用到的框架集成进来,进一步提升开发速度。比如集成Mybatis ORM框架,Hibernate Validator校验框架,Spring Retry重试框架等,具体见下面的脚手架特性。

Metrics details
Stars825
806 stars

fdv/running-elasticsearch-fun-profit

A book about running Elasticsearch

Metrics details
Stars806
756 stars

gearpump/gearpump

Lightweight real-time big data streaming engine over Akka

Metrics details
Stars756
715 stars

MrXujiang/v6.dooring.public

可视化大屏解决方案, 提供一套可视化编辑引擎, 助力个人或企业轻松定制自己的可视化大屏应用.

Metrics details
Stars715
713 stars

NationalSecurityAgency/datawave

DataWave is an ingest/query framework that leverages Apache Accumulo to provide fast, secure data access.

Metrics details
Stars713
681 stars

WeBankFinTech/WeDataSphere

WeDataSphere is a financial grade, one-stop big data platform suite.

Metrics details
Stars681
675 stars

bigartm/bigartm

Fast topic modeling platform

Metrics details
Stars675
662 stars

AbsaOSS/spline

Data Lineage Tracking And Visualization Solution

Metrics details
Stars662
644 stars

gangly/datafaker

Datafaker is a large-scale test data and flow test data generation tool. Datafaker fakes data and inserts to varied data sources. 测试数据生成工具

Metrics details
Stars644
635 stars

unum-cloud/ustore

Multi-Modal Database replacing MongoDB, Neo4J, and Elastic with 1 faster ACID solution, with NetworkX and Pandas interfaces, and bindings for C 99, C++ 17, Python 3, Java, GoLang 🗄️

Metrics details
Stars635
625 stars

Seagate/cortx

CORTX Community Object Storage is 100% open source object storage uniquely optimized for mass capacity storage devices.

Metrics details
Stars625
614 stars

lison16/vue-bigdata-table

基于Vue.js的百万级数据表格组件,支持编辑、筛选、过滤、粘贴、拖动调整列宽等多种功能

Metrics details
Stars614
586 stars

minio/sidekick

High Performance HTTP Sidecar Load Balancer

Metrics details
Stars586
581 stars

zenkay/bigdata-ecosystem

BigData Ecosystem Dataset

Metrics details
Stars581
568 stars

mvillarrealb/docker-spark-cluster

A simple spark standalone cluster for your testing environment purposses

Metrics details
Stars568
1-60 of 164 projects
Get A Weekly Email With Trending Bigdata Projects
Stay updated on Bigdata plus related topics you pick below.

Copyright 2018-2026 Awesome Open Source.  All rights reserved.