
定量分析“后Hadoop时代”开源趋势
Hadoop作为开源大数据技术的起源,兴起于2006年,至今已有16年历史。报告收集了从Hadoop发展第10年(即2015年)至今的相关公开数据,并进行了关联分析,定义了开源项目热力值研究模型,用量化指标描述开源项目的开发迭代活跃度和受开发者欢迎程度。 报告所呈现的开源大数据热力图,从技术全景、技术栈分类以及项目维度对入围项目的热力表现进行洞察,将项目进程中的关键事件与热力表现关联分析,并访谈了开源基金会、知名开源项目等领域专家,尝试找到项目健康发展一般规律,并对有效提升项目影响力的方法论进行了归纳总结。开源大数据技术的“摩尔定律”
报告发现,每隔40个月,热力值会提升1倍,开源大数据完成一轮技术迭代升级,而且技术周期在加速缩短。在8年时间内,发生了多轮热力变迁,反映出背后技术的更新换代趋势。开发者对「数据查询与分析」保持了长期的开发热情,连续8年位居热力值榜首。2017年,「流处理」热力值超过「批处理」,大数据处理进入实时阶段。数据规模不断扩大,数据结构也更多样化,「数据集成」从2020年开始爆发式增长。三大热力趋势:多元化、一体化和云原生
用户需求多样化推动技术多元化。「数据湖」以34%的热力值年均复合增长率高居热力值增速第一位,「交互式分析」、「DataOps」紧随其后,分列第二、三位 。而原有Hadoop体系的产品迭代则趋于稳定,热力值年均复合增长率为1%。 从2015年开始,计算部分率先进入「一体化」演进历程,其中的典型代表「流批一体」在2019年出现了第一个热力峰值。以数据湖存储为代表的存储一体化从2019年起进入了一个新的发展阶段,涌现了Delta Lake、 Iceberg和Hudi等热点项目。 云原生大规模重构开源技术栈。诞生于云原生时代的开源项目如雨后春笋般破土成长。「数据集成」、「数据存储」、「数据开发与管理」等领域均有重大项目更迭,新项目热力值占比已经超过了80%。开源大数据热力榜单TOP30
本报告从102个入围项目中,评选出了TOP30热力榜单。Kibana以989.40的热力值高居榜首。ClickHouse(数据查询与分析)、Airflow(数据调度与编排)、Flink(流处理)、Airbyte(数据集成)分别摘得各自细分领域的TOP1。Pulsar、Doris、StarRocks、DolphinScheduler、SeaTunnel等一众中国开源项目也表现出高热力趋势。把解决用户痛点作为核心竞争力,是这些优秀开源项目的共同特征,这一特征保证它们与时俱进,成为热力趋势中的“常青树”。
报告下载地址:
https://www.openatom.org/other/%E5%BC%80%E6%BA%90%E5%A4%A7%E6%95%B0%E6%8D%AE%E7%83%AD%E5%8A%9B%E6%8A%A5%E5%91%8A2022.pdf
原文标题:《2022开源大数据热力报告》重磅发布
文章出处:【微信公众号:开放原子】欢迎添加关注!文章转载请注明出处。
-
OpenHarmony
+关注
关注
30文章
3867浏览量
18987 -
开放原子基金会
+关注
关注
1文章
495浏览量
5942
原文标题:《2022开源大数据热力报告》重磅发布
文章出处:【微信号:开放原子,微信公众号:开放原子】欢迎添加关注!文章转载请注明出处。
发布评论请先 登录
斯坦福大学发布《2025 年人工智能指数报告》

零知开源平台重磅升级!嵌入式开发进入“涡轮增压”时代
汽轮机热力循环分析
小米开源2024年度报告发布
2023年度《中国公路货运运行大数据分析报告》发布

东软与中国信通院联合发布数据报告
开源鸿蒙操作系统5.0 Release版本发布
黄鹤开源社区正式发布
开源鸿蒙应用案例重磅发布
Meta重磅发布Llama 3.3 70B:开源AI模型的新里程碑

评论