Apache Spark_百度百科知识图谱

Apache Spark_百度百科

本站和网页 https://baike.baidu.com/item/SPARK/2229312 的作者无关，不对其内容负责。快照谨为网络故障时之索引，不代表被搜索网站的即时页面。

Apache Spark_百度百科
百度首页
网页
新闻
贴吧
知道
网盘
图片
视频
地图
文库
百科
进入词条
全站搜索
帮助
清除历史记录关闭
近期有不法分子冒充百度百科官方人员，以删除词条为由威胁并敲诈相关企业。在此严正声明：百度百科是免费编辑平台，绝不存在收费代编服务，请勿上当受骗！详情>>
首页
历史上的今天
百科冷知识
图解百科
秒懂百科
懂啦
秒懂本尊答
秒懂大师说
秒懂看瓦特
秒懂五千年
秒懂全视界
特色百科
数字博物馆
非遗百科
恐龙百科
多肉百科
艺术百科
科学百科
用户
蝌蚪团
热词团
百科校园
分类达人
百科任务
百科商城
知识专题
权威合作
合作模式
常见问题
联系方式
下载百科APP
个人中心
SPARK是一个多义词，请在下列义项上选择浏览（共11个义项）
展开
收起
添加义项
▪计算引擎
▪挪威女歌手Marit Larsen第三张录音室专辑
▪网络剧
▪fitz and the tantrums音乐作品
▪爱内里菜演唱歌曲
▪三代目J SOUL BROTHERS演唱歌曲
▪2014年陈如山发行EP
▪金泰妍演唱歌曲
▪V6演唱的歌曲
▪2016年机械工业出版社出版的图书
▪英文单词
Apache Spark
播报
编辑
锁定
讨论
上传视频
特型编辑
计算引擎
收藏
查看我的收藏
有用+1
已投票
同义词
SPARK（计算引擎）一般指Apache Spark
Apache Spark 是专为大规模数据处理而设计的快速通用的计算引擎。Spark是UC Berkeley AMP lab (加州大学伯克利分校的AMP实验室)所开源的类Hadoop MapReduce的通用并行框架，Spark，拥有Hadoop MapReduce所具有的优点；但不同于MapReduce的是——Job中间输出结果可以保存在内存中，从而不再需要读写HDFS，因此Spark能更好地适用于数据挖掘与机器学习等需要迭代的MapReduce的算法。Spark 是一种与 Hadoop 相似的开源集群计算环境，但是两者之间还存在一些不同之处，这些有用的不同之处使 Spark 在某些工作负载方面表现得更加优越，换句话说，Spark 启用了内存分布数据集，除了能够提供交互式查询外，它还可以优化迭代工作负载。Spark 是在 Scala 语言中实现的，它将 Scala 用作其应用程序框架。与 Hadoop 不同，Spark 和 Scala 能够紧密集成，其中的 Scala 可以像操作本地集合对象一样轻松地操作分布式数据集。尽管创建 Spark 是为了支持分布式数据集上的迭代作业，但是实际上它是对 Hadoop 的补充，可以在 Hadoop 文件系统中并行运行。通过名为 Mesos 的第三方集群框架可以支持此行为。Spark 由加州大学伯克利分校 AMP 实验室 (Algorithms, Machines, and People Lab) 开发，可用来构建大型的、低延迟的数据分析应用程序。
外文名
Spark
最新版本
3.3.0
[1]
基于
MapReduce算法实现的分布式计算
目录
基本介绍
特点介绍
性能特点
基本原理
计算方法
Apache Spark基本介绍
编辑
播报
Apache Spark是专为大规模数据处理而设计的快速通用的计算引擎
[2]
。现在形成一个高速发展应用广泛的生态系统。
Apache Spark特点介绍
编辑
播报
Spark 主要有三个特点
[3]
：首先，高级 API 剥离了对集群本身的关注，Spark 应用开发者可以专注于应用所要做的计算本身。其次，Spark 很快，支持交互式计算和复杂算法。最后，Spark 是一个通用引擎，可用它来完成各种各样的运算，包括 SQL 查询、文本处理、机器学习等，而在 Spark 出现之前，我们一般需要学习各种各样的引擎来分别处理这些需求。
Apache Spark性能特点
编辑
播报
更快的速度
内存计算下，Spark 比 Hadoop 快100倍。易用性Spark 提供了80多个高级运算符。通用性Spark 提供了大量的库，包括Spark Core、Spark SQL、Spark Streaming、MLlib、GraphX。开发者可以在同一个应用程序中无缝组合使用这些库。支持多种资源管理器Spark 支持 Hadoop YARN，Apache Mesos，及其自带的独立集群管理器Spark生态系统Shark：Shark基本上就是在Spark的框架基础上提供和Hive一样的HiveQL命令接口，为了最大程度的保持和Hive的兼容性，Spark使用了Hive的API来实现query Parsing和 Logic Plan generation，最后的PhysicalPlan execution阶段用Spark代替HadoopMapReduce。通过配置Shark参数，Shark可以自动在内存中缓存特定的RDD，实现数据重用，进而加快特定数据集的检索。同时，Shark通过UDF用户自定义函数实现特定的数据分析学习算法，使得SQL数据查询和运算分析能结合在一起，最大化RDD的重复使用。SparkR：SparkR是一个为R提供了轻量级的Spark前端的R包。 SparkR提供了一个分布式的data frame数据结构，解决了 R中的data frame只能在单机中使用的瓶颈，它和R中的data frame 一样支持许多操作，比如select,filter,aggregate等等。（类似dplyr包中的功能）这很好的解决了R的大数据级瓶颈问题。 SparkR也支持分布式的机器学习算法，比如使用MLib机器学习库。
[4]
SparkR为Spark引入了R语言社区的活力，吸引了大量的数据科学家开始在Spark平台上直接开始数据分析之旅。
[5]
Apache Spark基本原理
编辑
播报
Spark Streaming：构建在Spark上处理Stream数据的框架，基本的原理是将Stream数据分成小的时间片段（几秒），以类似batch批量处理的方式来处理这小部分数据。Spark Streaming构建在Spark上，一方面是因为Spark的低延迟执行引擎（100ms+），虽然比不上专门的流式数据处理软件，也可以用于实时计算，另一方面相比基于Record的其它处理框架（如Storm），一部分窄依赖的RDD数据集可以从源数据重新计算达到容错处理目的。此外小批量处理的方式使得它可以同时兼容批量和实时数据处理的逻辑和算法。方便了一些需要历史数据和实时数据联合分析的特定应用场合。
Apache Spark计算方法
编辑
播报
Bagel: Pregel on Spark，可以用Spark进行图计算，这是个非常有用的小项目。Bagel自带了一个例子，实现了Google的PageRank算法。当下Spark已不止步于实时计算，目标直指通用大数据处理平台，而终止Spark，开启SparkSQL或许已经初见端倪。近几年来，大数据机器学习和数据挖掘的并行化算法研究成为大数据领域一个较为重要的研究热点。早几年国内外研究者和业界比较关注的是在 Hadoop 平台上的并行化算法设计。然而， HadoopMapReduce 平台由于网络和磁盘读写开销大，难以高效地实现需要大量迭代计算的机器学习并行化算法。随着 UC Berkeley AMPLab 推出的新一代大数据平台 Spark 系统的出现和逐步发展成熟，近年来国内外开始关注在 Spark 平台上如何实现各种机器学习和数据挖掘并行化算法设计。为了方便一般应用领域的数据分析人员使用所熟悉的 R 语言在 Spark 平台上完成数据分析，Spark 提供了一个称为 SparkR 的编程接口，使得一般应用领域的数据分析人员可以在 R 语言的环境里方便地使用 Spark 的并行化编程接口和强大计算能力。
[6]
zhua曲子白渡白颗
百度百科内容由网友共同编辑，如您发现自己的词条内容不准确或不完善，欢迎使用本人词条编辑服务（免费）参与修正。立即前往>>
词条图册
更多图册
分享你的世界
查看更多
Spark是什么？
说起大数据，想必大家不陌生，这几乎贯穿了我们的生活，而大数据作用到的一个技术就是Spark，Spark是由加州大学伯克利分校的AMP实验室开发的用来处理的统一分析引擎，它的以构建大型的，低延迟的数据分析系统，它的主要特点就是可以在内存中计算，依靠磁盘去处理复杂的算法。
YJQand
大数据工作流程是什么样的？
大数据，顾名思义就是处理数据的技术，把他看做一个医院，这时的Master就好像是门诊，它把用户按照不同得病因分给不同的医科部门（worker），这时的病人需要治疗（APP），但是这个流程不可能只用一种药物（job），这时的流程就需要主治医师处理，而它的技能就好
YJQand
你知道大数据的数据引擎Spark有哪些组建么？
Spark全称是伯克利数据分析栈，因为Spark能处理大规模的数据，复杂的算法，所以它被运用在云计算，大数据，人工智能等方面；Spark一共有7个组建，分别是SparkCore,用于提供API；SparkSQL，是结构化数据包程序；Sparkstreaming
YJQand
那些高科技用到了Spark？
人工智能的核心就起大数据，通过大数据分析来决定执行那一步，Spark被用在了大数据领域，因为其能够处理大量的数据，依靠磁盘并能进行了复杂的运算，这些的特点，正是为人工智能提供了核心大脑，Spark这么强大，你有什么想法，欢迎评论留言！
YJQand
什么是spark？
Spark是一种快速、通用、可扩展的大数据分析引擎，它2009年诞生于加州大学伯克利分校AMPLab，2013年6月成为Apache培养项目，2014年2月成为Apache顶级项目。目前，Spark生态系统已经发展成为一个包含多个子项目的集合，其中包含Spar
娌愯景銆佲灣
spark的作业？
spark有两个基础作用 1中间结果的输出：基于MapReduce的计算引擎通常会将中间结果输出到磁盘上，进行存储和容错。出于任务管道承接的考虑，当一些查询翻译到MapReduce任务时，往往会产生多个Stage，而这些串联的Stage又依赖于底层文件系统来存
娌愯景銆佲灣
参考资料
Spark 3.0.0发布
．spark官网．2020-08-07[引用日期2020-08-07]
spark
．apache[引用日期2017-02-11]
Holden Karau．Spark快速大数据分析：人民邮电出版社，2015-09-01
[原]海纳百川有容乃大：SparkR与Docker的机器学习实战
．Segmentfault[引用日期2016-03-23]
[译]打造大数据产品：Shiny的Spark之旅
．SegmentFault[引用日期2016-02-20]
刘志强等：基于 SparkR 的分类算法并行化研究
．chinacloud[引用日期2016-03-27]
图集
Apache Spark的概述图（1张）
V百科往期回顾
词条统计
浏览次数：次
编辑次数：3次历史版本
最近更新：
cppcsc
（2022-10-06）
基本介绍
特点介绍
性能特点
基本原理
计算方法
为您推荐广告
新手上路
成长任务
编辑入门
编辑规则
本人编辑
我有疑问
内容质疑
在线客服
官方贴吧
意见反馈
投诉建议
举报不良信息
未通过词条申诉
投诉侵权信息
封禁查询与解封
©2022 Baidu 使用百度前必读 | 百科协议 | 隐私政策 | 百度百科合作平台 | 京ICP证030173号
京公网安备11000002000001号
进入词条
清除历史记录关闭
播报
编辑
讨论
收藏
登录
扫码下载百科APP
领取50财富值奖励
分享到微信朋友圈
打开微信“扫一扫”即可将网页分享至朋友圈
选择朗读音色
00:00
00:00