说三道四技术文摘-感悟人生的经典句子
说三道四 > 文档快照

十大技术,十家机构,从行业制高点一览大数据

HTML文档下载 WORD文档下载 PDF文档下载
大数据宽泛的概念很难深刻地理解,只有掌握行业最前沿的技术,了解该行业的领头人,才能对整个行业有一个总的认识。站在制高点,你将获得更敏锐的洞察力。

大数据在各行各业中取得了迅猛发展,许多组织都被迫寻找新的创造性方法来管理和控制如此庞大的数据,当然这么做的目的不只是管理和控制数据,而是要分析和挖掘其中的价值,来促进业务的发展。着眼大数据,过去几年内产生了许多颠覆性技术,比如Hadoop、MongDB、Spark、Impala等,了解这些前沿技术还有助于你更好的把握大数据发展趋势。诚然,想了解一件事物,首先要了解与该事物有关的人。因此,要想了解大数据,光了解技术是远远不够的,本文中大数据领域的十个巨头,将有助于你更深入掌握大数据这个行业的发展形势。


CSDN推荐:欢迎免费订阅《Hadoop与大数据周刊》获取更多Hadoop技术文献、大数据技术分析、企业实战经验,生态圈发展趋势。

大数据领域的十大开源技术

根据最新的思科全球云指数报告,预计到2017年年底,全球数据中心年均IP流量将达到7.7ZB。总体而言,数据中心IP流量在2012年到2017年之间将以25%的复合年均增长率(CAGR)增长。

现在增长的速度更快,而且组织需要依靠大量的数据集帮助它们运营、量化和发展业务。在过去几年里,大型数据库经历了从GB到TB再到PB级的发展过程。

此外,数据也不再是存储在一个地方,随着这些数据的增长以及云计算的发展,这些数据实现了分布式存储。

几乎所有行业都在发展大数据和数据科学

  • 科学:大型强子对撞机每秒大约进行6亿次碰撞。因此,只有当传感器流数据小于0.001%的时候才有效,从四个大型强子对撞机实验中产生的数据意味着每年将产生25PB的数据(统计于2012年),此外备份还会产生大量数据,备份后的数据有可能达到200PB。
  • 研究:美国航空航天局的气候模拟中心(NCCS)在其超级计算机平台上存储了约32PB的气候观测和模拟数据。
  • 私有/公共:亚马逊每天处理的后端操作达数百万,此外还有超过50万个第3方卖家的查询操作。亚马逊的核心技术运行在基于Linux的数据库系统上,截至2005年,亚马逊拥有世界上三个最大的Linux数据库,容量分别达到了7.8TB、18.5TB、24.7TB。

组织被迫寻找新的创造性方法来管理和控制如此庞大的数据,目的不只是为了整理数据,而是要分析和挖掘数据来进一步发展业务,因此,一些开源大数据技术值得考虑:

Apache HBase:这个大数据管理平台建立在谷歌强大的BigTable管理引擎基础上。作为具有开源、Java编码、分布式多个优势的数据库,Hbase最初被设计应用于Hadoop平台,而这一强大的数据管理工具,也被Facebook采用,用于管理消息平台的庞大数据。

Apache Storm:用于处理高速、大型数据流的分布式实时计算系统。Storm为Apache Hadoop添加了可靠的实时数据处理功能,同时还增加了低延迟的仪表板、安全警报,改进了原有的操作方式,帮助企业更有效率地捕获商业机会、发展新业务。

Apache Spark:该技术采用内存计算,从多迭代批量处理出发,允许将数据载入内存做反复查询,此外还融合数据仓库、流处理和图计算等多种计算范式,Spark用Scala语言实现,构建在HDFS上,能与Hadoop很好的结合,而且运行速度比MapReduce快100倍。

Apache Hadoop:该技术迅速成为了大数据管理标准之一。当它被用来管理大型数据集时,对于复杂的分布式应用,Hadoop体现出了非常好的性能,平台的灵活性使它可以运行在商用硬件系统,它还可以轻松地集成结构化、半结构化和甚至非结构化数据集。

Apache Drill:你有多大的数据集?其实无论你有多大的数据集,Drill都能轻松应对。通过支持HBase、Cassandra和MongoDB,Drill建立了交互式分析平台,允许大规模数据吞吐,而且能很快得出结果。

Apache Sqoop:也许你的数据现在还被锁定于旧系统中,Sqoop可以帮你解决这个问题。这一平台采用并发连接,可以将数据从关系数据库系统方便地转移到Hadoop中,可以自定义数据类型以及元数据传播的映射。事实上,你还可以将数据(如新的数据)导入到HDFS、Hive和Hbase中。

Apache Giraph:这是功能强大的图形处理平台,具有很好可扩展性和可用性。该技术已经被Facebook采用,Giraph可以运行在Hadoop环境中,可以将它直接部署到现有的Hadoop系统中。通过这种方式,你可以得到强大的分布式作图能力,同时还能利用上现有的大数据处理引擎。

Cloudera Impala:Impala模型也可以部署在你现有的Hadoop群集上,监视所有的查询。该技术和MapReduce一样,具有强大的批处理能力,而且Impala对于实时的SQL查询也有很好的效果,通过高效的SQL查询,你可以很快的了解到大数据平台上的数据。

Gephi:它可以用来对信息进行关联和量化处理,通过为数据创建功能强大的可视化效果,你可以从数据中得到不一样的洞察力。Gephi已经支持多个图表类型,而且可以在具有上百万个节点的大型网络上运行。Gephi具有活跃的用户社区,Gephi还提供了大量的插件,可以和现有系统完美的集成到一起,它还可以对复杂的IT连接、分布式系统中各个节点、数据流等信息进行可视化分析。

MongoDB:这个坚实的平台一直被很多组织推崇,它在大数据管理上有极好的性能。MongoDB最初是由DoubleClick公司的员工创建,现在该技术已经被广泛的应用于大数据管理。MongoDB是一个应用开源技术开发的NoSQL数据库,可以用于在JSON这样的平台上存储和处理数据。目前,纽约时报、Craigslist以及众多企业都采用了MongoDB,帮助他们管理大型数据集。(Couchbase服务器也作为一个参考)。

在我们这个DOD(data-on-demand)社会,每天都有大量的数据产生,并且大量的数据被收集在主要IT系统中。无论是社交媒体的照片还是国际商店交易信息,大量高质量、可量化的数据每天都在爆炸性增加,应对的唯一方法就是快速部署一个高效的管理方案。

切记,除了要对数据进行快速的分类和组织,IT管理人员必须具有挖掘信息并将其应用到业务中的能力。商业智能和数据量化背后的科学将继续发展和扩大,企业取得竞争优势的关键在于能否对它们的数据进行很好的管理。

历数大数据领域不可忽视的十大巨头

Amazon Web Services

Forrester将AWS称为“云霸主”,谈到云计算领域的大数据,那就不得不提到亚马逊。该公司的Hadoop产品被称为EMR(Elastic Map Reduce),AWS解释这款产品采用了Hadoop技术来提供大数据管理服务,但它不是纯开源Hadoop,经过修改后现在被专门用在AWS云上。

Forrester称EMR有很好的市场前景。很多公司基于EMR为客户提供服务,有一些公司将EMR应用于数据查询、建模、集成和管理。而且AWS还在创新,Forrester称未来EMR可以基于工作量的需要自动缩放调整大小。亚马逊计划为其产品和服务提供更强大的EMR支持,包括它的RedShift数据仓库、新公布的Kenesis实时处理引擎以及计划中的NoSQL数据库和商业智能工具。不过AWS还没有自己的Hadoop发行版。

Cloudera

Cloudera有开源Hadoop的发行版,这个发行版采用了Apache Hadoop开源项目的很多技术,不过基于这些技术的发行版也有很大的进步。Cloudera为它的Hadoop发行版开发了很多功能,包括Cloudera管理器,用于管理和监控,以及名为Impala的SQL引擎等。Cloudera的Hadoop发行版基于开源Hadoop,但也不是纯开源的产品。当Cloudera的客户需要Hadoop不具备的某些功能时,Cloudera的工程师们就会实现这些功能,或者找一个拥有这项技术的合作伙伴。Forrester表示:“Cloudera的创新方法忠于核心Hadoop,但因为其可实现快速创新并积极满足客户需求,这一点使它不同于其他那些供应商。”目前,Cloudera的平台已经拥有200多个付费客户,一些客户在Cloudera的技术支持下已经可以跨1000多个节点实现对PB级数据的有效管理。

Hortonworks

和Cloudera一样,Hortonworks是一个纯粹的Hadoop技术公司。与Cloudera不同的是,Hortonworks坚信开源Hadoop比任何其他供应商的Hadoop发行版都要强大。Hortonworks的目标是建立Hadoop生态圈和Hadoop用户社区,推进开源项目的发展。Hortonworks平台和开源Hadoop联系紧密,公司管理人员表示这会给用户带来好处,因为它可以防止被供应商套牢(如果Hortonworks的客户想要离开这个平台,他们可以轻松转向其他开源平台)。这并不是说Hortonworks完全依赖开源Hadoop技术,而是因为该公司将其所有开发的成果回报给了开源社区,比如Ambari,这个工具就是由Hortonworks开发而成,用来填充集群管理项目漏洞。Hortonworks的方案已经得到了Teradata、Microsoft、Red Hat和SAP这些供应商的支持。

IBM

当企业考虑一些大的IT项目时,很多人首先会想到IBM。IBM是Hadoop项目的主要参与者之一,Forrester称IBM已有100多个Hadoop部署,它的很多客户都有PB级的数据。IBM在网格计算、全球数据中心和企业大数据项目实施等众多领域有着丰富的经验。“IBM计划继续整合SPSS分析、高性能计算、BI工具、数据管理和建模、应对高性能计算的工作负载管理等众多技术。”

Intel

和AWS类似,英特尔不断改进和优化Hadoop使其运行在自己的硬件上,具体来说,就是让Hadoop运行在其至强芯片上,帮助用户打破Hadoop系统的一些限制,使软件和硬件结合的更好,英特尔的Hadoop发行版在上述方面做得比较好。Forrester指出英特尔在最近才推出这个产品,所以公司在未来还有很多改进的可能,英特尔和微软都被认为是Hadoop市场上的潜力股。

MapR Technologies

MapR的Hadoop发行版目前为止也许是最好的了,不过很多人可能都没有听说过。Forrester对Hadoop用户的调查显示,MapR的评级最高,其发行版在架构和数据处理能力上都获得了最高分。MapR已将一套特殊功能融入其Hadoop发行版中。例如网络文件系统(NFS)、灾难恢复以及高可用性功能。Forrester说MapR在Hadoop市场上没有Cloudera和Hortonworks那样的知名度,MapR要成为一个真正的大企业,还需要加强伙伴关系和市场营销。

Microsoft

微软在开源软件问题上一直很低调,但在大数据形势下,它不得不考虑让Windows也兼容Hadoop,它还积极投入到开源项目中,以更广泛地推动Hadoop生态圈的发展。我们可以在微软的公共云Windows Azure HDInsight产品中看到其成果。微软的Hadoop服务基于Hortonworks的发行版,而且是为Azure量身定制的。

微软也有一些其他的项目,包括名为Polybase的项目,让Hadoop查询实现了SQLServer查询的一些功能。Forrester说:“微软在数据库、数据仓库、云、OLAP、BI、电子表格(包括PowerPivot)、协作和开发工具市场上有很大优势,而且微软拥有庞大的用户群,但要在Hadoop这个领域成为行业领导者还有很远的路要走。”

Pivotal Software

EMC和Vmware部分大数据业务分拆组合产生了Pivotal。Pivotal一直努力构建一个性能优越的Hadoop发行版,为此,Pivotal在开源Hadoop的基础上又添加了一些新的工具,包括一个名为HAWQ的SQL引擎以及一个专门解决大数据问题的Hadoop应用。Forrester称Pivotal Hadoop平台的优势在于它整合了Pivotal、EMC、Vmware的众多技术,Pivotal的真正优势实际上等于EMC和Vmware两大公司为其撑腰。到目前为止,Pivotal的用户还不到100个,而且大多是中小型客户。

Teradata

对于Teradata来说,Hadoop既是一种威胁也是一种机遇。数据管理,特别是关于SQL和关系数据库这一领域是Teradata的专长。所以像Hadoop这样的NoSQL平台崛起可能会威胁到Teradata。相反,Teradata接受了Hadoop,通过与Hortonworks合作,Teradata在Hadoop平台集成了SQL技术,这使Teradata的客户可以在Hadoop平台上方便地使用存储在Teradata数据仓库中的数据。

AMPLab

通过将数据转变为信息,我们才可以理解世界,而这也正是AMPLab所做的。AMPLab致力于机器学习、数据挖掘、数据库、信息检索、自然语言处理和语音识别等多个领域,努力改进对信息包括不透明数据集内信息的甄别技术。除了Spark,开源分布式SQL查询引擎Shark也源于AMPLab,Shark具有极高的查询效率,具有良好的兼容性和可扩展性。近几年的发展使计算机科学进入到全新的时代,而AMPLab为我们设想一个运用大数据、云计算、通信等各种资源和技术灵活解决难题的方案,以应对越来越复杂的各种难题。

相关链接:

Open Source Technologies Provide Cloud-Ready Big Data Control

Nine Hadoop companies you should know(编译/毛梦琪 审校/魏伟)


以“云计算大数据 推动智慧中国”为主题的第六届中国云计算大会将于5月20-23日在北京国家会议中心隆重举办。产业观察、技术培训、主题论坛、行业研讨,内容丰富,干货十足。票价优惠,马上报名
布局O2O Facebook推出实物礼品卡 iSuppli:微软Surface RT实际销量远低于出货量 业界前三甲:App Store两个刷榜者,站了出来 极客无极限 一行HTML5代码引发的创意大爆炸 将服务器“弃”之荒野? 微软玩转露天数据中心 Dropbox:我们现在关注“内容” 而不仅仅是文件存储 访Teradata Aster Mayank Bawa:抛弃无效数据,让分析走向大众化 谷歌Chrome或新增通知中心 与Google Now整合 传言称HBO节目将登陆苹果Apple TV? Crashlytics被收购,应用崩溃报告服务要火了? 微软公布WP7.8完整功能 诺基亚率先升级 BlackBerry 10或许不仅仅是一剂强心针 一周消息树:专访蒋彪:JavaEE是企业级开发首选 移动周报:从封闭到开放,iOS生态系统要变天? 游戏平台上:Win7已跌破70% Ubuntu突破1% 不再那么传奇 扎克伯格时代或结束 微软应该联手Firefox OS,打造破坏性生态系统 中美IT人才俱乐部第一期:硅谷经验面面观 中国第四季度Android和iOS智能手机出货量高达98% 开发者眼中的代码审查“真相” 互联网产品设计的12个理念 Pair、Between、小恩爱:妹纸装个情侣应用吧? 横跨四大操作系统:3DMark将挑战所有智能设备 美国碰壁欧洲得意 华为获CERN青睐 应用数据分析新标准:Flurry增应用崩溃分析功能 Twitter被黑客入侵,25万用户信息可能被窃 16亿美元超级计算机项目助力解读人脑 卡巴斯基发现新型Android恶意软件 可入侵Windows 谷歌发布基于B-Tree的C++模板库 开源产品系列:高性能Web框架Zend Framework LiFi是否会取代WiFi? 电话拨号问题请教 100分 怎样读取数据库中的二进制数据? 急啊~fread的第二个参数忽略回车,怎么办? 为什么photoshop的调色板里只有一种颜色,急,在线 redhat linux8.0中文版有没有中文的帮助文档 Linux Apache+PHP+MySQL的配置问题?? 马上登陆geniusbible.yeah.net网站 我问一个简单问题 各linux都什么优点 这段代吗怎么写? 分乃身外之物,顺便问一个问题。 在delphi中怎么样把字符串的前后空格去掉 有没有人用vss做版本控制的?? 摩托遇到怪事~~决定研究一下~~有兴趣看看拉~~ 求救:哪位有NotesSQL 2.06 email:frank@southsundin.com API ATCS10_SCO505版本,免费的类似TUXEDO消息中间件,欢迎大家使用!!! what is the MAPI? 一个关于子窗体的问题?请大家帮忙,在线等待! 如何做浮动窗体! 一个不是很难的问题。我却很难哟 请教关于访问Jbuilder7中数据库的问题(急) 突然想到的一个问题,请问大家在认真思考问题的时候都习惯做些什么动作? 在SDI程序中,如何在“框架类”中得到“文档类”的指针? 经常看到图片的上传到数据库,以及如何显示的问题,并且在另一个页面实现指定位置显示多个图片!我整理了,需要来登记! 招聘程序员!!!! 各位老大:请帮助!!!!! 请假两天要扣掉薪水的百分之几? JSP通过JDBC连接ORACLE的问题!!! 简单问题,vb得块注视是什么? 为什么mingw和DJGPP. 的主页总是上不去?? 五笔怎么装?装在什么目录下? 最远的距离 请教关于访问Jbuilder7中数据库的问题(急) JSP通过JDBC连接ORACLE的问题!!!!!!!!!!!!!!! 打印机状态,在线等待,万分火急 modelmaker6这东西是做什么的,那位前辈知道 NOTES在用久了之后,邮箱会变的巨大,几百MB,但即使我将邮件删除,其邮件文件还是那么大,怎么可以让它缩小? 我为程序中的职工设了一个序号,人数有多少序号就有多少。可以一眼就看出有多少人。可是当我在离职表中删除职工时。序号跟着被删除。删除 关于sql的难题。 请问如何用SQL语句更改一个表的字段长度,其他都不变. jsp读取oracle8.1.6数据表中的中文,读出为?,着急啊。 上个100帖子已结,现在再拿100分求从导入到数据库的代码,各位老大帮忙看看。 怎样用程序设置文件夹共享? VB中,怎样实现C中的continue? 注册表与记录登录密码 更新表中某字段的值 请问如何实现像delphi编辑器那样,当输入了关键字后会变成粗体或其它的颜色? 有人需要Delphi调用水晶报表的例子吗? 关于ADO+SQL Server2000数据库备份的问题! vb.net应用程序! it,speak,become,English,that,I,get,the,could,was,I,could,job连词成句 被人类砍伐了的森林有哪些?请写出名称. 有没有初三的政治书最好是有笔记的? I Speak Because I Can 歌词 如果人类过度砍伐森林,会给森林的生态系统造成什么影响? 现在橡胶多少钱一公斤?我有个亲戚他家好多橡胶,请问现在哪位哥哥姐姐知道那东东多少钱一公斤?鞠躬~ 用2根长都是16分米的铁丝分别围一个长方形和正方形 我要起个好听的英文网名 油墨用开钛白粉69 改用龙莽996可以吗 英语翻译1、Landed fee deliver to the destination place2、Certificate of the material and the certificate of possible treatment of surface 3、How man is the produts you could refund the mold charge? 砍伐森林会对人类和动植物 的生活产生哪些影响 龙组词有哪些 第3、4、5题, where do you come from?where do you come foom? 23分米长的铁丝围成长方形,要求长方形和宽都是整分米数,怎样围成的长方形面积最 2 3 4题我做的对不对 英语翻译 用12分米的铁丝围成长和宽都是整分米数的长方形,面积最大的是多少平方分米,面积最小的是多少平方分米 高中物理竞赛试题 急一质量为m的炸弹一速度v飞行,其内部的炸药产生能量e,使此炸弹分为两半,一半的质量为另一半的k倍.若两半仍能沿着原方向前进,试分别求其速率 英语翻译 英语填空题求助,有图 “你”左边的那个单人旁念什么呢?3Q 每年有多少亩森林被砍伐 历史(上册):北京师范大学出版社政治(全一册):人民教育出版社要期末测试题,越多越全越好, 诠能组什么词 被砍伐的森林占所有森林的多少 印刷纸的种类印刷纸可以分为哪几种 诠字怎样组词?组一个就够了. 想给男朋友改个通讯录备注 ,要英文的.大家都知道那个最大限度是14个字母我准备在前面打两个空格 ,所以就只剩12个字母了最好要一个句子 请附上翻译 什么是非涂布印刷纸?我在写一篇关于造纸的论文,如果大家有更好的文章或名人名言或关于造纸的书籍,请多多告诉我给我,请与27日前发表给我! 诠换偏旁组词 有关电功率的计算题目.某电灯上标有 “220V 40W”.(1)把该电器接入110V电源中,计算此时的实际功率.(2)把该电灯和“220V 25W”的电灯并联在220V电源中,哪只灯更亮?为什么?(3)把该电灯和 印刷纸按用途可分为哪些类别? 五句形容人一心一意的古诗,求 2,4, “电话簿”英文怎么说? 一心一意这种形式的词语 请检查1.2.4.5. 电话本的英文是什么 一心一意类的词语比如一心一意 王字旁加个月字念什么字 森林采伐用机械定义就是这个,帮了个忙的啊,就这几天要交了. 我国古代发明较早的化学工艺有A造纸,指南针,制火药,冶炼钢铁 B制青铜器 制火药,印刷术,烧瓷器C制青铜器,冶炼钢铁,烧瓷器,制火药,D冶炼钢铁,指南针,造纸,印刷术 王字加个月字念什么?那为什么字典里没有啊 我要的是那种硬的橡胶的密度,最好是市场上常用的,价格便宜的.密度 密度? 指南针和印刷术是谁发明的·Y 电热地膜的工作原理是什么? 龙怎么组词 i know you want me翻译成西班牙语. 电热水袋的工作原理,及其中的化学药物是什么 请问:保持的近意词,成果的进意词,思考的进意词! It was because I could speak English that I got the job我想问一下这个句子各部分的结构(成分)分别是什么?这个句子的用法是it作形式主语?还是其他什么用法, 填空题1,3两题 砍伐森林后会导致水患,那么森林防止水患的原因有哪些 It was becauce I could speak English that I got the job.请问句中的that作什么? 填空题第2.3.4题 橡胶价格什么时候会上涨啊?现在的橡胶价格还不如青菜白菜价格,真是苦了我们这些胶农了,没法过日子了 It was beause I could speak English that I got the job.分析句子成分, 请问第3道填空题怎么做? 橡胶价格还会涨吗
备案号:鲁ICP备13029499号-2 说三道四 www.s3d4.cn 说三道四技术文摘