写点什么

ArchSummit 主题演讲:Ashish Thusoo 介绍大数据发展趋势和 Facebook 的大数据处理平台

  • 2012-07-23
  • 本文字数:1966 字

    阅读完需:约 6 分钟

Ashishi Thusoo 是 Qubole 联合创始人兼 CEO。Qubole 是一个建设云平台进行数据分析和处理的创业企业。在创办 Qubole 之前,ASHISH 负责 Facebook 数据基础设施团队。在他的领导下,团队创造了世界上最大的数据分析与处理平台。该平台实现了公司内部分析师,工程师以及数据科学家得以访问数据的目标。在这一过程中,他帮助推动创造“大数据”部署工具,技术和模板的实现 – 这已经成为主流“大数据”革命的构件。在 Ashish 的协助下,2007 年,他加入 Facebook 时用户只有 5 千万人,当他离开 Facebook 时,用户已经成长到 8 亿人。他也是 Apache Hive 项目的联合创始人,并作为该项目的 Apache 软件基金会的创始副总裁。在 ArchSummit 深圳 2012 大会上,我们也很荣幸邀请到 Ashishi 现场分享,现在报名参加大会可享超低折扣,3 人以上团购享更多优惠。

在这些年从事大数据处理工作的经验中,他总结过以下六点:

  1. 从“该抓哪些数据”转变成“有这么多数据可以做什么”:除了少数状况外,简单的算法搭配大量数据,计算出来的结果远比复杂的算法搭配少量数据更好;这相当类似统计的概念,意即在样本数够大的情况下可以忽略误差。
  2. 尽可能简化分析工具,让普通用户也能使用自如
  3. 大量用户可以让你的分析工具更加完善:第 2 和 3 点相辅相成。当你把分析工具设计得足够简单,一般用户自然乐意使用,而且这些人的加入,会使某些极端的问题一一浮现;例如一个写很烂的查询就会瘫痪整个系统,因此你必须花更多心思另外处理、配置资源,以及管理安全性和权限。
  4. 协作模式同样使用大数据处理:刻意把分析工具设计地带有合作的成分,如此一来当用户分享他们的分析,就会从讨论中得到更多的成果。
  5. 没有一种架构适用所有情况:我们经常在开发的过程中遇到从未见过的问题,与其硬是将它纳入现有的架构,直接设计一个新解决方案会是更好的选择。
  6. 维护服务比开发软件更难:我们花了很多的时间跟心力才让服务正常运作,一方面必须提高系统负载量,同时还要保留弹性,最重要的是要经常监控系统状态是否异常。

在今年的 ArchSummit 深圳 2012 大会上,他将把这六点经验放在融汇于两个演讲之中,包括第一天上午第一个主题演讲,题目是:大数据的技术趋势和演变,在这个演讲中,他将分享:

大数据相关的问题正在变得越来越广泛。很多公司都在面对并试图解决海量数据相关的问题。它几乎充斥了我们的耳朵:传感器和移动设备的不断涌现,产生着越来越多的数据。从根本上说,大数据已经站住脚了,而且正在得到越来越广泛的使用。观察它的演化过程,从 2007 年开始到现在,应该说它颠覆了很多东西,越来越多的人开始尝试。它可以在以下 5 个领域产生巨大影响:创造透明度、通过实验来发现需求和增强绩效、细分人群并采取灵活行动、用自动算法代替或者帮助人工决策、创新商业模式产品和服务。

那么,目前这一代大数据架构的主要驱动力有哪些?这些架构的演化遵循了什么样的路径?未来面临哪些最大的挑战?这些架构将会向什么方向演化?这些都是 Ashish 将会在本演讲中回答的问题。他会分析业界的使用案例,谈谈哪些系统表现出色,哪些系统还不够好。他还会谈及在云上运行这些系统面临的挑战,并就如何克服这些问题提供一些建议。

另外一个演讲,是在第二天下午的“海量数据之快准狠”专题之中,演讲题目是: Facebook 的海量数据架构演变过程,他将会讲到:

作为世界上最大的社交网络,Facebook 公司一天积聚的数据比很多大公司一年产生的数据还要多。 据 2010 年 3 月的博客显示,Facebook 公司的 Hadoop 集群成为世界上最大的计算机集群。这个集群由 2000 台计算机,800 台 16 核系统和 1200 台 8 核系统组成。集群中每个系统存储了大概 12 万亿到 24 万亿字节的数据。

一年前,Facebook 的集群存储了 30 千万亿字节的数据,大概是美国国会图书馆存储信息数量的 3000 倍。Facebook 数据中心在过去一年里增长了三分之一还多。 今年 4 月份,Facebook 耗资 4.5 亿美金建设的新数据中心也已经投入使用。

从 2007 年到 2011 年,Facebook 的大数据处理架构是如何演变的?在一个变动异常频繁,并且快速增长的环境里,都要面临哪些挑战?Facebook 使用了一些组件和技术,让公司大部分部门都可以根据不同的目的访问、分析、使用数据,背后的驱动力是什么?Ashish Thusoo 在本演讲中将会回答这些问题,同时会介绍从 Facebook 的经验中的一些重要收获。

如果您想了解大数据相关技术的发展趋势和具体实践,Ashish Thusoo 的演讲不可错过。

现在个人报名购票可享受 9 折优惠,节省 360 元。团购单位享有更多优惠,ArchSummit 深圳 2012 大会提供针对团队(3 人以上)购票优惠策略。详情请将公司参会信息发邮件至:arch@cn.infoq.com(邮件标题注明“团队购票”),或致电 010-89880682、010-64738142。有关 ArchSummit 全球架构师峰会 2012 的更多信息请访问官方网站: www.ArchSummit.com

2012-07-23 22:042473
用户头像

发布了 479 篇内容, 共 165.1 次阅读, 收获喜欢 52 次。

关注

评论

发布
暂无评论
发现更多内容

个人编程技能全景图

南山

利用工作日志提高效率

Janenesome

思考 工作方式

ARTS Week4

丽子

架构师训练营作业1-食堂就餐卡系统设计

索隆

Shell的技巧小总结(MIT Missing Semester)

Henny

Shell MIT 计算机 Computer Science 计算机工具

你了解 SpringBoot java -jar 的启动原理吗?

猴哥一一 cium

面试 Spring Boot Fat-JAR JAR URL Java 25 周年

仓储控制系统(WCS)软件可靠性设计

申扬科技

仓储控制系统 WCS 可靠性设计 容错性 易恢复性

硬核!30 张图解 HTTP 常见面试题

小林coding

https 计算机网络 计算机基础 HTTP

架构师训练营总结-20200614

caibird1984

为什么软件交付要快?因为要有赢的感觉!

刘华Kenneth

DevOps 敏捷 MVP 最小可用产品 持续交付

Flink 源码分析之写给大忙人看的 Flink Window原理

shengjk1

flink flink源码 flink window

GoF 23种设计模式

无心水

设计模式 GoF 23种设计模式

架构师训练营第一讲-学习总结

索隆

国内首个区块链电子档案平台上线

CECBC

区块链技术 防伪 溯源 电子档案

官方源、镜像源汇总

JackTian

镜像源 官网源

推荐几款有意思的小众 App(06.13)

静陌

产品 App

1. 版本管理工具及 Ruby 工具链环境

Edmond

rubygems CocoaPods VersionControl PackageManager Git Submodule

ARTS Week 3

时之虫

ARTS 打卡计划

【在云端 001】欢迎来到云原生

Bora.Don

云计算 云原生

愚蠢写作术(4):怎么让写作从开始到放弃

史方远

读书笔记 个人成长 写作 随笔杂谈

大话设计模式 | 2. 策略模式

Puran

C# 设计模式

编程基础

南山

程序员陪娃系列——叛逆小娃回归

孙苏勇

程序员 陪伴

小师妹学JavaIO之:用Selector来发好人卡

程序那些事

io nio 「Java 25周年」 小师妹 selector

架构训练营作业-20200614

caibird1984

ARTS打卡计划_第二周

叫不醒装睡的人

ARTS 打卡计划

软件设计原则作业

qihuajun

软件设计原则学习总结

qihuajun

ARTS|Week 3 本周的主题可能是乱

Puran

ARTS 打卡计划

JVM学习笔记——JVM类加载机制

王海

Java 面试 JVM

使用 Docker 镜像 | Docker 系列

AlwaysBeta

Docker 容器 虚拟私有云

ArchSummit主题演讲:Ashish Thusoo介绍大数据发展趋势和Facebook的大数据处理平台_Meta_郑柯_InfoQ精选文章