写点什么

雅虎! 来自 Hadoop 峰会的最新更新

  • 2010-07-15
  • 本文字数:1557 字

    阅读完需:约 5 分钟

雅虎首席产品官 Blake Irving 吹响了 2010 Hadoop 峰会的呜呜祖啦 (2010 南非世界杯助威工具) 雅虎发表的主题演讲阐述了他们的使用规模,贡献的技术方向,以及他们如何应用这项技术的架构模式。

显而易见, Hadoop 受到越来越多的关注:今年的会议有 1000 人参加并且门票在会前 10 天就告售罄,人数较前年的 300,去年的 650 有大幅的增长。Java 之父,James Gosling 也参加了该会议。这次会议标志着 Hadoop 5 周年(大约)。Irving 指出世界上只有 5% 的数据是结构化的,而非结构化数据一直保持极大的增长,这些新产生的数据的特点是更多的瞬时性。他强调 Yahoo 使用 Hadoop 来分析每一个页面点击并优化内容的排名,每 7 分钟更新一次结果。他指出“我们相信 Hadoop 已经为主流企业的应用做好了准备”。

雅虎的云计算高级副总裁,Shelton Shugar 指出,雅虎每天为 1000 亿事件产生 120TB 数据输入,目前储存了 70PB, 而其最高存储容量是 170PB。雅虎每天处理 3PB 数据,每个月在 38000 台服务器上运行超过百万个任务。由于雅虎的 Hadoop 的使用范围不断扩大,他们已经需要为主流应用程序员作为准备,建立支持提供和更好的管理工具和数据安全。他指出,雅虎在生产环境中将 Hadoop 应用于各种产品:

  • 数据分析
  • 内容优化
  • 雅虎公司反垃圾邮件
  • 广告产品
  • 广告优化
  • 广告选择
  • 大数据处理和 ETL

雅虎还在其应用科研中大量使用 Hadoop,比如:

  • 用户兴趣预测
  • 广告库存预测
  • 搜索排名
  • 广告定位
  • 垃圾邮件过滤

Eric Baldeschwiele,雅虎 Hadoop 软件开发副总裁指出,在去年雅虎已经:

  • 把他们的集群从每个 2000 节点增加到 4000 个节点
  • 受惠于摩尔定律带来的 CPU 计算能力增加,每个节点的任务数翻了一倍
  • 现在有超过 80%的磁盘利用率,通常 50-60%的 CPU 使用率,并且数据使用的增长速度高于处理使用
  • 贡献了超过 70%的 Hadoop 补丁

他们在去年的重点是改善 Hadoop 的 map-reduce, 这包括:

  • 一个新的容量调度程序
  • 任务跟踪的稳定性和支持混合工作负载的健壮性
  • 增加资源的使用的限制:安全围栏 (safety rails)

现在他们的重点是开发 Hadoop 的分布式文件系统,HDFS:

  • 在他们的每一个集群节点的存储现在是 12TB。他们现正兴建一个 48PB 的集群 - 由于 Name 节点可伸缩性的限制,“这对 Hadoop 来说是颠覆性的 “
  • 提高内存,连接和缓冲区的使用,并提供度量的体系。
  • 把存储拆分成一组文件卷集(使用多个 HDFS 集群)
  • 在 Hadoop 的下一个主要版本将会发布跨 HDFS 实例的联合存储

Baldeschwieler 解释雅虎如何个性化他们的主页:

  • 实时服务系统使用 Apache 从数据库中读取从 user 到 interest 的映射
  • 每隔 5 分钟,他们使用生产环境中的 Hadoop 集群基于最新数据重新排列内容,并每 7 分钟更新结果
  • 每个星期,他们在 Hadoop 科研集群上重新计算他们关于类别的机器学习模式

雅虎 Mail 以类似的方式使用 Hadoop:

  • 在生产集群上频繁根据垃圾邮件模式为邮件计分
  • 每隔几个小时在科研集群上训练反垃圾邮件模型。
  • 该系统每天推动 50 亿次的邮件投递,覆盖了 4.5 亿个邮箱

因为 HDFS 有一个单点故障(Name 节点),这对高可用性生产系统来说是个风险。为了减轻该风险,雅虎将数据复制到多个群集,因此分布式文件系统的中断可以使用备份文件系统来弥补和解决。在雅虎的演讲中, 除了自己的 Pig 项目,他们表示正在使用 Hadoop 的 Hive 项目。

Baldeschwieler 宣布,雅虎已经发布了 Hadoop Security 的 Beta 测试版,它使用 Kerberos 进行身份验证,并允许在同一集群托管商业敏感数据。他们还发布了 Oozie ,一个 Hadoop 的工作流引擎,这已在雅虎成为事实上的 ETL 标准。它集成了 MapReduce,HDFS,Pig 和 Hadoop Security。

总体而言,雅虎展示了其在 Hadoop 技术的持续领导地位,与此同时他们感到高兴的是,领先的互联网公司和独立技术供应商纷纷加入到了这一生态系统当中来。

查看英文原文: Yahoo! Updates from Hadoop Summit 2010

2010-07-15 02:223377
用户头像

发布了 42 篇内容, 共 17.8 次阅读, 收获喜欢 5 次。

关注

评论

发布
暂无评论
发现更多内容

吐血整理:推荐几款顶级好用的IDEA插件

Silently9527

Java intellij-idea idea插件

产品经理训练营第二周作业-利益相关者

隋泽

产品经理训练营

认识产品经理

ALone

JVM 垃圾收集算法

看山

JVM 垃圾回收算法

LeetCode题解:105. 从前序与中序遍历序列构造二叉树,Simple O(n) without map,JavaScript,详细注释

Lee Chen

算法 大前端 LeetCode

学习“利益相关者”后对自己工作的一点思考

隋泽

时间复杂度与常见排列算法

Changing Lin

算法

「架构师训练营 4 期」 第四周 - 002

凯迪

【JS】Array.from() 将伪数组转换成数组

德育处主任

JavaScript js ES6 array 28天写作

Java-可重入锁

hepingfly

Java 可重入锁

【JS】Array.of() 创建数组

德育处主任

JavaScript 大前端 js ES6 28天写作

线程的三种等待唤醒机制(面试必问)

hepingfly

Java 线程 等待唤醒

云游戏的那些事儿!读《大厂们的下一件大事儿》有感

李忠良

28天写作

微信直播也有跳舞小姐姐了 | 视频号28天(17)

赵新龙

28天写作

第二章作业

DF

JavaScript07 - 流程控制语句

Mr.Cactus

JavaScript

【函数计算实践】一个应用案例

程序员架构进阶

阿里云 架构 项目实战 函数计算 28天写作

请用思维导图画出架构师训练营所有技术知识点

DL

Python 中 lru_cache 的使用和实现

zikcheng

Python 源码分析 LRU

GNUCash 2: 缺点

lidaobing

GNUCash 28天写作

架构师训练营第四周作业 - 命题作业

阿德儿

开发质量提升系列:checklist投产检查列表(上)

罗小龙

代码质量 28天写作 checklist

如何基于海思芯片快速搭建Agora RTC应用

Hanson

WebRTC

架构师训练营 4 期 第4周

引花眠

架构师训练营 4 期

JavaScript06 - 操作符

Mr.Cactus

JavaScript

第九周作业

Binary

产品 0 期 - 第一章作业

让时间说真话

产品经理

批判性思维自修课(一)

石君

28天写作 批判性思维

大数据知识专栏 - 数据仓库

小马哥

大数据 hive 数据仓库 七日更

JavaScript08 - 数组

Mr.Cactus

JavaScript

【CSS】页面顶部阴影

德育处主任

CSS 大前端 html/css CSS小技巧 28天写作

雅虎! 来自Hadoop峰会的最新更新_架构_Ron Bodkin_InfoQ精选文章