写点什么

雅虎! 来自 Hadoop 峰会的最新更新

  • 2010-07-15
  • 本文字数:1557 字

    阅读完需:约 5 分钟

雅虎首席产品官 Blake Irving 吹响了 2010 Hadoop 峰会的呜呜祖啦 (2010 南非世界杯助威工具) 雅虎发表的主题演讲阐述了他们的使用规模,贡献的技术方向,以及他们如何应用这项技术的架构模式。

显而易见, Hadoop 受到越来越多的关注:今年的会议有 1000 人参加并且门票在会前 10 天就告售罄,人数较前年的 300,去年的 650 有大幅的增长。Java 之父,James Gosling 也参加了该会议。这次会议标志着 Hadoop 5 周年(大约)。Irving 指出世界上只有 5% 的数据是结构化的,而非结构化数据一直保持极大的增长,这些新产生的数据的特点是更多的瞬时性。他强调 Yahoo 使用 Hadoop 来分析每一个页面点击并优化内容的排名,每 7 分钟更新一次结果。他指出“我们相信 Hadoop 已经为主流企业的应用做好了准备”。

雅虎的云计算高级副总裁,Shelton Shugar 指出,雅虎每天为 1000 亿事件产生 120TB 数据输入,目前储存了 70PB, 而其最高存储容量是 170PB。雅虎每天处理 3PB 数据,每个月在 38000 台服务器上运行超过百万个任务。由于雅虎的 Hadoop 的使用范围不断扩大,他们已经需要为主流应用程序员作为准备,建立支持提供和更好的管理工具和数据安全。他指出,雅虎在生产环境中将 Hadoop 应用于各种产品:

  • 数据分析
  • 内容优化
  • 雅虎公司反垃圾邮件
  • 广告产品
  • 广告优化
  • 广告选择
  • 大数据处理和 ETL

雅虎还在其应用科研中大量使用 Hadoop,比如:

  • 用户兴趣预测
  • 广告库存预测
  • 搜索排名
  • 广告定位
  • 垃圾邮件过滤

Eric Baldeschwiele,雅虎 Hadoop 软件开发副总裁指出,在去年雅虎已经:

  • 把他们的集群从每个 2000 节点增加到 4000 个节点
  • 受惠于摩尔定律带来的 CPU 计算能力增加,每个节点的任务数翻了一倍
  • 现在有超过 80%的磁盘利用率,通常 50-60%的 CPU 使用率,并且数据使用的增长速度高于处理使用
  • 贡献了超过 70%的 Hadoop 补丁

他们在去年的重点是改善 Hadoop 的 map-reduce, 这包括:

  • 一个新的容量调度程序
  • 任务跟踪的稳定性和支持混合工作负载的健壮性
  • 增加资源的使用的限制:安全围栏 (safety rails)

现在他们的重点是开发 Hadoop 的分布式文件系统,HDFS:

  • 在他们的每一个集群节点的存储现在是 12TB。他们现正兴建一个 48PB 的集群 - 由于 Name 节点可伸缩性的限制,“这对 Hadoop 来说是颠覆性的 “
  • 提高内存,连接和缓冲区的使用,并提供度量的体系。
  • 把存储拆分成一组文件卷集(使用多个 HDFS 集群)
  • 在 Hadoop 的下一个主要版本将会发布跨 HDFS 实例的联合存储

Baldeschwieler 解释雅虎如何个性化他们的主页:

  • 实时服务系统使用 Apache 从数据库中读取从 user 到 interest 的映射
  • 每隔 5 分钟,他们使用生产环境中的 Hadoop 集群基于最新数据重新排列内容,并每 7 分钟更新结果
  • 每个星期,他们在 Hadoop 科研集群上重新计算他们关于类别的机器学习模式

雅虎 Mail 以类似的方式使用 Hadoop:

  • 在生产集群上频繁根据垃圾邮件模式为邮件计分
  • 每隔几个小时在科研集群上训练反垃圾邮件模型。
  • 该系统每天推动 50 亿次的邮件投递,覆盖了 4.5 亿个邮箱

因为 HDFS 有一个单点故障(Name 节点),这对高可用性生产系统来说是个风险。为了减轻该风险,雅虎将数据复制到多个群集,因此分布式文件系统的中断可以使用备份文件系统来弥补和解决。在雅虎的演讲中, 除了自己的 Pig 项目,他们表示正在使用 Hadoop 的 Hive 项目。

Baldeschwieler 宣布,雅虎已经发布了 Hadoop Security 的 Beta 测试版,它使用 Kerberos 进行身份验证,并允许在同一集群托管商业敏感数据。他们还发布了 Oozie ,一个 Hadoop 的工作流引擎,这已在雅虎成为事实上的 ETL 标准。它集成了 MapReduce,HDFS,Pig 和 Hadoop Security。

总体而言,雅虎展示了其在 Hadoop 技术的持续领导地位,与此同时他们感到高兴的是,领先的互联网公司和独立技术供应商纷纷加入到了这一生态系统当中来。

查看英文原文: Yahoo! Updates from Hadoop Summit 2010

2010-07-15 02:223455
用户头像

发布了 42 篇内容, 共 18.2 次阅读, 收获喜欢 5 次。

关注

评论

发布
暂无评论
发现更多内容

iOS分发证书过期或手动吊销,会影响App的下架吗?

雪奈椰子

TDengine 发布 IoT 场景下 3.0 性能对比分析报告,全方位超越 InfluxDB & TimescaleDB

爱倒腾的程序员

涛思数据 时序数据库 ​TDengine

处理开发者账号到期导致APP下架的方处理开发者账号到期导致APP下架的方法

雪奈椰子

数字化催生新文化,JNPF加速开发平台带来共赢未来!

EquatorCoco

低代码 数字化 新文化

程序员们集体诟病,低代码真的如此不堪?

伤感汤姆布利柏

在找稳定的企业级数据云平台?奇点云DataSimba R4.9 LTS发布

奇点云

产品升级 奇点云 数据基础设施 DataSimba

低代码助力内部系统开发

高端章鱼哥

低代码 系统开发 JNPF

特别呈现|腾讯云 X K+ 峰会共同打造软件工程新生态

CODING DevOps

探索智慧未来:JNPF低代码开发平台引领产业智能化革命!

加入高科技仿生人

低代码 智慧工厂 现代产业

窃取个人数据?OpenAI遭集体诉讼!"拯救数智化时代!低代码开发平台:打造信息安全的无敌守护者

不在线第一只蜗牛

低代码 信息安全 ChatGPT 数智时代

苹果开发者账号续费流程及苹果开发者账号续费流程及下架处理

雪奈椰子

一文了解PoseiSwap的质押系统

西柚子

SQL 优化(三):使用覆盖索引

hungxy

神级程序员,都在用哪些生产力工具?

互联网工科生

程序员 工具 生产力

用友:时序数据库要更懂业务场景

用友BIP

升级企业数智化底座,助力企业实现数智连接

用友BIP

数智底座

制造企业实施MES系统受到的影响因素有哪些?

优秀

MES系统

MySQL:无锁可扩展的 WAL 设计

互联网工科生

MySQL

走出舒适区吧,程序员们!

伤感汤姆布利柏

NFTScan 推出「NFTScan Connect」计划,支持早期 Web3 初创团队

NFT Research

#Web3

IM即时通讯APP在聊天场景中的应用

BeeWorks

强化学习从基础到进阶-案例与实践[5.1]:Policy Gradient策略梯度-Cart pole游戏展示

汀丶人工智能

人工智能 深度学习 强化学习 策略梯度

2023-06-30:给你一个 rows * cols 大小的矩形披萨和一个整数 k, 矩形包含两种字符: ‘A‘ (表示苹果)和 ‘.‘ (表示空白格子), 你需要切披萨 k-1 次,得到 k 块披

福大大架构师每日一题

Go 算法 rust Go 语言 福大大架构师每日一题

解放开发者——5个好用的低代码开发平台

树上有只程序猿

无法安装此app,因为无法验证其完整性 ,解决方案

雪奈椰子

全面揭秘!火山引擎边缘 IaaS 混合部署架构实践

火山引擎边缘云

IaaS 实践 火山引擎边缘云

golang 实现四层负载均衡

蓝胖子的编程梦

nginx 负载均衡 LVS MySQL 高可用 #go

对标世界一流!构建更适合国有企业的全面预算体系!

用友BIP

全面预算

Rainbond助力“信创应用”迁移上云

北京好雨科技有限公司

云原生 rainbond 信创云 企业号 7 月 PK 榜

雅虎! 来自Hadoop峰会的最新更新_架构_Ron Bodkin_InfoQ精选文章