AICon 上海站|90%日程已就绪,解锁Al未来! 了解详情
写点什么

雅虎! 来自 Hadoop 峰会的最新更新

  • 2010-07-15
  • 本文字数:1557 字

    阅读完需:约 5 分钟

雅虎首席产品官 Blake Irving 吹响了 2010 Hadoop 峰会的呜呜祖啦 (2010 南非世界杯助威工具) 雅虎发表的主题演讲阐述了他们的使用规模,贡献的技术方向,以及他们如何应用这项技术的架构模式。

显而易见, Hadoop 受到越来越多的关注:今年的会议有 1000 人参加并且门票在会前 10 天就告售罄,人数较前年的 300,去年的 650 有大幅的增长。Java 之父,James Gosling 也参加了该会议。这次会议标志着 Hadoop 5 周年(大约)。Irving 指出世界上只有 5% 的数据是结构化的,而非结构化数据一直保持极大的增长,这些新产生的数据的特点是更多的瞬时性。他强调 Yahoo 使用 Hadoop 来分析每一个页面点击并优化内容的排名,每 7 分钟更新一次结果。他指出“我们相信 Hadoop 已经为主流企业的应用做好了准备”。

雅虎的云计算高级副总裁,Shelton Shugar 指出,雅虎每天为 1000 亿事件产生 120TB 数据输入,目前储存了 70PB, 而其最高存储容量是 170PB。雅虎每天处理 3PB 数据,每个月在 38000 台服务器上运行超过百万个任务。由于雅虎的 Hadoop 的使用范围不断扩大,他们已经需要为主流应用程序员作为准备,建立支持提供和更好的管理工具和数据安全。他指出,雅虎在生产环境中将 Hadoop 应用于各种产品:

  • 数据分析
  • 内容优化
  • 雅虎公司反垃圾邮件
  • 广告产品
  • 广告优化
  • 广告选择
  • 大数据处理和 ETL

雅虎还在其应用科研中大量使用 Hadoop,比如:

  • 用户兴趣预测
  • 广告库存预测
  • 搜索排名
  • 广告定位
  • 垃圾邮件过滤

Eric Baldeschwiele,雅虎 Hadoop 软件开发副总裁指出,在去年雅虎已经:

  • 把他们的集群从每个 2000 节点增加到 4000 个节点
  • 受惠于摩尔定律带来的 CPU 计算能力增加,每个节点的任务数翻了一倍
  • 现在有超过 80%的磁盘利用率,通常 50-60%的 CPU 使用率,并且数据使用的增长速度高于处理使用
  • 贡献了超过 70%的 Hadoop 补丁

他们在去年的重点是改善 Hadoop 的 map-reduce, 这包括:

  • 一个新的容量调度程序
  • 任务跟踪的稳定性和支持混合工作负载的健壮性
  • 增加资源的使用的限制:安全围栏 (safety rails)

现在他们的重点是开发 Hadoop 的分布式文件系统,HDFS:

  • 在他们的每一个集群节点的存储现在是 12TB。他们现正兴建一个 48PB 的集群 - 由于 Name 节点可伸缩性的限制,“这对 Hadoop 来说是颠覆性的 “
  • 提高内存,连接和缓冲区的使用,并提供度量的体系。
  • 把存储拆分成一组文件卷集(使用多个 HDFS 集群)
  • 在 Hadoop 的下一个主要版本将会发布跨 HDFS 实例的联合存储

Baldeschwieler 解释雅虎如何个性化他们的主页:

  • 实时服务系统使用 Apache 从数据库中读取从 user 到 interest 的映射
  • 每隔 5 分钟,他们使用生产环境中的 Hadoop 集群基于最新数据重新排列内容,并每 7 分钟更新结果
  • 每个星期,他们在 Hadoop 科研集群上重新计算他们关于类别的机器学习模式

雅虎 Mail 以类似的方式使用 Hadoop:

  • 在生产集群上频繁根据垃圾邮件模式为邮件计分
  • 每隔几个小时在科研集群上训练反垃圾邮件模型。
  • 该系统每天推动 50 亿次的邮件投递,覆盖了 4.5 亿个邮箱

因为 HDFS 有一个单点故障(Name 节点),这对高可用性生产系统来说是个风险。为了减轻该风险,雅虎将数据复制到多个群集,因此分布式文件系统的中断可以使用备份文件系统来弥补和解决。在雅虎的演讲中, 除了自己的 Pig 项目,他们表示正在使用 Hadoop 的 Hive 项目。

Baldeschwieler 宣布,雅虎已经发布了 Hadoop Security 的 Beta 测试版,它使用 Kerberos 进行身份验证,并允许在同一集群托管商业敏感数据。他们还发布了 Oozie ,一个 Hadoop 的工作流引擎,这已在雅虎成为事实上的 ETL 标准。它集成了 MapReduce,HDFS,Pig 和 Hadoop Security。

总体而言,雅虎展示了其在 Hadoop 技术的持续领导地位,与此同时他们感到高兴的是,领先的互联网公司和独立技术供应商纷纷加入到了这一生态系统当中来。

查看英文原文: Yahoo! Updates from Hadoop Summit 2010

2010-07-15 02:223522
用户头像

发布了 42 篇内容, 共 18.6 次阅读, 收获喜欢 5 次。

关注

评论

发布
暂无评论
发现更多内容

KubeCon China 2023 | 以开源促进智能世界底座共建,给世界提供更好选择

新消费日报

苹果电脑pdf文档大小压缩推荐 PDF Squeezer激活中文最新版

胖墩儿不胖y

Mac软件 pdf编辑器 pdf处理工具

【稳定性】秘密武器--功能开关技术 | 京东物流技术团队

京东科技开发者

稳定性 企业号9月PK榜 功能开关

CPU性能指标简览

DevOps和数字孪生

仿真建模 CPU性能

软件测试/测试开发丨岗位内推-58同城岗位开放

测试人

软件测试 招聘 校招 岗位内推

基于Java开发的工作流系统(springboot+activiti源码)

金陵老街

springboot Activit

中秋国庆花式玩法,用低代码DIY假日大屏“Vlog”

华为云开发者联盟

低代码 开发 华为云 华为云开发者联盟 企业号9月PK榜

元服务助力山东舜和酒店数字化转型,促鸿蒙生态繁荣!

最新动态

MAC手动修复『已损坏』问题 终端运行命令报错处理

展初云

Mac Mac软件

1分钟完成1000万key数据对比

NineData

redis Redis 核心技术与实战 redis 精讲 数据对比 NineData

徐刚:AIGC时代,人力资源数智化的关键趋势与应对

用友BIP

人力资源 AIGC

英伟达张玮东:NVIDIA核心GPU技术与软件生态助力大模型开发和部署

TRaaS

英伟达 大模型训练

Petal 出行新人超值百元大礼包,中秋国庆优惠等你领!

最新动态

强强联合!天翼云与神州信息共助银行数字化转型升级!

天翼云开发者社区

数据库 云计算

【AIGC】只要10秒,AI生成IP海报,解放双手!!! | 京东云技术团队

京东科技开发者

人工智能 IP AIGC 企业号9月PK榜

AI编程助手工具,走过路过别错过

飞算JavaAI开发助手

关于 TDengine 的论文资料都在这里了,等你来取!

TDengine

时序数据库 国产数据库 ​TDengine

打造香港最安全便捷的银行,众安银行发布首份技术白皮书

ZA技术社区

科技 众安保险 ZA Bank 虚拟银行

“开放原子开源大赛”来袭, inBuilder低代码开发创新赛火热报名中!

inBuilder低代码平台

Mac如何内录系统声音

展初云

录屏 Mac软件

实战指南,SpringBoot + Mybatis 如何对接多数据源

华为云开发者联盟

大数据 华为云 华为云开发者联盟 企业号9月PK榜

分分钟搞定来源list添加到目标list,据说只要5%的人知道

飞算JavaAI开发助手

ARTS-week7(23.9.25-23.9.30)

Echo!!!

牵引数字经济重要增长极,天翼云智能边缘云助力元宇宙加速发展!

天翼云开发者社区

云计算

雅虎! 来自Hadoop峰会的最新更新_架构_Ron Bodkin_InfoQ精选文章