写点什么

从 HDFS 迁移到基于 Amazon S3 的 Apache HBase 的技巧

  • 2019-12-16
  • 本文字数:3085 字

    阅读完需:约 10 分钟

从 HDFS 迁移到基于 Amazon S3 的 Apache HBase 的技巧


Amazon EMR 5.2.0 开始,您可以选择基于


Amazon S3 上的 Apache HBase。在


S3 上运行 HBase 可为您额外带来多项优势,包括降低成本、数据持久性和更轻松地进行扩展。HBase 提供了多个可用于迁移和备份 HBase 表的选项。迁移到 S3 上的 HBase 的步骤与适用于 Apache Hadoop 分布式文件系统 (HDFS) 上的 HBase 的步骤类似。但是,如果您知道一些细微差别和一些“技巧”,则迁移会更容易。在本文中,我将介绍如何使用一些常用的 HBase 迁移选项开始使用 S3 上的 HBase。

HBase 迁移选项

选择正确的迁移方法和工具是确保 HBase 表成功迁移的重要步骤。但是,选择正确的迁移方法绝非易事。


以下 HBase 可帮助您迁移到 S3 上的 HBase:


  • 快照

  • 导出和导入

  • CopyTable


下图汇总了每个选项的步骤。



您使用的 HBase 迁移方法取决于各种因素。例如,EMR 提供的 HBase 版本 1.2.3 是您可在 S3 上运行的最早版本。因此,您要从中迁移的 HBase 版本可能是帮助您做出决定的重要因素。有关 HBase 版本和兼容性的更多信息,请参阅 _Apache HBase 参考指南_中的 HBase 版本号和兼容性


如果要从较早版本(例如 HBase 0.94)的 HBase 迁移,则应测试应用程序以确保其与较新的 HBase API 版本兼容。您肯定不想花费数小时迁移大型表,而只想了解您的应用程序和 API 是否与不同 HBase 版本兼容。


好消息是,HBase 提供的实用工具只需要迁移表的一部分。这可让您测试现有的 HBase 应用程序,而无需完全迁移整个 HBase 表。例如,可以使用“导出”、“导入”或“CopyTable”实用工具将表的一小部分迁移到 S3 上的 HBase。确认应用程序适用较新的 HBase 版本后,可以继续使用 HBase 快照迁移整个表。

选项 1:使用快照迁移到 S3 上的 HBase

您可以使用 HBase 快照轻松创建表备份。HBase 还提供 ExportSnapshot 实用工具,可让您将快照导出到其他位置,如 S3。在本部分,我将讨论如何将快照与 ExportSnapshot 结合使用,将表迁移到 S3 上的 HBase。


有关使用 HBase 快照执行表备份的详细信息,请参阅 _Amazon EMR 发行指南_中的使用 HBase 快照以及 _Apache HBase 参考指南_中的 HBase 快照。这些资源提供了可用于快照和 ExportSnapshot 的其他设置和配置。


以下示例说明了如何使用快照将 HBase 表迁移到 S3 上的 HBase。


注意:HBase 0.94 等较早的 HBase 版本的快照结构与您要迁移到的 HBase 1.x 的快照结构不同。如果您使用快照从 HBase 0.94 迁移,当您尝试恢复表时,会收到 TableInfoMissingException 错误。有关使用快照从 HBase 0.94 迁移的详细信息,请参阅从 HBase 0.94 迁移部分。


  1. 从源 HBase 集群中,创建表的快照:


   $ echo "snapshot '<table_name>', '<snapshot_name>'" | hbase shell
复制代码


  1. 将快照导出到 S3 存储桶:


   $ hbase org.apache.hadoop.hbase.snapshot.ExportSnapshot -snapshot <snapshot_name> -copy-to s3://<HBase_on_S3_root_dir>/
复制代码


对于 **ExportSnapshot** 实用工具中的 _-copy-to_ 参数,请指定您用于 EMR 集群 HBase root 目录的 S3 位置。如果您的集群已启动且正在运行,您可以通过在 EMR 控制台中查看集群的**配置** 或使用 AWS CLI 来查找其 S3 **hbase.rootdir** 值。以下是用于查找该值的命令:
复制代码


   $ aws emr describe-cluster --cluster-id <cluster_id> | grep hbase.rootdir
复制代码


  1. 启动一个将 S3 存储选项与 HBase 配合使用的 EMR 集群(如果您已启动并运行某个 EMR 集群,请跳过此步骤)。有关详细步骤,请参阅 _Amazon EMR 发行指南_中的通过控制台使用 HBase 创建集群。启动集群时,请确保 HBase root 目录设置为与导出的快照位于同一 S3 位置(即在上一步的 -copy-to 参数中使用的位置)。

  2. 从该快照恢复或克隆 HBase 表。

  3. 要恢复表并确保表名称与源表相同,请使用 restore_snapshot


       $ echo "restore_snapshot '<SNAPSHOT_NAME>'"| hbase shell
复制代码


* 要以其他表名称恢复表,请使用 **clone_snapshot**: 
复制代码


       $ echo "clone_snapshot '<snapshot_name>', '<table_name>'" | hbase shell
复制代码

使用快照从 HBase 0.94 迁移

如果使用快照方法从 HBase 版本 0.94 迁移,则在尝试从快照恢复时会收到错误。这是因为 HBase 0.94 中的快照结构与 HBase 1.x 中的快照结构不同。


以下步骤说明了如何修复 HBase 0.94 快照,以便将其恢复到 S3 上的 HBase 表。


  1. 完成上一示例中的步骤 1 至 3 以创建和导出快照。

  2. 在目标集群中,按照以下步骤修复快照:

  3. 使用 s3-dist-cp 将快照数据(存档)目录复制到新目录中。存档目录包含您的快照数据。目录可能会很大,具体取决于表的大小。使用 s3-dist-cp 可以加快此步骤的速度:


       $ s3-dist-cp --src s3://<HBase_on_S3_root_dir>/.archive/<table_name> --dest s3://<HBase_on_S3_root_dir>/archive/data/default/<table_name>
复制代码


* 创建并修复快照描述符文件: 
复制代码


       $ hdfs dfs -mkdir s3://<HBase_on_S3_root_dir>/.hbase-snapshot/<snapshot_name>/.tabledesc
$ hdfs dfs -mv s3://<HBase_on_S3_root_dir>/.hbase-snapshot/<snapshot_name>/.tableinfo.<*> s3://<HBase_on_S3_root_dir>/.hbase-snapshot/<snapshot_name>/.tabledesc
复制代码


  1. 恢复快照:


   $ echo "restore_snapshot '<snapshot_name>'" | hbase shell
复制代码

选项 2:使用“导出”和“导入”迁移到 S3 上的 HBase

正如我在前面部分探讨的,HBase 快照和 ExportSnapshot 是迁移表的理想之选。但有时您只想迁移表的其中一部分,因此您需要其他工具。在本部分,我将介绍如何使用 HBase“导出”和“导入”实用工具。


使用“导出”和“导入”将表迁移到 S3 上的 HBase 的步骤与 HBase 文档中提供的步骤没有太大差异。在这些文档中,您还可以找到详细信息,包括如何使用它们迁移表的一部分。


以下步骤说明了如何使用导出”和“导入”将表迁移到 S3 上的 HBase。


  1. 从源集群导出 HBase 表:


   $ hbase org.apache.hadoop.hbase.mapreduce.Export <table_name> s3://<table_s3_backup>/<location>/
复制代码


  1. 在目标集群中,创建要向其中导入数据的目标表。确保目标表中的列系列与导出的表/源表的列系列相同。

  2. 在目标集群中,使用“导入”实用工具导入表:


   $ hbase org.apache.hadoop.hbase.mapreduce.Import '<table_name>' s3://<table_s3_backup>/<location>/
复制代码


通常情况下,建议使用 HBase 快照迁移 HBase 表。但是,“导出”和“导入”实用工具对于测试使用案例非常有用,在这些情况下,只需迁移一小部分表并测试应用程序。如果您从没有 HBase 快照功能的 HBase 集群迁移,这也很方便。

选项 3:使用 CopyTable 迁移到 S3 上的 HBase

与“导出”和“导入”实用工具类似,CopyTable 是一个 HBase 实用工具,可用于复制 HBase 表的其中一部分。但请注意,如果您在无法兼容的 HBase 版本之间复制或迁移表(例如,从 HBase 0.94 复制到 HBase 1.x),CopyTable 无法使用。


有关更多信息和示例,请参阅 HBase 文档中的 CopyTable

小结

在本文中,我演示了如何使用常用 HBase 备份实用工具轻松将表迁移到 S3 上的 HBase。通过使用 HBase 快照,可以将整个表迁移到 S3 上的 HBase。要通过仅迁移或复制表的其中一部分来测试 S3 上的 HBase,可以使用 HBase“导出”、“导入”或“CopyTable”实用工具。


如果您有任何问题或建议,请在下方留言。




作者介绍:


Bruno Faria 是 AWS 的 EMR 解决方案架构师。 他与我们的客户合作,为他们在 Amazon EMR 上运行复杂应用程序提供架构方面的指导。在业余时间,他喜欢与家人共度时光和学习新的大数据解决方案。


本文转载自 AWS 技术博客。


原文链接:https://amazonaws-china.com/cn/blogs/china/tips-for-migrating-to-apache-hbase-on-amazon-s3-from-hdfs/


2019-12-16 15:491307

评论

发布
暂无评论
发现更多内容

实时大数据Flink知识结构(超全整理,附知识脑图)

大象灵感

大数据 flink spark 实时数仓 流处理

华为云网络覆盖全球2500+站点,打造高品质、低成本接入体验

华为云开发者联盟

RTC 华为云 媒体服务 LiveVideoStack

2021年10月国产数据库流行度排行解读 浅谈基础软件发展之道

墨天轮

数据库 华为 opengauss Gauss DB 国产数据库

业内首款云原生技术中台产品云原生 Stack 来了!

阿里巴巴云原生

阿里云 云原生 技术中台

Redis核心原理与实践--Redis启动过程源码分析

binecy

redis 源码阅读

iOS 崩溃日志在线符号化实践

百度Geek说

Vue进阶(幺伍叁):Vue-highlight 实现代码高亮

No Silver Bullet

Vue highlight.js 10月月更

OKR与影响地图,别再傻傻分不清

华为云开发者联盟

OKR 敏捷 影响地图 规划 目标

游戏数字资产复用——有哪些是你需要知道的?

龙智—DevSecOps解决方案

游戏开发 游戏引擎 perforce

这一篇 K8S(Kubernetes)我觉得可以了解一下!!!

牧小农

Docker 容器 kubenetes

企业级开发工具,J2PaaS低代码平台核心能力解析!

J2PaaS低代码平台

软件开发 低代码 低代码开发 低代码平台

模块一作业

Geek_1d37ea

【IT运维小知识】安全组是什么意思?

行云管家

网络安全 安全 数据安全 安全组 IT运维

如何赋能APaaS平台应用管理员

明道云

短短 146 天就成为 Apache APISIX Committer,我是怎么做到的?

API7.ai 技术团队

成长笔记 API网关 社区 Apache APISIX

医药研发企业数据中台的选择

鲸品堂

产业互联网

Linux指令日志分析(一)

正向成长

日志分析

学习总结(第一周)

Geek_1d37ea

架构实战营

网易云信被纳入 Gartner 2021年《CPaaS 市场指南》研究报告

网易云信

音视频 云通信 Gartner

网络生病了怎么办?看华为云网络测量如何“悬丝诊脉”

华为云开发者联盟

华为云 云网络 网络故障 网络测量 SDN架构

网易云音乐音视频算法的 Serverless 探索之路

阿里巴巴中间件

云计算 阿里云 Serverless 云原生 中间件

以开发之名 | 美好出行体验,“管家”一站实现

最新动态

IOS技术分享| ARCall视频通话重构

anyRTC开发者

ios 音视频 语音通话 视频通话 视频呼叫

官方线索 | 阿里云1024程序员创造营

穿过生命散发芬芳

1024我在现场

代码简洁之道:一行Python代码解决问题是时尚还是玄学

博文视点Broadview

只需2步,教你在Vue中设置登录验证拦截

华为云开发者联盟

Vue 浏览器 Token pringboot 登录验证

Flux架构思想在度咔App中的实践

百度Geek说

百度 架构 后端 短视频 Flux

阿里二面:为什么要分库分表?

Java MySQL 数据库 架构 面试

敏捷QA需要编写测试用例吗?

BY林子

测试用例 敏捷测试

数仓无损压缩算法:gzip算法

华为云开发者联盟

算法 deflate 无损 gzip 压缩数据

引导行业发展!旺链科技加入“可信区块链推进计划”

旺链科技

区块链 数字经济 产业区块链

从 HDFS 迁移到基于 Amazon S3 的 Apache HBase 的技巧_文化 & 方法_亚马逊云科技 (Amazon Web Services)_InfoQ精选文章