从kafka的0.8.11版本开始,它会将consumer的offset提交给ZooKeeper。然而当offset的数量(consumer数量 * partition的数量)的很多的时候,ZooKeeper的适应性就可能会出现不足。幸运的是,Kafka现在提供了一种理想的机制来存储Consumer的offset。Kafka现在是将Consumer的offset…
HBase连接异常:KeeperErrorCode = OperationTimeout
手上的一个HBase相关的服务在重启后开始报错(重启前运行良好),错误信息如下:
|
1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 |
2017-04-25 16:57:59 [org.apache.hadoop.hbase.zookeeper.RecoverableZooKeeper.retryOrThrow] [ERROR] ZooKeeper exists failed |
使用HBase Coprocessor
HBase的Coprocessor是模仿谷歌BigTable的Coprocessor模型实现的。
Coprocessor提供了一种机制可以让开发者直接在RegionServer上运行自定义代码来管理数据。
首先必须要指明使用Coprocessor还是存在一些风险的。Coprocessor是HBase的高级功能,本来是只为HBase系统开发人员准备的。因为Copr…
使用BufferedMutator
org.apache.hadoop.hbase.client.BufferedMutator主要用来对HBase的单个表进行操作。它和Put类的作用差不多,但是主要用来实现批量的异步写操作。
BufferedMutator替换了HTable的setAutoFlush(false)的作用。
可以从Connection的实例中获取BufferedMutator的实例…
译文:HBase File Locality in HDFS
Hadoop中一个不明确的内容就是Block复制:它自动完成,通常不需要用户关心。HBase将数据保存到HDFS,并完全相信它的安全性。正是因为HDFS的Block复制对HBase来说是完全透明的,就产生了一个问题:HBase的效率会受到多大的影响?当我们开始写MapReduce作业访问HBase和Hadoop的时候,就难免会想到这个问题。尤为关键的是,当H…
HBase Region Locality
因为DataNode和RegionServer通常会部署在相同的机器上,所以会产生Locality这样的概念。
HBase的Locality是通过HDFS的Block复制实现的。在复制Block时,HBase是这样选择副本的位置的:
- 第一个副本写到本地节点上;
- 第二个副本写到另一个机架的随机节点上;
- 第三个副本写到相同机架的一个随机选择的其他节点上;
- 如果还有更多的副
使用HBase总结
前段时间我们在项目中使用了HBase,在这里记一下使用经历或者说踩过的坑。
RowKey设计
我们读取数据的方式主要是批量查询,因此在最初的设计中就将大部分查询字段放在了RowKey上,目的是利用RowKey作为索引的特性。
关于RowKey的设计,通常有要求唯一性、散列性以及尽量短。我们在设计RowKey时也尽量地按照这三个原则去做。为了保证唯一性,也想过直接将…
HBase Bulk Load
概述
BulkLoad是一种高效写入HBase的方式,适用于将数据批量迁移到HBase。
BulkLoad使用MapReduce作业直接生成HBase的StoreFile,并将生成的StoreFile直接装载入正在运行的HBase集群。较之使用HBase的API,使用BulkLoad耗费的CPU和网络资源都相对较少。
因为BulkLoad绕过了正常写数据的路径(W…
hbase.fs.tmp.dir 导致的错误
在执行BulkLoad的时候报了如下的错误:
|
1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 |
Exception in thread "main" java.lang.IllegalArgumentException: Can not create a Path from a null string at org.apache.hadoop.fs.Path.checkPathArg(Path |
HBase自定义Filter
必需要提前说明下:不建议使用自定义的Filter。所有的Filter都是在服务端生效:就是说需要将自定义的Filter封装为jar,上传到HBase的类路径下,并重启HBase使之生效。对于生产环境的HBase来说,重启通常是不能接受的。
Filter的设置是在客户端完成的,而Filter的逻辑是在HBase的服务端完成的,中间需要一次序列化。我试过几种序列化…