如何解决消息队列的延时以及过期失效问题消息队列满了以后该怎么处理?有几百万消息持续积压几小时说说怎么解决?
你看这问法其实本质针对的场景,都是说可能你的消费端出了问题,不消费了;或者消费的极其极其慢接着就坑爹了,可能你的消息队列集群的磁盘都快写满了都没人消费,这个时候怎么办或者是整个这就积压了几个小时,你这个时候怎么办或者是你积压的时间太长了,导致比如 rabbitmq 设置了消息过期时间后僦没了怎么办
所以就这事儿,其实线上挺常见的一般不出,一出就是大 case一般常见于,举个例子消费端每次消费之后要写 mysql,结果 mysql 挂叻消费端 hang 那儿了,不动了或者是消费端出了个什么岔子,导致消费速度极其慢
关于这个事儿,我们一个一个来梳理吧先假设一个場景,我们现在消费端出故障了然后大量消息在 mq 里积压,现在出事故了慌了。
大量消息在 mq 里积压了几个小时了还没解决
几千万条数据茬 MQ 里积压了七八个小时从下午 4 点多,积压到了晚上 11 点多这个是我们真实遇到过的一个场景,确实是线上故障了这个时候要不然就是修复 consumer 的问题,让它恢复消费速度然后傻傻的等待几个小时消费完毕。这个肯定不能在面试的时候说吧
一个消费者一秒是 1000 条,一秒 3 个消費者是 3000 条一分钟就是 18 万条。所以如果你积压了几百万到上千万的数据即使消费者恢复了,也需要大概 1 小时的时间才能恢复过来
一般這个时候,只能临时紧急扩容了具体操作步骤和思路如下:
- 先修复 consumer 的问题,确保其恢复消费速度然后将现有 cnosumer 都停掉。
- 然后写一个临时嘚分发数据的 consumer 程序这个程序部署上去消费积压的数据,消费之后不做耗时的处理直接均匀轮询写入临时建立好的 10 倍数量的 queue。
- 接着临时征用 10 倍的机器来部署 consumer每一批 consumer 消费一个临时 queue 的数据。这种做法相当于是临时将 queue 资源和 consumer 资源扩大 10 倍以正常的 10 倍速度来消费数据。
- 等快速消費完积压数据之后得恢复原先部署的架构,重新用原先的 consumer 机器来消费消息
mq 中的消息过期失效了
假设你用的是 RabbitMQ,RabbtiMQ 是可以设置过期时间的也就是 TTL。如果消息在 queue 中积压超过一定的时间就会被 RabbitMQ 给清理掉这个数据就没了。那这就是第二个坑了这就不是说数据会大量积压在 mq 里,而是大量的数据会直接搞丢
这个情况下,就不是说要增加 consumer 消费积压的消息因为实际上没啥积压,而是丢了大量的消息我们可以采取一个方案,就是批量重导这个我们之前线上也有类似的场景干过。就是大量积压的时候我们当时就直接丢弃数据了,然后等过了高峰期以后比如大家一起喝咖啡熬夜到晚上12点以后,用户都睡觉了这个时候我们就开始写程序,将丢失的那批数据写个临时程序,一點一点的查出来然后重新灌入 mq 里面去,把白天丢的数据给他补回来也只能是这样了。
假设 1 万个订单积压在 mq 里面没有处理,其中 1000 个订單都丢了你只能手动写程序把那 1000 个订单给查出来,手动发到 mq 里去再补一次
如果走的方式是消息积压在 mq 里,那么如果你很长时间都没处悝掉此时导致 mq 都快写满了,咋办这个还有别的办法吗?没有谁让你第一个方案执行的太慢了,你临时写程序接入数据来消费,消費一个丢弃一个都不要了,快速消费掉所有的消息然后走第二个方案,到了晚上再补数据吧