小红书会给陈皓道歉,这是小红书的整改方案,你相信吗?
什么是变更?其实也有一些难以定义的地方,比如图上这次霸榜微博热搜的简单故障
代码运行几年了,没人动它,那天运行就是异常了,然后导致全网大故障
为什么不灰度?——业务:我都几年没动它,怎么去灰度?
你说冤不冤?
顯示更多
华为昨天的大故障,把客户的数据库实例、机器、网络实例全部关机6个小时以上,还有逼脸舔着去投诉,说不影响数据面,真是神经病,太不要脸了。
唯一幸运的是没有删除数据,应该是坏的不能再坏的一次故障。
顯示更多
我们以前碰到过几次 IDC 机房多条光纤被同时挖断的 case
如图 1,确实是围着 IDC 施工,结果 3 条光纤都挖断了
还有一次不是施工,也是同时断掉了几条光纤,最后分析下来怀疑是有人破坏,于是报警了,不过后续没有跟我同步
像这种问题我觉得都是可以理解也确实不是高频的
顯示更多
我这辈子碰到的诡异的 bug 里,选了 10 个,这个可以入选其中:
客户端如果使用本地 4790/4789 端口通过SLB 连云服务,有极低的概率被SLB 丢包(当云服务的回包 ACK号要同时满足,第5,6位,9-12位,25-32位分别为1,1,1, 4或1)。 上周数据库 ALB 已经关掉了这个逻辑(CLB 没关)
交易所A客户(持续2个多月)/上海 B 客户(持续一年多) 都在排查分析这个异常
4789/4790 是和云 vpc 特殊端口重叠,最后满足条件:交易所A客户(持续2个多月)/上海 B 客户(持续一年多) 的包被丢掉了,因为叠加起来这个 tcp 包被认为是个 udp 包
顯示更多
来说说昨天菊花云大故障,你司的机器是几点拉起来的,越早说明贵司越重要,排在后面的都是垃圾客户,哈哈哈哈
我先来,我司是 11 点左右逐步开始拉起
顯示更多
国内云厂商的公告写得还是非常外交部范,如图
非常简洁,虽然我以前骂 AWS 产品做得烂,但是 AWS 在事故公告/原因公示方面做得是最好的
公告地址: 大家去观摩
这份通告是 0726 凌晨 3 点多挂出来的,机器恢复是 0726 9 点之后的事情,而且从开始重启到启动完毕也耗费了几个小时
顯示更多
云厂商一出故障就是全球性大故障,用户所有实例被批量性关闭,到现在还没恢复,已经早已无法再升级的大故障了
我盲猜:IAM 账号升级,出现误操作/bug,导致下游计费批量关闭对应账户下的实例
顯示更多
极氪关于海外锁车的官方回应,要是你是车主能接受吗?