碰到能力弱的工程师真是很无语,大概也就是过去10多年互联网火爆留下来的遗毒吧
能力弱指的什么呢,出错了永远只会说:Linux报错、MySQL不对、Java不对。从不去看日志,永远只看最表面的现象
A->B->C->MySQL 一看到A报错,就说你给的MySQL不对
显示更多
小红书首席技术专家,80万股入职期权期权,当下估值2400万美金,最后一分没给,牛逼,实名在控诉
小红书会给陈皓道歉,这是小红书的整改方案,你相信吗?
大家误会了,不是前同事给他打电话求助,而是系统自动打的告警电话。我觉得两天内还可以接受吧。
离职第3天,接到了前司电话,通知我“发生了P0级故障,请尽快处理”。
什么是变更?其实也有一些难以定义的地方,比如图上这次霸榜微博热搜的简单故障
代码运行几年了,没人动它,那天运行就是异常了,然后导致全网大故障
为什么不灰度?——业务:我都几年没动它,怎么去灰度?
你说冤不冤?
显示更多
华为昨天的大故障,把客户的数据库实例、机器、网络实例全部关机6个小时以上,还有逼脸舔着去投诉,说不影响数据面,真是神经病,太不要脸了。
唯一幸运的是没有删除数据,应该是坏的不能再坏的一次故障。
显示更多
昨天华为云故障,就简单写了篇发了。然后华为云跑过来投诉我,被微信驳回了。
华为云全球性故障,持续接近五个小时,高度疑似计划升级 IAM 导致。草台班子原理诚不欺我,上一次 IAM 故障带翻全球服务的还是阿里云。写了篇文章,简单聊了下。
显示更多
我们以前碰到过几次 IDC 机房多条光纤被同时挖断的 case
如图 1,确实是围着 IDC 施工,结果 3 条光纤都挖断了
还有一次不是施工,也是同时断掉了几条光纤,最后分析下来怀疑是有人破坏,于是报警了,不过后续没有跟我同步
像这种问题我觉得都是可以理解也确实不是高频的
显示更多
我这辈子碰到的诡异的 bug 里,选了 10 个,这个可以入选其中:
客户端如果使用本地 4790/4789 端口通过SLB 连云服务,有极低的概率被SLB 丢包(当云服务的回包 ACK号要同时满足,第5,6位,9-12位,25-32位分别为1,1,1, 4或1)。 上周数据库 ALB 已经关掉了这个逻辑(CLB 没关)
交易所A客户(持续2个多月)/上海 B 客户(持续一年多) 都在排查分析这个异常
4789/4790 是和云 vpc 特殊端口重叠,最后满足条件:交易所A客户(持续2个多月)/上海 B 客户(持续一年多) 的包被丢掉了,因为叠加起来这个 tcp 包被认为是个 udp 包
显示更多
2022 年8 月 11 号,国内最顶尖的 MySQL 团队(负责最大的 MySQL 云服务集群),在他们的管控元数据库上出现一条慢查询 ,原因是业务上新功能,但是没有考虑到某个查询不带id的情况,导致大量全表扫描将CPU 打满,故障影响长达3个小时,一堆DBA 花了3 小时才发现是慢查询,非常耻辱,于是上线了慢查询自动分析功能期望下次立功——结果一年后另外一次更大的故障因为这个分析系统导致了8 小时的故障时间(这是后话)
对,最牛逼的 MySQL DBA 团队碰到这个慢查询还要影响 3 个小时,确实是难绷
显示更多
来说说昨天菊花云大故障,你司的机器是几点拉起来的,越早说明贵司越重要,排在后面的都是垃圾客户,哈哈哈哈
我先来,我司是 11 点左右逐步开始拉起
显示更多
国内云厂商的公告写得还是非常外交部范,如图
非常简洁,虽然我以前骂 AWS 产品做得烂,但是 AWS 在事故公告/原因公示方面做得是最好的
公告地址: 大家去观摩
这份通告是 0726 凌晨 3 点多挂出来的,机器恢复是 0726 9 点之后的事情,而且从开始重启到启动完毕也耗费了几个小时
显示更多
华为这次还是经验不足,其实在云厂商里,管控是非常非常危险的,我给你们说几个阿里云的例子
Case 1:
双十一后的第一天,阿里云发生了一场史诗级大翻车,大量依赖阿里云服务的应用 APP,包括阿里自己的一系列应用:淘宝,钉钉,闲鱼,… 都出现了问题
原因就是一个自动更新脚本去拉取白名单,然后下发,结果拉取的时候api 超时,返回了一部分数据,拉取端也没做校验就下发了,导致白名单大量缺失,那不就几乎所有 app/oss 等都访问不通了么
关键是这个脚本跑了几年了,早期也没做灰度,也不是新上线,团队也换了几波人
Case 2:
阿里云数据库自己的元数据库磁盘写满了,导致整个数据库管控全挂,没法变配/新购等等
道理很简单,所有的变配/新购都要更新元数据库。你一定会问,为什么没有监控?为什么没有高可用?单库单表没做拆分?
Case 3:
阿里云监控数据采集出现 bug,导致下游获取不到监控数据,这本来问题不大,看不到监控数据而已,现在作妖的来了,阿里云数据库有个 DAS (自动驾驶,智能管控 系统),因为没有监控数据,开始锁实例/锁云盘,强制给用户变配,吓人不?
你看出了 Case2,其他 Case 你们自己不会碰到,都是云厂商自己搞出来的
所以能不用云就不要用,实在要用也就用 ECS/IaaS 这一层就完事了,听懂我这句话你就可以做你们公司的 CTO/CIO 了
显示更多
机房着火,光线被挖断,IDC被炸,硬件故障这些用云不用云都会碰到,我觉得是可以理解的。
但是华为自己的账号管理系统升级把客户的 ECS/网络实例/数据库等全关掉了,这就不是正常逻辑能理解的了。
然后关闭持续超过 6 小时才开始缓慢恢复,恢复又花了 2-3 小时,然后客户业务继续花 2-3 小时恢复
这种运维动作的发布居然不灰度?正常逻辑得小客户/小区域逐渐灰度发布,一个区域一个区域发布,一批账号一批账号发布才是正确的路径
一把梭哈,闻所未闻,业余至极,遥遥领先
显示更多
一个观点:
如果云厂商的火灾/机器故障/网络光纤被挖断,这些都是用户自己也会碰到所以也可以接受,正常赔付就 OK 了
但是如果是 IAM/白名单 等这种云厂商自身管理需要导致的故障,必须 100 倍赔偿才合理,应为用户在自己的 IDC 永远碰不到这些问题
是不是有点道理?
显示更多
不要相信云厂商
不要相信云厂商
不要相信云厂商
他们都是草台班子,只会搞出用户永远搞不出来的全球性大故障,难以置信那种
云厂商一出故障就是全球性大故障,用户所有实例被批量性关闭,到现在还没恢复,已经早已无法再升级的大故障了
我盲猜:IAM 账号升级,出现误操作/bug,导致下游计费批量关闭对应账户下的实例
显示更多
云厂商一出故障就是全球性大故障,用户所有实例被批量性关闭,到现在还没恢复,已经早已无法再升级的大故障了
我盲猜:IAM 账号升级,出现误操作/bug,导致下游计费批量关闭对应账户下的实例
显示更多
极氪关于海外锁车的官方回应,要是你是车主能接受吗?