註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

plantegg
@plantegg
Claude code/AI/Agent/智能体,AI探索,云计算专家,云资源优化专家
467 正在關注    58.4K 粉絲
小红书首席技术专家,80万股入职期权期权,当下估值2400万美金,最后一分没给,牛逼,实名在控诉
0
365
1.3K
162
轉發到社區
继续下跌,创造历史新低。
spacex 跌到八十我考虑入一点
小红书会给陈皓道歉,这是小红书的整改方案,你相信吗?
0
17
34
3
轉發到社區
大家误会了,不是前同事给他打电话求助,而是系统自动打的告警电话。我觉得两天内还可以接受吧。
离职第3天,接到了前司电话,通知我“发生了P0级故障,请尽快处理”。
0
32
16
0
轉發到社區
什么是变更?其实也有一些难以定义的地方,比如图上这次霸榜微博热搜的简单故障 代码运行几年了,没人动它,那天运行就是异常了,然后导致全网大故障 为什么不灰度?——业务:我都几年没动它,怎么去灰度? 你说冤不冤?
顯示更多
华为昨天的大故障,把客户的数据库实例、机器、网络实例全部关机6个小时以上,还有逼脸舔着去投诉,说不影响数据面,真是神经病,太不要脸了。 唯一幸运的是没有删除数据,应该是坏的不能再坏的一次故障。
顯示更多
0
20
61
4
轉發到社區
昨天华为云故障,就简单写了篇发了。然后华为云跑过来投诉我,被微信驳回了。
华为云全球性故障,持续接近五个小时,高度疑似计划升级 IAM 导致。草台班子原理诚不欺我,上一次 IAM 故障带翻全球服务的还是阿里云。写了篇文章,简单聊了下。
顯示更多
0
51
202
10
轉發到社區
我们以前碰到过几次 IDC 机房多条光纤被同时挖断的 case 如图 1,确实是围着 IDC 施工,结果 3 条光纤都挖断了 还有一次不是施工,也是同时断掉了几条光纤,最后分析下来怀疑是有人破坏,于是报警了,不过后续没有跟我同步 像这种问题我觉得都是可以理解也确实不是高频的
顯示更多
我这辈子碰到的诡异的 bug 里,选了 10 个,这个可以入选其中: 客户端如果使用本地 4790/4789 端口通过SLB 连云服务,有极低的概率被SLB 丢包(当云服务的回包 ACK号要同时满足,第5,6位,9-12位,25-32位分别为1,1,1, 4或1)。 上周数据库 ALB 已经关掉了这个逻辑(CLB 没关) 交易所A客户(持续2个多月)/上海 B 客户(持续一年多) 都在排查分析这个异常 4789/4790 是和云 vpc 特殊端口重叠,最后满足条件:交易所A客户(持续2个多月)/上海 B 客户(持续一年多) 的包被丢掉了,因为叠加起来这个 tcp 包被认为是个 udp 包
顯示更多
0
42
57
3
轉發到社區
2022 年8 月 11 号,国内最顶尖的 MySQL 团队(负责最大的 MySQL 云服务集群),在他们的管控元数据库上出现一条慢查询 ,原因是业务上新功能,但是没有考虑到某个查询不带id的情况,导致大量全表扫描将CPU 打满,故障影响长达3个小时,一堆DBA 花了3 小时才发现是慢查询,非常耻辱,于是上线了慢查询自动分析功能期望下次立功——结果一年后另外一次更大的故障因为这个分析系统导致了8 小时的故障时间(这是后话) 对,最牛逼的 MySQL DBA 团队碰到这个慢查询还要影响 3 个小时,确实是难绷
顯示更多
0
36
208
21
轉發到社區
来说说昨天菊花云大故障,你司的机器是几点拉起来的,越早说明贵司越重要,排在后面的都是垃圾客户,哈哈哈哈 我先来,我司是 11 点左右逐步开始拉起
顯示更多
0
37
65
3
轉發到社區
国内云厂商的公告写得还是非常外交部范,如图 非常简洁,虽然我以前骂 AWS 产品做得烂,但是 AWS 在事故公告/原因公示方面做得是最好的 公告地址: 大家去观摩 这份通告是 0726 凌晨 3 点多挂出来的,机器恢复是 0726 9 点之后的事情,而且从开始重启到启动完毕也耗费了几个小时
顯示更多
0
22
36
5
轉發到社區
华为这次还是经验不足,其实在云厂商里,管控是非常非常危险的,我给你们说几个阿里云的例子 Case 1: 双十一后的第一天,阿里云发生了一场史诗级大翻车,大量依赖阿里云服务的应用 APP,包括阿里自己的一系列应用:淘宝,钉钉,闲鱼,… 都出现了问题 原因就是一个自动更新脚本去拉取白名单,然后下发,结果拉取的时候api 超时,返回了一部分数据,拉取端也没做校验就下发了,导致白名单大量缺失,那不就几乎所有 app/oss 等都访问不通了么 关键是这个脚本跑了几年了,早期也没做灰度,也不是新上线,团队也换了几波人 Case 2: 阿里云数据库自己的元数据库磁盘写满了,导致整个数据库管控全挂,没法变配/新购等等 道理很简单,所有的变配/新购都要更新元数据库。你一定会问,为什么没有监控?为什么没有高可用?单库单表没做拆分? Case 3: 阿里云监控数据采集出现 bug,导致下游获取不到监控数据,这本来问题不大,看不到监控数据而已,现在作妖的来了,阿里云数据库有个 DAS (自动驾驶,智能管控 系统),因为没有监控数据,开始锁实例/锁云盘,强制给用户变配,吓人不? 你看出了 Case2,其他 Case 你们自己不会碰到,都是云厂商自己搞出来的 所以能不用云就不要用,实在要用也就用 ECS/IaaS 这一层就完事了,听懂我这句话你就可以做你们公司的 CTO/CIO 了
顯示更多
0
20
115
14
轉發到社區
机房着火,光线被挖断,IDC被炸,硬件故障这些用云不用云都会碰到,我觉得是可以理解的。 但是华为自己的账号管理系统升级把客户的 ECS/网络实例/数据库等全关掉了,这就不是正常逻辑能理解的了。 然后关闭持续超过 6 小时才开始缓慢恢复,恢复又花了 2-3 小时,然后客户业务继续花 2-3 小时恢复 这种运维动作的发布居然不灰度?正常逻辑得小客户/小区域逐渐灰度发布,一个区域一个区域发布,一批账号一批账号发布才是正确的路径 一把梭哈,闻所未闻,业余至极,遥遥领先
顯示更多
华为云全球性大故障,宿主机全部关机且无法开机
0
75
184
15
轉發到社區
一个观点: 如果云厂商的火灾/机器故障/网络光纤被挖断,这些都是用户自己也会碰到所以也可以接受,正常赔付就 OK 了 但是如果是 IAM/白名单 等这种云厂商自身管理需要导致的故障,必须 100 倍赔偿才合理,应为用户在自己的 IDC 永远碰不到这些问题 是不是有点道理?
顯示更多
华为云全球性大故障,宿主机全部关机且无法开机
0
60
34
4
轉發到社區
不要相信云厂商 不要相信云厂商 不要相信云厂商 他们都是草台班子,只会搞出用户永远搞不出来的全球性大故障,难以置信那种
云厂商一出故障就是全球性大故障,用户所有实例被批量性关闭,到现在还没恢复,已经早已无法再升级的大故障了 我盲猜:IAM 账号升级,出现误操作/bug,导致下游计费批量关闭对应账户下的实例
顯示更多
云厂商一出故障就是全球性大故障,用户所有实例被批量性关闭,到现在还没恢复,已经早已无法再升级的大故障了 我盲猜:IAM 账号升级,出现误操作/bug,导致下游计费批量关闭对应账户下的实例
顯示更多
0
28
27
4
轉發到社區
华为云全球性大故障,宿主机全部关机且无法开机
0
28
168
11
轉發到社區
极氪关于海外锁车的官方回应,要是你是车主能接受吗?
0
10
21
2
轉發到社區
考考大家: 1)AWS 的 EC2 和 Aliyun 的 ECS,谁承诺的 SLA 更高? 2)比如这些云厂商承诺的 99.99% 你理解的是单台 ECS/EC2 的 SLA 是 99.99% 吗? 说实在的我搞了 10多年云在这两个问题上我居然被坑 换个思路:如果你觉得理想汽车老是坏,那是因为你只买一辆,你要同时买两辆全年保证 99.999% 有汽车开 佩服佩服
顯示更多