半年前机房里一周炸了5块盘,RAID重建还没跑完第二块又掉了,那个晚上我盯着iDRAC面板手都在抖。事后复盘发现这5块盘的SMART数据在故障前2-4周就已经有明显异常了——只是没人看。从那之后我搞了一套磁盘预测感知的东西,用smartmontools采集SMART数据,跑一个轻量的XGBoo...
连个服务器要过三道关卡,排查问题先花十分钟想命令,好不容易跑完一轮发现方向错了还得重来。运维人的时间,大半耗在"准备干活"上,而不是"干活"本身。最近用了Chaterm之后,排查故障直接敲中文描述问题,它自动生成命令、自动执行、自动分析结果,整个链路一气呵成。今天掰开讲讲这个工具。运维人的命令...
先搞清楚NotReady到底意味着什么很多人一看到NotReady就慌,其实这个状态本身不是故障,是一个信号。Kubernetes的node-controller每隔一段时间检查节点的心跳。具体来说,kubelet会持续更新两个东西:一个是Node对象的.status.conditions,一...
先搞明白:RBAC 到底是个啥?在说怎么设计之前,得先聊清楚 RBAC 这东西的本质。我见过很多团队,上来就"我们要做 RBAC",但问到 RBAC 是啥、能解决啥问题,就支支吾吾说不清。说白了,RBAC(Role-Based Access Control,基于角色的访问控制)就是一句话:把权...
某天收到监控告警,服务器出口带宽被打满,业务响应变慢。本文记录完整的排查思路和处理过程。定位流量来源:iftop带宽被打满,第一步要搞清楚流量到底流向哪里。iftop 是最直观的工具。启动模型工具# 安装 yum install -y iftop # CentOS/RHEL apt ...
热爱技术的云计算运维工程师,Python全栈工程师,分享开发经验与生活感悟。
欢迎关注我的微信公众号@运维躬行录,领取海量学习资料