你新买了一台云服务器,装好系统、部署完应用,觉得万事大吉了。但你打开/var/log/auth.log看一眼就知道,从你服务器暴露在公网那一刻起,全世界的扫描器已经在排队敲门了。一天几万条暴力破解记录,不是夸张,是常态。这篇文章我把每一步加固操作写到具体命令级别。不讲道理,直接上手。系统账户和...
200多个微服务同时构建失败,线上发版卡死,开发堵在办公室门口骂娘。我盯着Jenkins那台破服务器,磁盘100%,内存飘红,连后台都进不去。那一刻我才真正明白:Jenkins不是装上就能用的,企业级的CI/CD,是一套体系,不是一个工具。装上Jenkins到用好Jenkins,中间隔着一百个...
为什么光会 strace 远远不够先说个大实话。很多刚入行的兄弟一提排查就上 strace,觉得这玩意儿万能。strace 确实好用,追系统调用和信号一把好手。可它有个致命毛病——性能开销太大了。你在一个每秒几万请求的高并发服务上直接 strace,好家伙,进程直接被你拖慢好几倍,本来没崩的可...
我把这两年折腾 Kafka 监控的经验整理出来,从 JMX 指标怎么暴露、Exporter 怎么选、Prometheus 怎么抓、Grafana 面板怎么配,到告警规则怎么写,全流程给你讲清楚。看完你照着搭一套,基本能覆盖 90% 的 Kafka 线上问题。建议先收藏,搭的时候对着看。先说清楚...
上个月某天凌晨,告警群里突然炸了:Kafka 集群某台 broker 磁盘使用率 95%,马上要撑爆。我赶紧爬起来处理,登上去一看,日志目录里堆了一堆 .log 文件,大的有几十 G,小的也有几个 G。当时心里挺懵的,Kafka 不是号称"高吞吐、零丢失"吗,怎么磁盘会爆?后来花了半宿才把问题...
热爱技术的云计算运维工程师,Python全栈工程师,分享开发经验与生活感悟。
欢迎关注我的微信公众号@运维躬行录,领取海量学习资料