博客文章

2026年6月2日

Docker 代码沙箱防逃逸实战:从 Namespace 到 gVisor,我是怎么一层层锁死容器的

前阵子有个做在线编程平台的朋友找到我,说他们平台要支持用户在线提交代码并执行,问我用 Docker 跑用户代码安不安全。我当时就笑了——这事儿我太熟了,之前在做一个类似 LeetCode 的 OJ 系统的时候,就踩过不少坑。说白了,Docker 容器不是什么铜墙铁壁,它本质上就是跑在宿主机内核...

作者:悠悠
2026年6月1日

一文讲透 GPUDirect RDMA:它到底解决了什么问题?AWS 上哪些 GPU 实例能用?

这两年搞大模型训练、分布式推理、HPC 计算,绕不开几个词:GPU、NVLink、NCCL、EFA、RDMA、GPUDirect RDMA。我之前刚接触这块的时候,说实话也挺懵。一个模型训练慢,大家开会的时候嘴里都是“通信瓶颈”“AllReduce 太慢”“跨节点带宽不够”“EFA 没跑起来”...

作者:悠悠
2026年5月31日

mTLS到底是个啥?服务间双向认证从原理到实战,一篇搞定

从TLS说起在讲mTLS之前,我们得先把TLS搞明白。日常我们访问https网站,浏览器地址栏那个小锁,背后就是TLS在工作。TLS的核心逻辑其实很简单——单向认证。什么意思呢?就是客户端去验证服务端的身份,但服务端不验证客户端。流程大概是这样:客户端发起连接请求,告诉服务端我支持哪些TLS版...

作者:悠悠
2026年5月31日

源站 IP 暴露被直接打穿?这套 AWS 纵深防御方案你一定用得上

上周半夜接到一个紧急电话,客户的业务挂了。打开监控一看,源站 ALB 的 CPU 直接拉满,连接数爆表。但奇怪的是 CloudFront 那边的请求量完全正常,WAF 日志也干干净净。我当时就猜到了——源站 IP 漏了,攻击者绕过了 CloudFront 直接打源站。后来确认就是这样,客户的源...

作者:悠悠
2026年5月28日

大模型微调完全指南:从显存炸裂到优雅落地

说白了,当下用大模型最大的痛点就是:它太通用了。OpenAI的GPT、Meta的Llama这些开源模型,确实什么都能做,但对你的特定业务场景来说,那就是"什么都会,什么都不行"。微调就是来解决这个问题的——用你的私有数据,让模型学会你的"方言"。我之前在生产环境里踩过不少坑。显存不够、训练巨慢...

作者:悠悠