工作地点:
北京市
工作职责:
故障全生命周期 Owner
• 作为计算域故障第一责任人,5 min 内完成定界、30 min 内给出止损方案并现场指挥落地;
• 牵头复盘,输出 RCA 及可落地的架构/流程/代码级改进,复发率下降 50%+;
隐患清零
• 基于日志、指标、拨测、Chaos 工程等数据,主动发现并推进重大隐患(资源泄漏、调度热点、内核 BUG、热迁移失败等)闭环;
技术深耕与工具沉淀
• 在 OpenStack、K8s 容器、Linux 内核、虚拟化调度四大方向中至少精通 1-2 项;
• 用 Python/Go 将高频处置场景脚本化、工具化、平台化,进行人效提升 3;
客户与研发桥梁
• 面向客户技术层做透明化沟通,将复杂技术问题翻译成业务语言;
• 与内核、虚拟化、网络、存储研发共建方案,推动缺陷在 1-3 个版本内解决。
任职资格:
本科以上学历,5年及以上超大规模云资源池(≥10w 服务器)SRE/运维/研发经验;
技术深度(源码级/内核级/调度器级)满足以下至少两项:
• OpenStack Nova/Placement:资源调度、Filter/Weigher 二次开发、大规模调度性能优化;
• K8s & 容器:kube-scheduler、kubelet、CRI、cgroups v2、RuntimeClass、热升级;
• Linux Kernel:调度器 CFS/RT、内存管理 NUMA、KVM/QEMU 调优、live-migration、eBPF 排障;
• 虚拟化调度:CPU 拓扑透传、vCPU Pinning、超线程隔离、热迁移失败根因定位。
技术广度:对存储(Ceph/Rook/NVMe-oF)及网络加速(OVS-DPDK、SR-IOV、virtio-net)具备熟练定位与应急能力;
编码能力:Python/Go 至少一门可写出线上脚本/工具,熟悉 Git、CI/CD;