招聘动态
更多>>
高级运维工程师(计算)(J11124)
  • 招聘类别:
  • 活水岗位
  • 工作性质:
  • 全职
  • 招聘人数:
  • 若干
  • 发布时间:
  • 2026-08-10
  • 截止时间:
  •  

  • 工作地点:

    北京市


    工作职责:

    故障全生命周期 Owner
    • 作为计算域故障第一责任人,5 min 内完成定界、30 min 内给出止损方案并现场指挥落地;
    • 牵头复盘,输出 RCA 及可落地的架构/流程/代码级改进,复发率下降 50%+;
    隐患清零
    • 基于日志、指标、拨测、Chaos 工程等数据,主动发现并推进重大隐患(资源泄漏、调度热点、内核 BUG、热迁移失败等)闭环;
    技术深耕与工具沉淀
    • 在 OpenStack、K8s 容器、Linux 内核、虚拟化调度四大方向中至少精通 1-2 项;
    • 用 Python/Go 将高频处置场景脚本化、工具化、平台化,进行人效提升 3;
    客户与研发桥梁
    • 面向客户技术层做透明化沟通,将复杂技术问题翻译成业务语言;
    • 与内核、虚拟化、网络、存储研发共建方案,推动缺陷在 1-3 个版本内解决。


    任职资格:

    本科以上学历,5年及以上超大规模云资源池(≥10w 服务器)SRE/运维/研发经验;
    技术深度(源码级/内核级/调度器级)满足以下至少两项:
    • OpenStack Nova/Placement:资源调度、Filter/Weigher 二次开发、大规模调度性能优化;
    • K8s & 容器:kube-scheduler、kubelet、CRI、cgroups v2、RuntimeClass、热升级;
    • Linux Kernel:调度器 CFS/RT、内存管理 NUMA、KVM/QEMU 调优、live-migration、eBPF 排障;
    • 虚拟化调度:CPU 拓扑透传、vCPU Pinning、超线程隔离、热迁移失败根因定位。
    技术广度:对存储(Ceph/Rook/NVMe-oF)及网络加速(OVS-DPDK、SR-IOV、virtio-net)具备熟练定位与应急能力;
    编码能力:Python/Go 至少一门可写出线上脚本/工具,熟悉 Git、CI/CD;