Operations

GPU 集群运维工程师

保障 H300 / RTX 5090 / PRO 6000 等节点稳定可用:驱动、监控、排障与变更。对标上海智算中心运维岗位常见能力模型。

岗位职责

  • 负责 GPU 服务器上架、装机、驱动 / CUDA / 容器运行时维护与版本回滚。
  • 建设与维护监控告警(GPU 利用率、温度、ECC、磁盘、网络);处理 OOM、NCCL、掉卡等典型故障。
  • 配合业务做镜像标准化、节点封锁/引流、容量规划与变更窗口。
  • 编写运维手册与应急预案;参与机房 debark / 远程手的协作。
  • 可选:协助 K8s Device Plugin / GPU Operator 落地。

任职要求

  • 3 年以上 Linux 运维经验;熟悉 systemd、网络、存储与性能工具(perf / nvidia-smi 等)。
  • 熟悉 NVIDIA 驱动、CUDA 工具链与容器 GPU 透传;处理过训练/推理现场问题者优先。
  • 了解 Prometheus / Grafana;会 Bash,能写简单 Python/Go 自动化。
  • 有 IDC / 私有云 / 智算中心经验加分;能接受值班与紧急响应。

福利与工作方式

  • 薪资面议;值班补贴面议;五险一金。
  • 静安办公 + 机房相关事务出差(市内为主)。
  • 可直接接触多型号 GPU 库存与客户负载。