岗位职责
- 负责 GPU 服务器上架、装机、驱动 / CUDA / 容器运行时维护与版本回滚。
- 建设与维护监控告警(GPU 利用率、温度、ECC、磁盘、网络);处理 OOM、NCCL、掉卡等典型故障。
- 配合业务做镜像标准化、节点封锁/引流、容量规划与变更窗口。
- 编写运维手册与应急预案;参与机房 debark / 远程手的协作。
- 可选:协助 K8s Device Plugin / GPU Operator 落地。
任职要求
- 3 年以上 Linux 运维经验;熟悉 systemd、网络、存储与性能工具(perf / nvidia-smi 等)。
- 熟悉 NVIDIA 驱动、CUDA 工具链与容器 GPU 透传;处理过训练/推理现场问题者优先。
- 了解 Prometheus / Grafana;会 Bash,能写简单 Python/Go 自动化。
- 有 IDC / 私有云 / 智算中心经验加分;能接受值班与紧急响应。
福利与工作方式
- 薪资面议;值班补贴面议;五险一金。
- 静安办公 + 机房相关事务出差(市内为主)。
- 可直接接触多型号 GPU 库存与客户负载。