【AI Infra】基础架构工程师(SRE)(J12900)
深圳
本科及以上
自动化类·计算机类
使用简历深度优化功能,快速提升简历质量
职位介绍
工作职责
1、做什么:
负责 GPU 算力集群的调度、运维与优化,以及阿里云资源的维护与管理,为模型训练和数据处理提供稳定、高效、弹性的算力基础设施。
2、核心职责:
- GPU 集群(H20 等)部署、运维与资源调度系统建设
- 分布式训练环境搭建(NCCL 网络优化、RDMA 配置、Checkpoint 自动保存与恢复)
- 阿里云资源维护与混合云架构设计(弹性伸缩、成本优化)
- 集群级监控体系与告警策略,容量规划支撑算力增长
任职资格
1、任职要求:
- 计算机/软件工程 等相关专业,本科及以上
- 熟悉 Linux 系统、网络(TCP/IP/RDMA)、存储原理
- 熟悉 Kubernetes,有 GPU 集群调度基础
- 了解阿里云/AWS 等公有云资源管理
- 熟悉监控告警体系(Prometheus/Grafana/ELK)
2、加分项:
- 大规模 AI 训练集群(千卡级)运维经验
- NCCL/MPI 分布式通信库与网络拓扑优化经验
- 基础设施即代码(Terraform/Pulumi)实践

