logologo
寻找工作
返回简章2026-08-04 更新

【AI Infra】基础架构工程师(SRE)(J12900)

深圳
本科及以上
自动化类·计算机类
使用简历深度优化功能,快速提升简历质量
职位介绍
工作职责 1、做什么: 负责 GPU 算力集群的调度、运维与优化,以及阿里云资源的维护与管理,为模型训练和数据处理提供稳定、高效、弹性的算力基础设施。 2、核心职责: - GPU 集群(H20 等)部署、运维与资源调度系统建设 - 分布式训练环境搭建(NCCL 网络优化、RDMA 配置、Checkpoint 自动保存与恢复) - 阿里云资源维护与混合云架构设计(弹性伸缩、成本优化) - 集群级监控体系与告警策略,容量规划支撑算力增长 任职资格 1、任职要求: - 计算机/软件工程 等相关专业,本科及以上 - 熟悉 Linux 系统、网络(TCP/IP/RDMA)、存储原理 - 熟悉 Kubernetes,有 GPU 集群调度基础 - 了解阿里云/AWS 等公有云资源管理 - 熟悉监控告警体系(Prometheus/Grafana/ELK) 2、加分项: - 大规模 AI 训练集群(千卡级)运维经验 - NCCL/MPI 分布式通信库与网络拓扑优化经验 - 基础设施即代码(Terraform/Pulumi)实践