优粮生计划-AI管理员
北京
硕士及以上
计算机类·电子信息类
使用简历深度优化功能,快速提升简历质量
职位介绍
专业要求:计算机科学与技术、软件工程、人工智能、电子信息工程、通信工程或相关专业 岗位职责 1.GPU集群运维:负责GPU服务器(NVIDIAA/H系列)硬件巡检、故障定位与日常运维,覆盖CUDA/驱动/NCCL全栈排障,保障集群稳定运行;2.国产算力卡信创环境运维:负责国产算力卡(华为昇腾、寒武纪、海光 DCU等)信创环境的适配、部署与运维,完成驱动/固件/生态栈的调优,支撑国产化替代落地;3.集群监控与调度:维护DCGM/Prometheus等监控体系,管理Slurm/K8s+GPU Operator等调度系统,优化训练资源分配与算力利用率;4.MLOps平台建设:建设并运营模型训练/推理平台(MLflow/Kubeflow/vLLM等),搭建 CI/CD forML流水线,打通数据管道、训练任务与推理服务全链路; 5.平台组件开发:使用Python/Go开发平台工具与K8soperator等组件,提升平台自动化与自助服务能力;6.网络与性能优化:维护InfiniBand/RDMA高性能网络,配合分布式训练进行网络与存储性能调优,保障大规模训练效率;7.推理部署与优化:支撑大模型推理服务部署,开展量化/推理框架(vLLM/TGI/TensorRT-LLM)等性能优化;8.文档与协同:编写运维手册、平台使用文档与故障分析报告,与算法、研发团队协作,推动平台标准化运营。 任职资格 1.有国产算力卡/信创环境实战经验者优先;2.熟悉NVIDIA生态(CUDA/cuDNN/NCCL),具备GPU服务器故障定位与驱动调优能力;熟悉分布式训练与InfiniBand/RDMA网络;3.具备国产算力卡信创环境适配经验,熟悉昇腾CANN、寒武纪Neuware、海光DCU等生态栈者优先; 4.熟悉Slurm/Kubernetes+GPUOperator等调度方案,掌握DCGM/Prometheus等监控体系;5.熟悉MLflow/Kubeflow等工具链与vLLM/TGI等推理框架;熟练使用Python/Go,有K8s operator或平台组件开发经验;6.精通Linux系统调优,能独立处理内核/驱动/性能问题;了解模型量化与推理优化者优先;7.具备较强的责任心与应急响应意识,能适应突发故障处理;具备良好的沟通协作与文档能力,能与算法团队高效配合; 8.持有NVIDIADLI、CKA/CKS或云厂商相关认证者优先; 9.有大模型推理优化(量化/蒸馏/KV Cache)实战经验者优先。
所属批次:中粮集团2027秋招 2027届校园招聘简章企业职位库在招档案→

