logologo
寻找工作
返回简章2026-09-16 更新

优粮生计划-AI管理员

北京
硕士及以上
不限专业
使用简历深度优化功能,快速提升简历质量
职位介绍
专业要求:计算机科学与技术、软件工程、人工智能、电子信息工程、通信工程或相关专业 岗位职责 1、GPU集群运维:负责GPU服务器(NVIDIAA/H系列)硬件巡检、故障定位与日常运维,覆盖CUDA/驱动/NCCL全栈排障,保障集群稳定运行; 2、国产算力卡信创环境运维:负责国产算力卡(华为昇腾、寒武纪、海光 DCU等)信创环境的适配、部署与运维,完成驱动/固件/生态栈的调优,支撑国产化替代落地; 3、集群监控与调度:维护DCGM/Prometheus等监控体系,管理Slurm/K8s+GPU Operator等调度系统,优化训练资源分配与算力利用率; 4、MLOps平台建设:建设并运营模型训练/推理平台(MLflow/Kubeflow/vLLM等),搭建 CI/CD forML流水线,打通数据管道、训练任务与推理服务全链路; 5、平台组件开发:使用Python/Go开发平台工具与K8soperator等组件,提升平台自动化与自助服务能力; 6、网络与性能优化:维护InfiniBand/RDMA高性能网络,配合分布式训练进行网络与存储性能调优,保障大规模训练效率; 7、推理部署与优化:支撑大模型推理服务部署,开展量化/推理框架(vLLM/TGI/TensorRT-LLM)等性能优化; 8、文档与协同:编写运维手册、平台使用文档与故障分析报告,与算法、研发团队协作,推动平台标准化运营。 任职资格 1、有国产算力卡/信创环境实战经验者优先; 2、熟悉NVIDIA生态(CUDA/cuDNN/NCCL),具备GPU服务器故障定位与驱动调优能力; 熟悉分布式训练与InfiniBand/RDMA网络; 3、具备国产算力卡信创环境适配经验,熟悉昇腾CANN、寒武纪Neuware、海光DCU等生态栈者优先; 4、熟悉Slurm/Kubernetes+GPUOperator等调度方案,掌握DCGM/Prometheus等监控体系; 5、熟悉MLflow/Kubeflow等工具链与vLLM/TGI等推理框架; 熟练使用Python/Go,有K8s operator或平台组件开发经验; 6、精通Linux系统调优,能独立处理内核/驱动/性能问题; 了解模型量化与推理优化者优先; 7、具备较强的责任心与应急响应意识,能适应突发故障处理; 具备良好的沟通协作与文档能力,能与算法团队高效配合; 8、持有NVIDIADLI、CKA/CKS或云厂商相关认证者优先; 9、有大模型推理优化(量化/蒸馏/KV Cache)实战经验者优先。
所属批次:中粮集团2027秋招 2027届校园招聘简章企业职位库在招档案