logologo
寻找工作
返回简章2026-07-25 更新

阿里星-超大规模训练关键技术-27届

杭州
硕士及以上
计算机类·数学类
使用简历深度优化功能,快速提升简历质量
职位介绍
职位描述 1. 参与FlashMoE等分布式训练框架的优化,重点攻关MoE模型的Expert并行通信优化、负载动态均衡和稀疏激活下的高效训练; 2. 负责显存优化技术创新(激活重计算、梯度检查点、ZeRO变体),支持万亿参数MoE模型在有限显存下的稳定训练; 3. 探索多种异构硬件设备(A100/H100/H800/PPU)上的训练性能优化,通过算子融合、通信重叠、显存管理等手段提升MFU; 4. 支撑集团内部或云上客户万卡级MoE模型训练场景,将技术成果沉淀为PAI-DLC训练平台核心特性; 5. 推动超大规模训练优化方向的学术影响力产出。 职位要求 1. 熟悉深度学习基本原理、主流深度学习算法及应用、以及至少一种主流框架(PyTorch、TensorFlow等); 2. 熟悉Megatron、TrasformerEngine、DualPipe等框架技术,并在研究或实习项目中有相应的实践经历; 3. 具备扎实的计算机基础知识、C++/Python编程能力,熟悉常见数据结构和设计模式; 4. 具有很强的学习能力、复杂问题归纳梳理能力、沟通和团队协作能力,具备能够深度钻研技术的耐心。 加分项: 1. 有很强的学术研究能力和优秀的学术成果(AI领域顶会/顶刊论文); 2. 熟悉体系结构,并有扎实的高性能计算/AI编译器/推理框架/模型优化经验; 3. 作为核心贡献者参与开发或者负责维护AI领域的流行开源项目。