logologo
寻找工作
返回简章2026-08-10 更新

【2027届校招】大模型AI Infra/MLSys工程师

北京·上海
计算机类·电子信息类
使用简历深度优化功能,快速提升简历质量
职位介绍
招聘部门:数据驱动部 工作职责: 我们正在寻找具备深厚大模型结构优化经验的工程师,负责端到端大模型的架构设计、训练性能优化及推理加速。您将面向千卡级集群,围绕模型结构、训练 Pipeline等方向持续优化,推动大模型在超大规模集群和芯片的性能边界。 您将深度参与以下方向: 1、训练稳定性与性能优化: 负责超大规模模型训练过程中的稳定性、收敛效率与系统性能优化,提升千卡集群下的整体训练效率与资源利用率。 2、异构硬件适配: 统一适配各种主流与国产 GPU/NPU 芯片,解决异构计算集群的通信与调度问题。 3、集群稳定性保障: 解决千卡/万卡集群训练时的显存瓶颈、断点续训(Checkpoint)、通信拓扑优化及算力调度问题。 4、模型推理加速与部署优化:针对 GPU进行推理性能优化,包括 Kernel Fusion、算子优化、KV Cache、并行策略及部署系统优化等。 5、新一代高效率模型架构探索: 探索高效率模型结构与训练范式,包括 Sparse / Linear Attention、Hybrid Architecture、MoE Scaling、多模态融合等前沿方向。 目标方向 提升千卡集群训练 MFU 与整体吞吐; 提升训练效率,降低大模型训练成本; 提升模型在 GPU/NPU等芯片的推理性能与 MAC 利用率; 支撑超大规模模型与集群的稳定训练与持续迭代。 任职要求: 1、计算机、人工智能、数学、电子工程等相关专业硕士及以上学历; 2、具备大模型结构设计、训练优化或底层系统开发经验。 3、千卡集群实战经验: 具备千卡及以上规模 GPU/NPU等集群(如 B300 / B200 / H100 / H800 / A100 等)的实际训练速度优化与模型调优经验; 4、熟悉大规模分布式训练中的并行策略、通信优化与性能分析。 5、大模型相关经验: 主导或深度参与过 10B 参数以上大模型的结构设计、预训练或微调项目; 对主流大模型体系(如 DeepSeek、千问、豆包等)有深入理解,具备相关结构优化经验者优先。 6、工程能力: 精通 Python / C++; 熟练掌握 PyTorch 及至少一种主流分布式训练框架,如 Megatron-LM、DeepSpeed、vLLM; 熟悉 CUDA、TensorRT、Kernel 优化或推理框架者优先。 招聘人数:若干