logologo
寻找工作
返回简章2026-07-28 更新

大模型推理前沿技术研究-阿里星

北京·杭州
硕士及以上
计算机类·数学类
使用简历深度优化功能,快速提升简历质量
职位介绍
职位描述
在这里,你将深入大模型计算的核心腹地,横跨算法压缩与系统工程,从万亿参数模型的轻量化创新到万卡集群的极致性能调优,打通从模型结构创新、高效压缩、到算子内核与分布式系统的全链路技术栈,打造全球领先的训练与推理加速引擎。
1、极致算子与内核开发
手写高性能GPU/NPU核心算子(CUDA/Triton),针对低比特量化、稀疏计算、注意力机制等场景深度挖掘硬件算力,结合编译优化与性能剖析(Nsight系列)突破计算瓶颈;
2、模型压缩与轻量化
研发FP8/INT4/INT8量化(PTQ/QAT)、结构化/非结构化稀疏、动态剪枝、低秩近似(LoRA)及MoE技术;利用强化学习(RL)与AutoML构建自动化压缩流水线,实现精度-效率帕累托最优;
3、分布式训练与通信优化
深度优化Megatron-LM、DeepSpeed等框架,突破万卡集群通信瓶颈,设计拓扑感知调度、通信压缩(如梯度压缩)、计算与通信重叠等策略,提升 scaling efficiency;
4、前沿推理架构落地
研究并部署投机采样(Speculative Decoding)、分离式推理(Disaggregated Inference)、KV Cache优化等技术,在生产环境实现延迟与吞吐的数量级提升。
职位要求
1、在MLSys、NeurIPS、ICML、ACL等顶会/顶刊发表过论文;
2、在国际顶级竞赛(ACM/ICPC等)中取得冠亚军或优异成绩;
3、深度参与或主导贡献过顶级开源项目(vLLM/SGLang/TensorRT-LLM/Megatron-LM等)。