logologo
寻找工作
返回简章2026-07-25 更新

阿里星-KV Cache分布式存储的网络优化-27届

杭州
硕士及以上
计算机类·数学类
使用简历深度优化功能,快速提升简历质量
职位介绍
职位描述 负责大模型推理系统中网络性能优化和设计。深入了解计算机体系结构与网络系统相关知识。熟悉推理系统算法及推理基础设施的原理、关键问题与方案。核心工作职责包括: 1、KV Cache相关的传输优化; 2、通信协议优化:RDMA、TCP实现高效的分布式传输; 3、模型特定的优化方案:针对MOE、Prefix KV Cache等特殊模型架构,提供定制化的优化解决方案,支持各类大模型架构; 4、性能基准测试与监控系统建设:建立完整的性能评估框架,实现实时监控和分析,提供性能优化的数据支撑; 5、开源社区贡献与技术文档撰写:积极参与vLLM、HiCache等开源项目,撰写详细的技术文档和优化指南。 职位要求 1、有GPU计算系统优化经验,熟悉CUDA编程和GPU系统架构; 2、深入理解PyTorch/vLLM推理框架的架构和工作原理,有框架优化经验; 3、掌握CUDA、NCCL等并行编程技术,了解GPU间的通信机制; 4、有大规模分布式系统的设计与实现经验,理解分布式系统的核心问题; 5、良好的工程能力和代码质量意识,能够编写高性能、可维护的代码。 加分项: 1、有顶级开源社区(Linux Kernel、PyTorch、TensorFlow等)的实质性贡献经验; 2、发表过系统优化或并行计算相关的学术论文(CCF A类以上); 3、有AWS/GCP/Azure等云服务AI推理优化的实战经验; 4、深入了解NVLink、RDMA等高性能通信协议,有优化经验。