阿里星-KV Cache分布式存储的网络优化-27届
杭州
硕士及以上
计算机类·数学类
使用简历深度优化功能,快速提升简历质量
职位介绍
职位描述
负责大模型推理系统中网络性能优化和设计。深入了解计算机体系结构与网络系统相关知识。熟悉推理系统算法及推理基础设施的原理、关键问题与方案。核心工作职责包括:
1、KV Cache相关的传输优化;
2、通信协议优化:RDMA、TCP实现高效的分布式传输;
3、模型特定的优化方案:针对MOE、Prefix KV Cache等特殊模型架构,提供定制化的优化解决方案,支持各类大模型架构;
4、性能基准测试与监控系统建设:建立完整的性能评估框架,实现实时监控和分析,提供性能优化的数据支撑;
5、开源社区贡献与技术文档撰写:积极参与vLLM、HiCache等开源项目,撰写详细的技术文档和优化指南。
职位要求
1、有GPU计算系统优化经验,熟悉CUDA编程和GPU系统架构;
2、深入理解PyTorch/vLLM推理框架的架构和工作原理,有框架优化经验;
3、掌握CUDA、NCCL等并行编程技术,了解GPU间的通信机制;
4、有大规模分布式系统的设计与实现经验,理解分布式系统的核心问题;
5、良好的工程能力和代码质量意识,能够编写高性能、可维护的代码。
加分项:
1、有顶级开源社区(Linux Kernel、PyTorch、TensorFlow等)的实质性贡献经验;
2、发表过系统优化或并行计算相关的学术论文(CCF A类以上);
3、有AWS/GCP/Azure等云服务AI推理优化的实战经验;
4、深入了解NVLink、RDMA等高性能通信协议,有优化经验。

