logologo
寻找工作
返回简章2026-07-25 更新

阿里星-LLM高性能推理系统关键技术研究27届

杭州
硕士及以上
计算机类
使用简历深度优化功能,快速提升简历质量
职位介绍
职位描述 1. 参与大模型推理系统的架构设计与开发,包括推理网关、请求调度、流量路由等核心模块的建设 2. 负责推理引擎(vLLM/SGLang等)的深度优化与定制化开发,提升推理吞吐与延迟表现 3. 参与PD分离(Prefill-Decode)架构的设计与开发,优化Prefill与Decode阶段的资源分配与协同调度 4. 负责KV Cache存储与管理系统开发,包括KV Cache迁移、共享、淘汰策略的设计与实现 5. 参与模型分发系统开发,支持大模型在多节点间的高效分发与加载 6. 基于线上监控与用户反馈,持续优化推理链路的性能、稳定性与成本效率 职位要求 1. 计算机相关专业,具有Golang、Python或C++开发经验 2. 熟悉vLLM、SGLang等开源推理引擎的架构与实现,了解Continuous Batching、PagedAttention等核心机制 3. 深入理解LLM推理场景下的请求调度策略,熟悉 KV Cache 管理、PD分离等前沿架构 4. 具备高性能系统开发经验,熟悉GPU编程(CUDA/Triton等)者优先 5. 具备复杂系统的设计与调试能力,能够系统性分析推理链路中的性能瓶颈 6. 良好的学习和自我驱动能力,具备良好的跨团队沟通协作能力 7. 积极拥抱AI辅助编程工具,善于利用AI提升开发效率与代码质量