logologo
寻找工作
2026-08-22 更新

推理优化工程师-27届校招

北京
本科及以上
计算机类
职位介绍
岗位职责 1. 调研主流大模型(GLM、Qwen、DeepSeek等)的KVCache基础结构,整理不同模型的缓存特性差异,协助团队完成优化方案调研、文档沉淀与实验验证。 2.学习vLLM、SGLang推理框架与PD分离架构基础原理,协助完成分布式KV Cache跨节点数据传输的测试、调试工作,积累大模型分布式推理基础经验。 3.参与GPU显存、内存、磁盘多级缓存卸载的相关实验,协助完成128K长上下文推理场景的资源适配、显存占用测试与数据分析工作。 4.协助优化大模型推理调度逻辑,基于缓存命中率、显存水位等指标,开展对比实验,辅助提升推理吞吐与延迟表现。 5.参与分布式KV缓存服务的基础功能迭代,协助完成数据统计、日志整理、基础监控配置,保障推理服务稳定运行。 任职要求 1.本科及以上学历,计算机、软件工程、人工智能、电子信息等相关专业。2.掌握Python基础编程,有C++/CUDA任意一种语言基础即可,了解GPU并行计算、高性能计算基础概念;3.掌握C++/Rust任意一门编程语言,熟悉操作系统、内存管理、计算机网络等底层基础课程; 4.了解大模型推理基本流程,知道KVCache的作用与基础原理,有vLLM/SGLang框架使用、部署、实验经验者优先; 5.具备基本的代码调试、问题排查思维,愿意学习GPU显存优化、缓存优化相关技术。 6.了解高性能IO、网络通信基础原理即可,无需精通RDMA/SPDK等技术;7.对大模型、AI推理有基本认知,愿意跨界学习大模型系统优化相关技术即可。 优先加分项 1. 有大模型推理框架使用、二次调试、课程实验、毕设相关经历; 2.了解模型量化、剪枝、显存优化等基础技术,有相关实验或项目经历; 3. 接触过长文本大模型推理、GPU资源调优相关实践; 4.有分布式系统、高性能网络、NPU开发相关学习或项目经历; 5. 基础扎实、自驱力强,对大模型推理系统、高性能优化方向有长期兴趣。
职位归属:首都在线2027 企业官方在招库2027届校园招聘简章专页