logologo
寻找工作
返回简章2026-08-11 更新

大模型数据引擎工程师

北京
本科及以上
不限专业
使用简历深度优化功能,快速提升简历质量
职位介绍
职位描述
1、参与打造生成式大模型的数据基础设施,构建高性能、分布式、可扩展的数据系统,通过数据驱动模型生产,让海量数据场景下的算法迭代又快又稳; 
2、参与构建 agentic 数据生产体系:将数据基建能力封装为 agent 可靠调用的工具与服务,参与研发数据链路的编排与运行框架——让数据管线的搭建、运维、排障逐步由 agent 自主完成; 
3、在导师带领下攻坚以下领域之一的核心架构难题:大规模分布式计算与调度 / 海量多模态存储 / 跨模态检索 / 大规模批量推理优化等;
4、参与建设数据管线的无人值守能力与全链路可追溯:作业级容错与自愈、自动化质量监测、数据版本化与血缘、数据实验归因体系; 
5、与算法、数据交付团队紧密协作,共同定义算子与数据服务的接口标准,以 Co-Design 方式共同提升模型效果。
任职要求
1、计算机及相关专业本科及以上学历; 
2、扎实掌握至少一种系统语言(C++/Go/Rust/Java)及 Python,有课程项目或实习中的系统开发实践,对吞吐/延迟/资源成本有基本体感; 
3、对以下某一方向有浓厚兴趣和扎实基础,愿意深入钻研(方向说明见下方); 
4、具备抽象思维:能把复杂问题拆解为清晰的模块与接口,有意识地追求"好用、可复用、可观测"的设计; 
5、善用 AI-coding 与大模型工具,认同 agentic 研发理念; 
6、沟通务实,乐于跨团队协作,尊重相邻方向的专业判断。

方向长板(以下四选一,至少一个方向达到深入理解水平):
1、分布式计算与调度:深入理解 Ray/Spark/Flink 之一的架构与调度机制,有课程实验或实习中的大规模数据处理实践;了解 Kubernetes 批调度、GPU 调度者优先; 
2、存储与数据湖:理解对象存储/数据湖/分布式缓存的核心设计,有海量数据读写的实践或课程项目经验;了解数据版本化或血缘系统者优先; 
3、检索与索引:理解向量检索引擎(Faiss/Milvus 等)或倒排/多维索引的原理,有 ANN 建库或检索调优的实践;了解跨模态检索(文搜视频/以图搜视频)者优先; 
4、推理优化:理解 vLLM/SGLang/TensorRT 类推理框架的核心机制,对动态 batching、量化加速、显存与吞吐调优有实践认知;了解视觉/多模态模型推理优化者优先。

加分项(各方向通用):
1、有多模态/视频数据处理相关经验(视频编解码、GPU 视频处理管线、BMF/Ray Data 类框架); 
2、参与过知名开源项目,或有高水平论文(CVPR/ICCV/ECCV/NeurIPS/ICML 等); 
3、有ACM/ICPC、Kaggle 等竞赛获奖经历; 
4、有相关方向的大厂实习经历。