logologo
寻找工作
返回简章2026-07-25 更新

LLM-大模型算法工程师-SH、BJ

上海
硕士及以上
数学类·计算机类
使用简历深度优化功能,快速提升简历质量
职位介绍
关于团队: Shopee 大模型团队专注于打造面向全球竞争的多语言大模型。我们以真实业务驱动的创新为核心,致力于构建融合推理、记忆与自主执行能力的下一代自主智能体(Agentic LLM)体系。依托全球新兴市场尤其是东南亚的多语言、多文化数据优势,我们已自主建设大模型全栈基础设施,覆盖训练体系、评测系统、安全机制与高效推理部署。 我们的模型能力已在 电商、广告、客服、物流、数据分析、企业知识系统 等全链路业务场景中规模化落地,为集团与生态伙伴带来显著效率提升与成本优化。同时,我们的技术成果已在 ACL、EMNLP 等国际人工智能顶级会议发表,核心能力获得全球学术与产业的认可。 职位描述: 1.大规模预训练数据算法:负责为基础大模型构建高质量的海量数据集,涵盖数据采集、清洗、去重、质量过滤以及Token化等全生命周期的处理。他们通过设计高效的数据处理算法和构建大规模自动化流水线,不断优化训练数据的分布与质量,从而直接提升最终模型的性能、稳定性和泛化能力。 2.预训练算法研发(Pre-training Algorithm Research):负责大规模 Transformer/MoE 模型的预训练体系构建,包括 Optimizer、ResidualNet、MoE结构、NTP/MTP 目标函数设计、多任务混合训练(Multi-task Mixture)、跨语言建模(Cross-lingual Modeling)、数据采样与 curriculum 策略优化;探索更高效的训练收敛路径。 3.模型架构与前沿技术探索(Architecture Innovation & Frontier Research):探索新一代模型架构,包括MoE、长上下文(Long-context)、Diffusion LLM、Omni-model、多模态联合建模等,持续推动模型在推理能力、泛化能力、安全性方面的突破。 职位要求: 1.计算机科学、人工智能、数学等相关专业硕士及以上学历,或具备同等规模的工程经验。 2.深刻理解 Transformer 原理与训练动态(如 Attention 机制、优化器、归一化策略);熟练使用 PyTorch 并掌握大模型训练技巧。 3.熟悉分布式训练体系,包括 DP/ZeRO/TP/PP/EP 等范式;具备处理大模型训练稳定性问题(数值稳定性、梯度爆炸、显存优化等)的经验。 4.有百亿级(100B+)以上参数规模模型 的训练、优化或落地经验者优先。 5.具备扎实的工程能力、良好的 Debug 能力、系统性问题诊断能力与跨团队沟通协作能力。 加分项: 1.熟悉 MoE 训练框架(如 DeepSpeed-MoE、Tutel、Megablocks),对大规模 Expert Routing、负载均衡与专家并行有深入理解。 2.熟悉长上下文技术(RoPE 插值、NTK Scaling、Mamba/Linear Attention、分块注意力等)。 3.有跨模态与文本联合预训练经验(视觉、语音、多模态 Embedding 等)。 4.在国际顶级会议(如 NeurIPS、ICLR、ICML、ACL、EMNLP)发表论文者优先。 工作地点:上海、北京