logologo
寻找工作
返回简章2026-07-09 更新

大模型 RL 算法工程师

北京
硕士及以上
计算机类·电子信息类
使用简历深度优化功能,快速提升简历质量
职位介绍
## 职责 - 参与大模型后训练(Post-Training)研究工作,方向包括 On-Policy Distillation (OPD) 和 Agentic Reinforcement Learning - 跟踪 arxiv 最新论文,定期整理 survey,为团队提供方向参考 - 设计并执行算法实验(ablation study),在真实业务模型上验证效果 - 参与自研训练框架的开发与维护,将算法方案工程化为可复现的 training recipe - 分析训练数据(rollout trajectory、工具调用成功率、reward 分布) ## 要求 - 在读硕士或博士,CS/ML/AI 相关方向,实习期 ≥3 个月,每周 ≥4 天 - 了解 LLM Post-Training 范式(SFT / RLHF / PPO / GRPO),至少跑过 SFT 或 DPO 实验 - 了解 RL 基础概念(policy gradient、reward、advantage、GAE) - 熟练 PyTorch 和 Python,能阅读并修改训练框架代码 - 熟悉 Linux、Docker、Git 基本使用 - 加分:用过 verl / TRL / NeMo-RL 等训练框架;了解 vLLM / LightLLM 等推理引擎;有分布式训练(FSDP / Ray)或 GPU 集群使用经验;读过 OPD 或 agentic RL 方向 paper