大模型 RL 算法工程师
北京
硕士及以上
计算机类·电子信息类
使用简历深度优化功能,快速提升简历质量
职位介绍
## 职责
- 参与大模型后训练(Post-Training)研究工作,方向包括 On-Policy Distillation (OPD) 和 Agentic Reinforcement Learning
- 跟踪 arxiv 最新论文,定期整理 survey,为团队提供方向参考
- 设计并执行算法实验(ablation study),在真实业务模型上验证效果
- 参与自研训练框架的开发与维护,将算法方案工程化为可复现的 training recipe
- 分析训练数据(rollout trajectory、工具调用成功率、reward 分布)
## 要求
- 在读硕士或博士,CS/ML/AI 相关方向,实习期 ≥3 个月,每周 ≥4 天
- 了解 LLM Post-Training 范式(SFT / RLHF / PPO / GRPO),至少跑过 SFT 或 DPO 实验
- 了解 RL 基础概念(policy gradient、reward、advantage、GAE)
- 熟练 PyTorch 和 Python,能阅读并修改训练框架代码
- 熟悉 Linux、Docker、Git 基本使用
- 加分:用过 verl / TRL / NeMo-RL 等训练框架;了解 vLLM / LightLLM 等推理引擎;有分布式训练(FSDP / Ray)或 GPU 集群使用经验;读过 OPD 或 agentic RL 方向 paper

