公司简介:
北京市商汤科技开发有限公司成立于2014-11-14,法定代表人为刘强,注册资本为225000万元,统一社会信用代码为911****83181538675,企业注册地址位于北京市海淀区北四环西路58号11层1101-1117室,所属行业为科技推广和应用服务业,经营范围包含:一般项目:技术服务、技术开发、技术咨询、技术交流、技术转让、技术推广;数字技术服务;文艺创作;专业设计服务;图文设计制作;平面设计;广告设计、代理;广告发布;数字广告设计、代理;计算机软硬件及外围设备制造;计算机软硬件及辅助设备批发;电子产品销售;技术进出口。(除依法须经批准的项目外,凭营业执照依法自主开展经营活动)(不得从事国家和本市产业政策禁止和限制类项目的经营活动。)。企业当前经营状态为存续。在招职位如下:
大模型 RL 算法工程师
工作城市:北京
薪资:9k-15k
学历要求:硕士,博士
岗位性质:实习
岗位描述:
薪资:9k-15k
学历要求:硕士,博士
岗位性质:实习
岗位描述:
## 职责
- 参与大模型后训练(Post-Training)研究工作,方向包括 On-Policy Distillation (OPD) 和 Agentic Reinforcement Learning
- 跟踪 arxiv 最新论文,定期整理 survey,为团队提供方向参考
- 设计并执行算法实验(ablation study),在真实业务模型上验证效果
- 参与自研训练框架的开发与维护,将算法方案工程化为可复现的 training recipe
- 分析训练数据(rollout trajectory、工具调用成功率、reward 分布)
## 要求
- 在读硕士或博士,CS/ML/AI 相关方向,实习期 ≥3 个月,每周 ≥4 天
- 了解 LLM Post-Training 范式(SFT / RLHF / PPO / GRPO),至少跑过 SFT 或 DPO 实验
- 了解 RL 基础概念(policy gradient、reward、advantage、GAE)
- 熟练 PyTorch 和 Python,能阅读并修改训练框架代码
- 熟悉 Linux、Docker、Git 基本使用
- 加分:用过 verl / TRL / NeMo-RL 等训练框架;了解 vLLM / LightLLM 等推理引擎;有分布式训练(FSDP / Ray)或 GPU 集群使用经验;读过 OPD 或 agentic RL 方向 paper
- 参与大模型后训练(Post-Training)研究工作,方向包括 On-Policy Distillation (OPD) 和 Agentic Reinforcement Learning
- 跟踪 arxiv 最新论文,定期整理 survey,为团队提供方向参考
- 设计并执行算法实验(ablation study),在真实业务模型上验证效果
- 参与自研训练框架的开发与维护,将算法方案工程化为可复现的 training recipe
- 分析训练数据(rollout trajectory、工具调用成功率、reward 分布)
## 要求
- 在读硕士或博士,CS/ML/AI 相关方向,实习期 ≥3 个月,每周 ≥4 天
- 了解 LLM Post-Training 范式(SFT / RLHF / PPO / GRPO),至少跑过 SFT 或 DPO 实验
- 了解 RL 基础概念(policy gradient、reward、advantage、GAE)
- 熟练 PyTorch 和 Python,能阅读并修改训练框架代码
- 熟悉 Linux、Docker、Git 基本使用
- 加分:用过 verl / TRL / NeMo-RL 等训练框架;了解 vLLM / LightLLM 等推理引擎;有分布式训练(FSDP / Ray)或 GPU 集群使用经验;读过 OPD 或 agentic RL 方向 paper

