logologo
寻找工作
返回简章2026-07-25 更新

算法工程师-强化学习

杭州
本科及以上
自动化类·计算机类
使用简历深度优化功能,快速提升简历质量
职位介绍
职位描述 1. 负责大语言模型(LLM)及多模态模型后训练(Post-Training)阶段的强化学习算法迭代; 2. 深入研究并优化基于人类、AI 及环境反馈的 RL 算法(如 PPO, DPO, GRPO, ORPO 等),提升模型的规则遵循与多目标平衡能力; 3. 探索基于 RL 的 Reasoning 模型相关技术(如 CoT 思维链、CoA 动作链的融合),实现原生具备多步思考和工具调用能力的推理模型; 4. 将 RL + LLM 技术应用于实际业务(如跨境贸易搜索、商家智能诊断、电商 Agent 等),设计并实现智能化的决策优化方案,提升业务效能。 职位要求 1. 本科及以上学历,计算机、数学、统计学、物理或自动化等相关专业优先; 2. 具备扎实的机器学习、深度学习及自然语言处理(NLP)理论基础,熟悉 Transformer、ViT、CLIP 等主流预训练模型; 3. 深入理解强化学习原理,熟悉 RM、PPO、DPO、GRPO、MBRL 等至少数种 RL 算法及其应用范式; 4. 精通 Python 编程,熟练运用 PyTorch 进行模型训练与调试; 5. 具备极佳的工程实现能力,了解大模型训练系统(如分布式训练、加速优化)或相关底层代码库者优先。