具身智能-强化学习(灵巧操作方向) 实习生
深圳
硕士及以上
自动化类·计算机类
使用简历深度优化功能,快速提升简历质量
职位介绍
招聘部门:智能制造 / 工业互联网 / 工业自动化
【职位介绍】
1. 安克实习生项目是面向正式校招岗位的人才培养与选拔通道。实习期间将按照校招标准进行系统的培养与综合评估,表现优秀者可直接获得校招转正机会,提前锁定正式校招席位。我们以严肃、长期的视角对待每一位实习生,也期待与你共同成长。
【职位职责】
1. 参与具身操作模型(VA/VLA/WAM)的监督微调(SFT)和强化学习(RL),包括数据格式设计、训练配置、效果评估与 benchmark 分析
2. 负责在真实机器人平台上设计并实施 RL 训练方案,通过真机数据迭代提升具身操作模型在复杂、非结构化环境下的泛化能力与鲁棒性
3. 参与设计与训练通用奖励模型,通过奖励模型引导,实现长程任务(Long-horizon tasks)下的高效真机强化学习
4. 跟踪前沿具身智能方向论文,探索基础模型与 RL 结合的最新技术,推动其在真机任务中的表现超越传统模仿学习方法
【任职要求】
1. 硕士及以上学历在读,计算机、人工智能、机器人、自动化等相关专业,2026 年及以后毕业优先
2. 深刻理解强化学习核心算法(PPO, SAC 等),同时熟悉具身操作大模型(VA/VLA/WAM)的训练逻辑
3. 具备扎实的机器人运动学、动力学基础,能够处理真机实验中的延迟、噪声及硬件非线性特性
4. 精通 Python 与 PyTorch,熟悉主流 RL 框架,具备良好的分布式训练与真机部署工程经验
5. 了解以下至少一个方向的核心技术: Offline-to-online 真机RL算法 去噪模型(Flow matching/Diffusion)RL算法 VLA / 多模态大模型 机器人学习或具身智能基础方法
6. 具备较强的论文阅读与复现能力,能够快速理解并验证新方法
7. 具备良好的数据组织与问题分析能力,能够处理大规模数据集与复杂 pipeline
8. 加分项:Offline-to-online RL 算法经验、去噪模型(Flow matching/Diffusion)RL算法经验
9. 加分项:在具身智能、多模态学习、机器人数据集等方向有科研或开源项目经历
10. 加分项:学术成果:在机器人、RL 或计算机视觉顶会(CoRL, ICRA, IROS, RSS, NeurIPS)、顶刊发表过关于“真机 RL”或“具身大模型”的高质量论文
11. 加分项:前沿生产力工具:熟练使用 Claude Code, Codex, Cursor 等工具进行高效代码开发与系统构建
【学历要求】
硕士及以上
【硬性专业要求】
计算机相关专业、人工智能相关专业、机器人相关专业、自动化相关专业
所属批次:安克创新科技股份有限公司深圳分公司 2026届校园招聘简章企业职位库在招档案→

