logologo
寻找工作
返回简章2026-08-28 更新

模型后训练工程师(J10369)

杭州
硕士及以上
计算机类·统计学类
使用简历深度优化功能,快速提升简历质量
职位介绍
工作职责
1、负责LLM后训练全链路研发与落地,涵盖有监督微调(SFT)、奖励模型训练(RM)、强化学习对齐(RLHF)等核心流程,重点攻坚金融垂域场景的后训练。
2、参与高质量训练、评测数据的构建方案制定与落地,包括数据筛选、清洗、过滤与迭代,构建、优化微调数据集。
任职资格
1、硕士及以上学历,专业不限,本科绩点优秀;
2、扎实的深度学习理论基础,熟悉 Python,了解 PyTorch、Hugging Face 生态,理解 LoRA 微调、分布式训练基础原理;
3、了解 SFT、RLHF 主流对齐方案,有 LLM 微调、NLP 相关课题、项目、竞赛经历优先;
4、具备良好实验思维,善于复盘实验结果;逻辑清晰,学习驱动力强,拥有良好跨团队协作沟通能力。
加分项
1、拥有大模型微调实战项目、开源项目参与经历、大模型赛道竞赛获奖;
2、毕业设计 / 科研课题围绕大模型微调、模型对齐、NLP 方向;
3、接触过数据集治理、模型自动化评测相关工作。