logologo
寻找工作
返回简章2026-07-28 更新

大模型安全研究-阿里星

杭州
硕士及以上
计算机类·数学类
使用简历深度优化功能,快速提升简历质量
职位介绍
职位描述
随着人工智能技术的快速发展,大规模语言模型(Large Language Models, LLMs)在各行各业中得到广泛应用,其安全性、可控性与可信度已成为制约其落地的关键因素。当前,大模型在推理过程中可能表现出不可预测的行为,例如生成虚假信息、泄露隐私、响应恶意攻击指令、难以解释决策逻辑等问题,严重影响其在金融、医疗、政务、教育等高风险领域的部署。为应对上述挑战,我们亟需构建具备“内生安全”能力的大模型系统——即从模型设计、训练机制、推理过程到输出结果的全生命周期中,嵌入安全防护、行为对齐、攻防鲁棒性、可解释性及幻觉缓解等关键能力。该目标要求我们深入理解模型内部工作机制,探索前沿理论方法,并将其转化为工程实践。

1. 负责大模型的内生安全对齐训练,覆盖通用合规、幻觉、越狱等风险,沉淀安全奖励模型、高质量数据构建链路、训练策略等安全组件和方法论。
2. 负责大模型的可解释专题研究,能针对大模型的特定行为进行实验分析(包括拒答、幻觉、偏见等),研发评测与诊断工具。
3. 负责大模型幻觉的专题研究,包括评测、内生加固、外层检测。

职位要求
1. 计算机、数学、人工智能等相关专业硕士及以上学历,有大模型安全或偏好对齐领域背景者优先。
2. 精通Python/C++/Java中至少一门语言,具备扎实的数据结构、算法基础及工程化能力,熟悉深度学习框架(如PyTorch、TensorFlow)。
3. 有较强的问题分析与解决能力,能够针对实验结论提出假设并设计方案验证,并具备良好的技术洞察力与业务敏感度。
4. 良好的团队协作与跨部门沟通能力,能推动算法与产品、工程团队的高效协同。
5. 持续学习与技术输出能力,在顶会发表过相关论文或申请专利者优先,能通过技术分享带动团队能力提升。