logologo
寻找工作
返回简章2026-07-20 更新

MaaS Agentic视觉生成算法研究-阿里星

北京
硕士及以上
不限专业
使用简历深度优化功能,快速提升简历质量
职位介绍
职位描述 阿里云MaaS(Model-as-a-Service)平台致力于打造国际领先的大模型服务与应用能力。依托阿里云强大的算力集群、领先的基座模型和完备的平台能力,我们围绕Agentic图像与视频生成方向,持续攻坚生成模型在复杂任务中的可控性、一致性、指令遵循与业务可用性等关键问题,打造下一代智能化视觉创作平台与解决方案,赋能短剧/漫剧、互动娱乐、电商广告等核心业务场景。 相较于公开 Benchmark或单轮生成Demo,真实商业内容生成任务更强调多轮创意理解、图像与视频一致性、复杂指令遵循和高质量交付。我们正在寻找具备技术信仰、研究热情与探索精神的优秀人才,通过后训练、图像/视频智能体、推理侧扩展与系统化评测等技术创新,推动生成模型从“单点工具”向“自主创作系统”演进,并将真实场景中沉淀的关键能力持续反哺至基座模型。 核心职责 1. Agentic视觉生成算法研究:面向电商广告、短剧/漫剧创作、互动娱乐等真实业务场景,开展视觉创作 Agent 架构设计与算法创新。研究任务自主拆解、分镜规划、长短期记忆、工具调用、自我反思与修正等能力,提升模型从模糊创意意图到高质量图像/视频内容生成的端到端规划与执行能力。 2. 一致性控制与长视频生成能力建设:研究基于Agent上下文记忆与多模态条件控制的图像/视频生成算法,攻克复杂场景下角色IP、人物身份、服饰外观、场景风格、物体关系、运动规律与镜头衔接的一致性难题,持续提升长时序生成中的时空稳定性、剧情连贯性、视觉质量和可控生成能力。 3. 推理侧扩展与智能体系统优化:研究图像/视频生成大模型在推理阶段的Test-time Scaling策略,探索“规划—生成—评估—修正”的闭环推理范式。结合多Agent协作、工具调用、自动评测与重生成机制,提升视觉创作系统在复杂提示词、多约束任务和真实业务交付中的稳定性与效率。 4. 端到端业务交付与基座能力反哺:面向广告营销、短视频生产、短剧/漫剧创作等业务目标,打造端到端Agentic视觉生成解决方案,并优化模型在训练、推理、评测和交付环节的综合效能。抽象真实业务中的共性问题,将经过验证的算法方案、高质量数据、训练范式和评测基准沉淀为通用能力,持续反哺基座模型迭代。 职位要求 1.学术背景:计算机、人工智能、机器学习、数学等相关方向优秀硕士或博士(2027 届毕业生),具备扎实的机器学习、深度学习和多模态大模型理论基础。 2.代码与工程能力:具备优秀的编码能力与数据结构基础,熟练掌握Python和 PyTorch,有大模型、多模态模型或生成模型代码实现和训练经验。 3.问题抽象与落地能力:对真实业务场景中的复杂问题有强烈兴趣,能够从广告营销、短剧创作、内容生成等场景中抽象关键技术问题,并通过实验分析、算法迭代和工程优化推动模型能力落地。 4.科研能力:具备优秀的科研素养和实验分析能力,有能力围绕Agentic视觉生成、多模态生成、视频理解、后训练、推理侧扩展等方向开展创新研究。在 CVPR、NeurIPS、ICLR、ICML、ICCV、SIGGRAPH 等顶级会议或期刊发表过多篇相关论文。 5.加分项:在图像/视频生成与编辑、Agent、多模态理解、模型评测、开源大模型等方向有深入经验者优先;有高影响力论文、知名开源项目贡献,或曾参与主流大模型、多模态模型、视频生成项目建设者优先。