logologo
寻找工作
返回简章2026-07-20 更新

MaaS 多模态AI搜索算法研究-阿里星

北京
硕士及以上
不限专业
使用简历深度优化功能,快速提升简历质量
职位介绍
职位描述 阿里云MaaS(Model-as-a-Service)平台致力于打造国际领先的大模型服务与应用能力。依托阿里云强大的算力集群、领先的基座模型和完备的平台工程体系,我们围绕多模态AI搜索方向,持续攻坚跨模态理解、复杂内容检索、多模态RAG、长视频理解与智能问答等关键技术问题,打造下一代智能搜索体验与企业级多模态知识服务能力,赋能云上企业客户与生态开发者。 相较于传统关键词搜索或单一模态检索,真实业务中的智能搜索任务更强调对复杂Query的深度理解、对图文/视频/文档等多模态内容的统一表征、对跨模态语义关系的精准建模,以及面向业务场景的可解释、高可靠问答生成能力。我们正在寻找具备技术信仰、研究热情与探索精神的优秀人才,通过多模态表征学习、Embedding/Reranker优化、多模态RAG链路建设、长视频理解与大模型后训练等技术创新,推动搜索系统从“信息匹配工具”向“智能理解与知识生成系统”演进。 核心职责 1. 多模态表征与排序模型优化:面向海量图文、视频、文档等多模态数据,研究和开发业界领先的多模态表征模型、Embedding 模型与重排序模型。围绕复杂 Query 理解、跨模态语义对齐、细粒度相关性建模、难负样本挖掘与排序目标优化等问题开展算法创新,持续提升多模态检索在复杂业务场景下的准确性、召回率、相关性和鲁棒性。 2. 多模态检索增强生成(RAG)链路优化:面向企业知识库、复杂文档检索、图文混合问答、视频内容问答等真实场景,参与多模态 RAG 链路的核心算法攻坚。研究多模态 Query 理解、跨模态意图识别、复杂文档解析、PDF/图表/表格混合检索、多粒度内容切分与召回、检索结果融合、证据选择与最终答案生成等关键技术,提升系统在复杂知识场景下的可用性、准确性与可解释性。 3. 长视频理解与视频搜索能力建设:研究高效的长视频理解与搜索范式,攻克超长序列建模、长程依赖捕捉、视频事件定位、跨片段语义关联与多轮视频问答等关键问题。通过视频表征学习、时序建模、多模态对齐与大模型增强推理等方法,提升模型对视频深层语义、人物关系、场景变化、事件演化和复杂用户问题的理解能力,建设面向真实业务的视频检索与视频问答能力。 4. 大模型后训练与搜索系统效果优化:围绕多模态搜索和智能问答的业务目标,参与 SFT、偏好优化、RLHF / DPO / GRPO 等大模型后训练工作,优化模型在检索理解、答案生成、结果排序、复杂指令遵循和业务指标上的综合表现。结合离线评测、在线实验、错误分析和数据闭环,持续沉淀高质量训练数据、评测基准与算法范式,推动核心能力反哺至 MaaS 平台模型与搜索产品体系。 职位要求 1. 学术背景:计算机、人工智能、软件工程、数学等相关方向优秀硕士或博士,2027届应届毕业生优先;具备扎实的机器学习、深度学习、信息检索和多模态大模型理论基础。 2. 代码与工程能力:具备优秀的编码能力、实验实现能力和数据结构基础,熟练掌握Python和PyTorch;有大模型、多模态模型、Embedding、Reranker、RAG、搜索推荐等相关代码实现、训练或系统落地经验。 3. 算法与模型经验:熟悉 LLM/MLLM、跨模态检索、图文检索、视频理解、视频问答、文档智能解析等方向中的一个或多个;具备 SFT、偏好优化、RLHF/DPO/GRPO等大模型后训练经验,能够通过数据构造、训练策略设计和实验分析持续提升模型效果。 4. 问题抽象与落地能力:对大模型、多模态搜索、RAG、视频理解和智能问答等方向有浓厚兴趣,能够从企业知识检索、复杂文档理解、视频内容搜索等真实业务场景中抽象关键技术问题,并通过算法迭代、实验验证和工程优化推动能力落地。 5. 科研能力:具备优秀的科研素养、问题拆解能力和实验分析能力,能够围绕多模态表征学习、跨模态检索、多模态 RAG、长视频理解、大模型后训练等方向开展创新研究。在NeurIPS、ICML、ICLR、EMNLP、CVPR、SIGIR、AAAI等顶级会议或期刊发表过3 篇以上大模型或多模态相关论文。 6. 综合素质:具备良好的主动性、责任心和团队沟通协作能力,能够在开放问题和快速变化的业务场景中持续推进,并对技术深度、业务价值和用户体验保持高标准追求。 7. 加分项:参加过ACM/ICPC、Kaggle、天池、数学建模等竞赛并取得优秀成绩者优先;在图文检索、视频理解、复杂文档解析、RAG 系统、开源大模型或多模态评测等方向有深入实践、开源贡献或高影响力研究成果者优先。