logologo
寻找工作
2026-07-25 更新

阿里云计算有限公司

行业应用软件 · 民营企业 · 成立18年
简章详情

公司简介:

阿里云(www.aliyun.com)创立于2009年,是全球领先的云计算及人工智能科技公司,为200多个国家和地区的企业、开发者和政府机构提供服务。2017年1月阿里云成为奥运会全球指定云服务商。2017年8月阿里巴巴财报数据显示,阿里云付费云计算用户超过100万。阿里云致力于以在线公共服务的方式,提供安全、可靠的计算和数据处理能力,让计算和人工智能成为普惠科技。阿里云在全球18个地域开放了45个可用区,为全球数十亿用户提供可靠的计算支持。此外,阿里云为全球客户部署200多个飞天数据中心,通过底层统一的飞天操作系统,为客户提供全球独有的混合云体验。

在招职位如下:

Token Foundry——前端开发工程师

工作城市:杭州
薪资:9k-15k
学历要求:本科,硕士,博士
岗位性质:实习
岗位描述:
*此为暑期实习岗位,向27届同学开放,28届及以后同学请勿投递~

【岗位描述】
1. 负责全栈式开发,不只有Node全栈,还有页面搭建、中后台低代码等场景;
2. 负责移动端开发,不只有移动Web、小程序多端,还有诸如Weex动态化等场景;
3. 负责性能、架构等方面的改进与优化,还能参与ElementUI/MorJS等开源产品和社区建设;
4. 有机会自己亲手打造一个产品的从设计到发布。

【职位要求】
1. 熟练使用各种Web前端技术,包括HTML(5)/CSS(3)/Java script等,并有相关的项目开发经验或成果;
2. 熟悉前端工程化,用过git,gulp或webpack等工具,最好有自己的github仓库;
3. 有基于Ajax应用的开发经验,有NodeJS/Java开发经验,或者有移动端开发经验;
4. 深刻理解Web标准,对可用性、可访问性等相关知识有实际的了解;
5. 对算法、数据结构、建模有一定了解;
6. 关注AI业界技术发展趋势,有使用Claude Code、Cursor、通义灵码等AI工具辅助开发经验,一定提示词工程能力;
7. 良好的沟通能力和团队协同能力,能与他人合作,共同完成目标。

【加分项】
1. 有大型互联网公司相关岗位实习及项目开发经历;
2. AI前端应用开发:有开发过LLM相关前端应用,参与AI相关产品前端实现;
3. AI辅助开发实践:使用AI工具rules,增加自定义命令,理解上下文工程来增强AI工具的能力;
4. 技术视野:对AI技术体系有浓厚兴趣,掌握LLM/PE/Agent/RAG等原理与运用;关注AI与前端技术的发展趋势,了解大模型能力及其在开发中的应用场景;
5. 在相关领域国际顶级会议、期刊发表论文,或相关学术会议组织的权威比赛中获奖。

测试开发工程师

工作城市:杭州
薪资:9k-15k
学历要求:硕士,博士
岗位性质:实习
岗位描述:
【职位描述】
1. 深入业务场景,参与产品全生命周期质量体系建设,确保复杂业务逻辑的正确性与系统稳定性;
2. 研发前沿的测试工具与平台,包括自动化测试框架、性能压测平台、故障演练系统及资损防控体系;
3. 通过代码审计、架构分析、全链路压测等手段,挖掘系统深层次缺陷,为业务的丝滑体验保驾护航;
4. 利用AI大模型,打造测试智能体,推动质量工作迈入AGI时代。

【职位要求】
1. 计算机、数学、信息管理等相关专业;
2. 熟悉C/C++、Java、Python等一门及以上编程语言;
3. 熟悉软件研发流程,掌握软件测试理论和方法,有设计和开发测试工具和自动化测试框架的能力;
4. 喜欢钻研技术,对质量捍卫有热情,不断追求产品用户体验的完善;
5. 良好的沟通能力和团队协同能力,能与他人合作,共同完成目标;
6. 熟悉LLM核心原理,熟悉Agent设计逻辑,在RAG/Prompt工程/CE工程领域有实践经验最佳,有大模型微调的实践经验优先。

Token Foundry-语音多模态大模型算法工程师

工作城市:杭州
薪资:9k-18k
学历要求:硕士,博士
岗位性质:实习
岗位描述:
*此岗位为暑期实习,为毕业时间2026-11-01 ~ 2027-10-31同学开放,28届及以后的同学请勿投递~
Base:北京/杭州

职位描述:
1. 负责语音生成/语音识别/语音合成/声纹/语种/情感等方向的算法研究和开发;
2. 负责语音信号处理的相关算法研究和开发,包括语音增强、回声消除、混响消除、自动增益控制、波达方向估计、波束形成等;
3. 负责口语语言理解/用户意图理解/对话模型/语音交互等算法研究和开发;
4. 语音统一多模态大模型:研究下一代多模态通用大模型技术范式,实现文本、语音、视觉模态的联合建模。

职位要求:
1. 硕士及以上学历,计算机科学、人工智能、语音信号处理、自然语言处理或相关专业;
2. 具备扎实的计算机与机器学习理论基础,熟练掌握至少一种编程语言(如 Python/C++),工程实现能力强;
3. 熟悉语音识别、语音合成、口语语言处理、语音交互等核心技术,具备以下一项或多项经验:
- 语音端到端声学建模(如 Transformer、Whisper、Qwen-Omni、Baichuan-Omni);
- 语音无监督预训练(如 Wav2Vec);
- 大语言模型(LLM)相关研发,包括预训练、SFT、强化学习;
- 语音端到端大模型(Audio Encoder + LLM)的联合训练与优化;
4. 对前沿技术有强烈探索欲,具备优秀的自驱力、独立思考能力和团队协作精神。

【加分项】
1. 在 NeurIPS、ICML、ICLR、CVPR、ACL、AAAI、Interspeech、ICASSP、ASRU 等顶级会议/期刊发表过论文(尤其一作);
2. 在 ACM、Kaggle 或语音/多模态相关国际竞赛中获得优异成绩(如前三名);
3. 具备跨领域研究经验(如 NLP + 语音、音频信号处理 + 深度学习);
4. 成功复现或改进过 SOTA 语音算法,或有开源项目贡献。

前端开发工程师

工作城市:杭州
薪资:9k-15k
学历要求:硕士,博士
岗位性质:实习
岗位描述:
【职位描述】
1. 负责全栈式开发,不只有Node全栈,还有页面搭建、中后台低代码等场景;
2. 负责移动端开发,不只有移动Web、小程序多端,还有诸如Weex动态化等场景;
3. 负责性能、架构等方面的改进与优化,还能参与ElementUI/MorJS等开源产品和社区建设;
4. 有机会自己亲手打造一个产品的从设计到发布。

【职位要求】
1. 熟练使用各种Web前端技术,包括HTML(5)/CSS(3)/Java script等,并有相关的项目开发经验或成果;
2. 熟悉前端工程化,用过git,gulp或webpack等工具,最好有自己的github仓库;
3. 有基于Ajax应用的开发经验,有NodeJS/Java开发经验,或者有移动端开发经验;
4. 深刻理解Web标准,对可用性、可访问性等相关知识有实际的了解;
5. 对算法、数据结构、建模有一定了解;
6. 关注AI业界技术发展趋势,有使用Claude Code、Cursor、通义灵码等AI工具辅助开发经验,一定提示词工程能力;
7. 良好的沟通能力和团队协同能力,能与他人合作,共同完成目标。

【加分项】
1. 有大型互联网公司相关岗位实习及项目开发经历;
2. AI前端应用开发:有开发过LLM相关前端应用,参与AI相关产品前端实现;
3. AI辅助开发实践:使用AI工具rules,增加自定义命令,理解上下文工程来增强AI工具的能力;
4. 技术视野:对AI技术体系有浓厚兴趣,掌握LLM/PE/Agent/RAG等原理与运用;关注AI与前端技术的发展趋势,了解大模型能力及其在开发中的应用场景;
5. 在相关领域国际顶级会议、期刊发表论文,或相关学术会议组织的权威比赛中获奖。



27届-阿里云开放平台-AI应用研发工程师

工作城市:杭州
薪资:12k-18k
学历要求:硕士,博士
岗位性质:实习
岗位描述:
聚焦核心业务场景,利用Agent等前沿技术推动AI落地。你将参与从需求洞察到系统构建的全流程,通过研发智能应用与工具,提升业务效率与效果,实现技术驱动业务增长的完整闭环,推动智能规模化演进,实现技术价值转化。

具体职责包括以下相关方向的一项或多项:
1.需求理解与归因:
● 深入业务场景,利用数据挖掘与特征分析完成现象归因;精准识别高价值问题,将模糊的业务痛点转化为明确的 AI 解决目标。
2.架构设计:
● 面向具体业务需求,设计 AI 原生系统架构;参与 Agent 系统核心模块的规划,包括记忆管理、推理策略与工具编排,兼顾架构的灵活性、可扩展性与工程可落地性。
3.知识与环境构建:
● 搭建AI与现有业务系统的交互环境,涵盖 API 接入、RAG 知识库构建、记忆方案设计;持续优化召回质量与上下文注入策略,为模型提供准确、及时的执行环境与知识支撑。
4.核心能力实现:
● 负责Agent关键模块的工程落地,实现意图识别、任务拆解与反思纠错闭环;封装标准化SDK/API服务,构建Agent观测体系,实现全链路追踪与多维归因分析。
5.系统迭代与演进:
● 建立搭建自动化评测与回测机制,通过调优与Case分析不断收敛效果与性能提升的最优路径;沉淀方法论与可复用组件,推动 AI 能力从单点验证走向规模化落地。
6.性能优化:
● 优化高并发场景下的系统性能,通过异步处理与降级策略保障稳定性,通过低侵入性观测手段保障系统的长期稳定运行。



AI数据工程师

工作城市:杭州
薪资:12k-18k
学历要求:硕士,博士
岗位性质:实习
岗位描述:
以数据驱动、评测驱动的方式,构建数据高效迭代闭环,建立从数据寻源、标注、处理、合成到评测的全链路数据体系,持续建设高质量数据集和评测集,不断推动基础模型能力提升,推动AI模型和应用发展。

具体职责包括以下相关方向的一项或多项:
1.全模态数据处理:
● 参与研发万亿级数据规模的全模态数据处理引擎。
● 通过设计高性能、可复用的数据处理算子,构建覆盖全生命周期的自动化数据生产pipeline。
● 解决海量数据在清洗、脱敏及增强过程中的计算瓶颈,利用智能筛选与精准对齐算法交付极具竞争力的高质量训练集。
● 持续优化全链路交付效能,确保数据质量与处理规模世界领先。
2.大模型数据理解与资产体系建设:
● 参与全模态AI数据基础设施建设。 负责设计支撑AGI 演进的多模态语义标签标准与特征映射体系,通过构建先进的质量度量模型与内容理解框架,实现对海量 3D、视频、音频等复杂数据的自动化精炼,精细化的数据理解体系加速AGI发展的科学性与高效性。
● 构建核心AI数据战略资产体系。 结合业务垂直场景与最前沿算法,深度参与海量数据的解析、挖掘与性能优化,驱动EB级全模态数据的深度解析与价值发现;通过全链路的智能处理与挖掘优化,将海量数据转化为高稀缺性和行业竞争壁垒的AI数据资产。
3.领域全链路数据策略建设:
● 设计实现面向大模型细分领域的模型性能优化的全链路数据体系,涵盖评测体系设计、数据加工与数据合成链路、数据标注策略设计。
● 深度理解大模型细分领域的技术点,实践“评测驱动”(Evaluation-Driven Development,EDD)的大模型迭代方法,确保千问、万相等基础模型能力持续处于世界领先水平。

职位要求:
1.基础条件
● 计算机、软件工程、数学、统计、人工智能、大数据、机器人等相关专业硕士/博士优先(非此类专业,有相关经验亦可)。
● 有顶会论文/高影响项目/开源贡献者加分。

2.专业能力
● 大数据处理技术:深入理解大规模分布式数据处理系统原理,熟悉Spark/Flink/Ray等开源技术栈;深入理解流批处理原理(计算模型、调度和资源管理、容错与一致性等);可独立完成面向全模态数据(结构化/文本/图像/音频/视频)的批流一体数据处理开发与优化。
● 大模型技术的理解与掌握:深入理解大模型核心原理,包括Transformer架构、上下文学习(ICL)、指令微调(Instruction Tuning)、检索增强生成(RAG)及推理机制(如思维链CoT)等关键技术;熟悉大模型在预训练、监督微调(SFT)和强化学习对齐(RLHF/RLAIF)等阶段的数据需求与优化逻辑。能够基于领域场景设计高质量数据处理与合成算法,通过系统化的数据迭代、评估反馈与模型微调闭环,持续驱动大模型在特定领域的能力提升与性能优化 。
● AI编程意识与工程思维:能持续快速学习AI研发新范式,熟练运用主流AI工具,独立完成从需求分析、架构设计到高质量代码实现的系统级开发任务,并确保代码的可维护性、可扩展性与工程规范性。
● 跨学科、跨领域的理解: 通过评测及数据驱动的方式提升模型的效果,结合对大模型及垂直领域的深度融合理解,能够设计面向领域的高质量评测集和数据集,针对基础模型短板设计相应的模型训练策略,不断突破基础模型的能力上限。
● 工程与系统素养:能至少在一种主流编程语言(如 Java / Python / C++ 等)上有深度的实践经验,掌握常见工程实践并具备优秀的Coding能力,能够根据场景灵活选型并快速上手。

3.能力特质
● 好奇心:对AI有热情、对前沿技术与产品好奇。
● 持续学习:能快速地学习、掌握新的知识与技术。
● 沟通交流:能与其他人进行良好的沟通、交流,拓宽自身的视野与知识面。
● 认真负责:有责任感,能确保工作完整的闭环、高质量的交付,为团队、合作方提供可信赖的支撑。

AI产品评测工程师

工作城市:杭州
薪资:12k-18k
学历要求:硕士,博士
岗位性质:实习
岗位描述:
职位描述:
1. 构建科学高效的AI产品评测体系,持续优化评测方法、指标和数据集;
2. 搭建评测工具平台,执行评测方案并拿到评测结论;
3. 根据评测结论对AI模型和AI产品进行能力分析和迭代优化分析,提出优化建议;
4. 关注业界前沿AI模型和产品发展,关注AI前沿评测方法发展,并转化为内部评测实践。

职位要求:
1. 计算机、人工智能、统计学、数学或相关专业;
2. 熟练掌握Python语言,有工程开发、算法开发或评测工具开发经验优先;
3. 对AI相关产品发展有极高热情,关注业界发展,喜欢尝试新鲜事物;
4. 优秀的团队合作精神和沟通表达能力,具备敏锐感知和持续学习能力。



研发工程师java(Base多地区)27届校招

工作城市:北京
薪资:12k-16k
学历要求:硕士,博士
岗位性质:实习
岗位描述:
1.参与基础软件的设计、开发和维护,如分布式文件系统、缓存系统、Key/alue 存储系统、数据库、Linux 操作系统和Java 优化等;
2. 参与高性能分布式服务端程序的系统设计,阿里巴巴的产品提供强有力的后台支持,在海量的网络访问和数据处理中,设计并设施最强大的解决方案:
3.参与搜索引擎各个功能模块的设计和实现,构建高可靠性、高可用性、高可扩展性的体系结构,满足日趋复杂的业务需求;
4.参与超大规模的云计算底层核心技术的设计和实现,为阿里巴巴内部以及百万级云计算用户提供高性能高质量高弹性网络,计算及存储能力;
5. 参与产品的开发和维护,完成从需求到设计、开发和上线等整个项目周期内的工作;为用户提供丰富而有价值的桌面或无线软件产品;6.参与海量数据处理和开发,通过sql、pllsgl、java 进行 etl 程序开发,满足商业上对数据的开发需求:
1. 热爱编程,熟悉掌握但不限于 JAVA/C/C++/PHP/NET 等编程语言中的一种或几种,有良好的编程习惯;
2. 熟悉网络编程和多线程编程,对 TCP/IP,HTTP 等网络协议有一定的理解,并了解XML 和 HTML 语言;
3. 熟悉 Unix/Linux/Win32 环境下编程,熟练使用调试工具,并熟悉 Perl,Python,shell 等脚本语言;
4. 热衷于数据库技术,能够熟练编写 SQL脚本,参与过MySql 或 Oracle 应用开发项目;
5. 对数据结构、算法有一定了解;
6. 学习能力强,对新事物保有好奇心,有良好的沟通能力和团队协同能力,善于独立思考并反思总结。
【加分项】
1. 热衷于ACM,在校期间参与过大学生数学建模竞赛,“挑战杯”,机器人足球比赛等,或作为骨干参与过学生网站的建设和开发;2. 在相关领域国际顶级会议、期刊发表论文,或相关学术会议组织的权威比赛中获奖
Base:(北京 / 成都 / 广州 / 杭州 / 上海 / 深圳 / 西安)



C/C++

工作城市:上海
薪资:20k-40k
学历要求:本科,硕士,博士
岗位性质:全职
岗位描述:
岗位职责
参与云计算基础设施高性能网络系统研发,覆盖虚拟网络、主机网络、数据中心网络、智能网卡、RDMA、DPDK、eBPF、XDP 等方向。
负责网络转发链路、协议栈、流量调度、网络可观测性、性能优化等核心模块的设计、开发与验证。
深入分析网络时延、吞吐、抖动、丢包等性能问题,构建自动化压测、诊断和调优能力。
参与大规模分布式环境下网络可靠性、稳定性和资源效率优化,支撑高并发、低时延业务场景。
跟进高性能网络、内核网络、云原生网络、硬件卸载等前沿技术,并推动工程落地。
任职要求
计算机、通信、电子工程、软件工程等相关专业,本科及以上学历。
熟悉 C 或 C++ 编程,具备扎实的数据结构、操作系统、计算机网络基础。
熟悉 Linux 系统原理,了解进程线程、内存管理、文件系统、网络协议栈等基础机制。
理解 TCP/IP、UDP、HTTP、RPC、负载均衡、网络虚拟化等基本概念。
具备良好的问题分析能力和工程实现能力,能够通过日志、抓包、性能工具定位复杂问题。
具备良好的学习能力、沟通协作能力和责任心,愿意深入底层系统和基础设施方向。
加分项
有 Linux 内核网络、DPDK、eBPF、XDP、RDMA、智能网卡、虚拟交换机相关实践经验。
熟悉性能分析工具,如 perf、ftrace、bcc、tcpdump、wireshark、flamegraph 等。
有 ACM、系统竞赛、开源项目、内核社区、网络系统课程项目经验。
有分布式系统、云计算、容器网络、Kubernetes 网络插件相关经验。
你将参与
云计算核心网络基础设施建设,面对大规模、高并发、低时延的真实业务场景,和团队一起持续优化网络性能、稳定性和资源效率,打造面向未来的高性能网络系统。



算法工程师-AI Agent-秒悟

工作城市:杭州
薪资:12k-18k
学历要求:硕士,博士
岗位性质:实习
岗位描述:
校招实习生,仅面向27届毕业同学,28届及之后毕业的同学可以关注日常实习岗位

职位描述:
1. 研发并优化 Agent 的核心能力模块,包括但不限于自主规划(Planning)、多步推理(Reasoning)、工具调用(Tool Use)、长短期记忆(Memory)及 RAG 增强;
2.应用强化学习(RL)、模仿学习、SFT 及偏好对齐(DPO/PPO)技术,提升模型在复杂任务中的执行成功率与逻辑性;
3. 参与构建高性能、高可用的 Agent 框架或 Runtime 系统,探索多智能体(Multi-Agent)协同与自我迭代学习范式;
4. 构建端到端的智能体评测体系,通过数据驱动的方式持续迭代算法,推动 Agent 在搜索、办公、创作或垂直行业场景的落地。

职位要求:
1. 本科及以上学历,计算机、人工智能、数学、电子信息等相关专业优先;
2. 精通 Python,具备扎实的 C/C++/Java(至少一门)基础,具备极佳的工程实现能力,追求高质量的代码设计;
3. 深入理解 Transformer 架构及大模型(LLM)原理;熟悉深度学习主流框架(PyTorch/TensorFlow);掌握强化学习、自然语言处理或计算机视觉的基础理论;
4. 极强的求知欲与学习能力,对新技术保有好奇心;逻辑清晰,善于独立思考并反思总结;具备良好的沟通能力和团队协同意识。

【加分项】
1. 在 NeurIPS, ICML, ICLR, ACL, CVPR 等顶级会议发表过论文;
2. 在 ACM-ICPC、NOI/IOI、TopCoder、Kaggle 或知名 AI 算法大赛中获得优异名次;
3. 开知名开源项目的核心贡献者或在开源社区有影响力;
4. 有 LangChain、AutoGen、MetaGPT 等 Agent 框架的使用或二次开发经验;
5. 熟悉 RAG 架构或在搜索/推荐场景有相关实践。



阿里星-大模型推理优化算子与框架适配-27届

工作城市:北京
薪资:12k-24k
学历要求:硕士,博士
岗位性质:实习
岗位描述:
职位描述
1. 参与vLLM/SGLang等开源推理引擎的底层算子优化,重点攻关高性能Attention算子创新,通过编译优化(Triton/CUDA Graphs)提升单服务实例的推理性能;
2. 负责异构硬件的适配与算子自动调优,最大化利用硬件特性(Tensor Core、HBM带宽、NVLink拓扑);
3. 配合前沿模型压缩算法(量化、剪枝、蒸馏)探索算子级优化方案,创新请求调度算法,优化用户体验和系统吞吐;
支撑云上客户大模型部署标杆场景,将技术成果沉淀为PAI推理服务核心特性;
4. 探索云上混部署方法,将不同尺寸、不同访问频度、不同优先级的模型混合部署在异构资源池中,并保证SLA。通过请求调度方法的创新、资源共享方法创新,降低总体部署成本、提升资源利用率和弹性;
5. 推动底层算子优化方向的学术影响力和开源影响力产出。
职位要求
1. 具备扎实的计算机基础知识、C++/Python编程能力,熟悉常见数据结构和设计模式;
2. 具有很强的学习能力、复杂问题归纳梳理能力、沟通和团队协作能力,具备能够深度钻研技术的耐心;
3. 有很强的学术研究能力和优秀的学术成果(AI领域顶会/顶刊论文)。

阿里星-超大规模训练关键技术-27届

工作城市:杭州
薪资:12k-24k
学历要求:硕士,博士
岗位性质:实习
岗位描述:
职位描述
1. 参与FlashMoE等分布式训练框架的优化,重点攻关MoE模型的Expert并行通信优化、负载动态均衡和稀疏激活下的高效训练;
2. 负责显存优化技术创新(激活重计算、梯度检查点、ZeRO变体),支持万亿参数MoE模型在有限显存下的稳定训练;
3. 探索多种异构硬件设备(A100/H100/H800/PPU)上的训练性能优化,通过算子融合、通信重叠、显存管理等手段提升MFU;
4. 支撑集团内部或云上客户万卡级MoE模型训练场景,将技术成果沉淀为PAI-DLC训练平台核心特性;
5. 推动超大规模训练优化方向的学术影响力产出。
职位要求
1. 熟悉深度学习基本原理、主流深度学习算法及应用、以及至少一种主流框架(PyTorch、TensorFlow等);
2. 熟悉Megatron、TrasformerEngine、DualPipe等框架技术,并在研究或实习项目中有相应的实践经历;
3. 具备扎实的计算机基础知识、C++/Python编程能力,熟悉常见数据结构和设计模式;
4. 具有很强的学习能力、复杂问题归纳梳理能力、沟通和团队协作能力,具备能够深度钻研技术的耐心。
加分项:
1. 有很强的学术研究能力和优秀的学术成果(AI领域顶会/顶刊论文);
2. 熟悉体系结构,并有扎实的高性能计算/AI编译器/推理框架/模型优化经验;
3. 作为核心贡献者参与开发或者负责维护AI领域的流行开源项目。

阿里星-LLM高性能推理系统关键技术研究27届

工作城市:杭州
薪资:12k-24k
学历要求:硕士,博士
岗位性质:实习
岗位描述:
职位描述
1. 参与大模型推理系统的架构设计与开发,包括推理网关、请求调度、流量路由等核心模块的建设
2. 负责推理引擎(vLLM/SGLang等)的深度优化与定制化开发,提升推理吞吐与延迟表现
3. 参与PD分离(Prefill-Decode)架构的设计与开发,优化Prefill与Decode阶段的资源分配与协同调度
4. 负责KV Cache存储与管理系统开发,包括KV Cache迁移、共享、淘汰策略的设计与实现
5. 参与模型分发系统开发,支持大模型在多节点间的高效分发与加载
6. 基于线上监控与用户反馈,持续优化推理链路的性能、稳定性与成本效率
职位要求
1. 计算机相关专业,具有Golang、Python或C++开发经验
2. 熟悉vLLM、SGLang等开源推理引擎的架构与实现,了解Continuous Batching、PagedAttention等核心机制
3. 深入理解LLM推理场景下的请求调度策略,熟悉 KV Cache 管理、PD分离等前沿架构
4. 具备高性能系统开发经验,熟悉GPU编程(CUDA/Triton等)者优先
5. 具备复杂系统的设计与调试能力,能够系统性分析推理链路中的性能瓶颈
6. 良好的学习和自我驱动能力,具备良好的跨团队沟通协作能力
7. 积极拥抱AI辅助编程工具,善于利用AI提升开发效率与代码质量

阿里星-大规模模型训练调度与框架协同优化

工作城市:杭州
薪资:12k-24k
学历要求:硕士,博士
岗位性质:实习
岗位描述:
职位描述
1. 设计和开发面向大规模模型训练的智能调度系统,实现调度器与训练框架(Megatron-LM、DeepSpeed、FSDP)的深度协同,使资源分配能够感知并行策略拓扑、通信模式和显存需求,提升集群级训练效率和资源利用率;
2. 研究和实现万卡级训练的高可用与弹性机制,包括快速故障检测与自动诊断、智能恢复策略(冗余计算、在线重配)、弹性伸缩(节点增减时自动调整并行策略)、高效 checkpoint(增量/异步/分层存储)等,提升训练稳定性和有效训练时间占比;
3. 探索自动并行策略搜索与动态调整技术,基于性能建模、执行模拟或在线 profiling,自动选择和优化 DP/TP/PP/SP/CP/EP 的多维并行组合,适应异构集群和动态资源环境,降低人工调参成本;
4. 参与 PAI-DLC 训练平台核心能力建设,将技术成果沉淀为可产品化的训练调度和稳定性能力,支撑集团内部和云上客户的大模型训练需求;
5. 有一定的技术前瞻性,可以对平台演进中的技术需求(如多阶段训练流水线编排、训练-推理混合调度、异构集群适配等)进行预研和设计。
职位要求
1. 具备扎实的计算机基础知识和分布式系统研发经验,C++/Python 编程能力强,对操作系统原理、计算机网络、分布式一致性等系统领域知识有较好的理解和项目应用经验。
2. 熟悉深度学习基本原理和主流深度学习框架(PyTorch),了解分布式训练的基本并行策略(DP/TP/PP/EP)和通信原语(NCCL、AllReduce、P2P)。
3. 熟悉 Megatron-LM、DeepSpeed、TransformerEngine、DualPipe 等训练框架技术,并在研究或实习项目中有相应的实践经历。
4. 具有很强的学习能力、复杂问题归纳梳理能力、沟通和团队协作能力,具备能够深度钻研技术的耐心。
加分项:
1. 有很强的学术研究能力和优秀的学术成果(分布式系统/AI 系统/高性能计算领域顶会/顶刊论文);
2. 熟悉集群调度系统(Kubernetes、YARN、自研调度器)的设计与实现;
3. 有万卡级大模型训练实战经验,了解训练中的故障模式和稳定性优化;
4. 作为核心贡献者参与开发或负责维护 AI 领域的流行开源项目。

阿里星-KV Cache分布式存储的网络优化-27届

工作城市:杭州
薪资:12k-24k
学历要求:硕士,博士
岗位性质:实习
岗位描述:
职位描述
负责大模型推理系统中网络性能优化和设计。深入了解计算机体系结构与网络系统相关知识。熟悉推理系统算法及推理基础设施的原理、关键问题与方案。核心工作职责包括:
1、KV Cache相关的传输优化;
2、通信协议优化:RDMA、TCP实现高效的分布式传输;
3、模型特定的优化方案:针对MOE、Prefix KV Cache等特殊模型架构,提供定制化的优化解决方案,支持各类大模型架构;
4、性能基准测试与监控系统建设:建立完整的性能评估框架,实现实时监控和分析,提供性能优化的数据支撑;
5、开源社区贡献与技术文档撰写:积极参与vLLM、HiCache等开源项目,撰写详细的技术文档和优化指南。
职位要求
1、有GPU计算系统优化经验,熟悉CUDA编程和GPU系统架构;
2、深入理解PyTorch/vLLM推理框架的架构和工作原理,有框架优化经验;
3、掌握CUDA、NCCL等并行编程技术,了解GPU间的通信机制;
4、有大规模分布式系统的设计与实现经验,理解分布式系统的核心问题;
5、良好的工程能力和代码质量意识,能够编写高性能、可维护的代码。
加分项:
1、有顶级开源社区(Linux Kernel、PyTorch、TensorFlow等)的实质性贡献经验;
2、发表过系统优化或并行计算相关的学术论文(CCF A类以上);
3、有AWS/GCP/Azure等云服务AI推理优化的实战经验;
4、深入了解NVLink、RDMA等高性能通信协议,有优化经验。

阿里星-大模型推理优化算子与框架适配-27届

工作城市:杭州
薪资:12k-24k
学历要求:硕士,博士
岗位性质:实习
岗位描述:
职位描述
1. 参与vLLM/SGLang等开源推理引擎的底层算子优化,重点攻关高性能Attention算子创新,通过编译优化(Triton/CUDA Graphs)提升单服务实例的推理性能;
2. 负责异构硬件的适配与算子自动调优,最大化利用硬件特性(Tensor Core、HBM带宽、NVLink拓扑);
3. 配合前沿模型压缩算法(量化、剪枝、蒸馏)探索算子级优化方案,创新请求调度算法,优化用户体验和系统吞吐;
支撑云上客户大模型部署标杆场景,将技术成果沉淀为PAI推理服务核心特性;
4. 探索云上混部署方法,将不同尺寸、不同访问频度、不同优先级的模型混合部署在异构资源池中,并保证SLA。通过请求调度方法的创新、资源共享方法创新,降低总体部署成本、提升资源利用率和弹性;
5. 推动底层算子优化方向的学术影响力和开源影响力产出。
职位要求
1. 具备扎实的计算机基础知识、C++/Python编程能力,熟悉常见数据结构和设计模式;
2. 具有很强的学习能力、复杂问题归纳梳理能力、沟通和团队协作能力,具备能够深度钻研技术的耐心;
3. 有很强的学术研究能力和优秀的学术成果(AI领域顶会/顶刊论文)。



阿里星Agentic RL训练基础设施关键技术研究

工作城市:杭州
薪资:12k-24k
学历要求:硕士,博士
岗位性质:实习
岗位描述:
职位描述
1. 设计和优化面向 Agent 训练的分布式 RL 训练系统,包括训练-推理统一调度、大规模 rollout 生成加速、长轨迹高效训练、异步奖励计算流水线等;基于 verl/Slime/RLInf 等开源框架进行系统级创新,结合 SGLang/vLLM 等推理引擎提升 Agentic RL 训练效率;
2. 探索面向多步 Agent 任务的 RL 算法创新,包括长程信用分配方法、过程奖励建模、探索策略设计、GRPO/PPO 在 Agent 场景的改进、多智能体 RL 训练方法等;结合算法创新提升 Agent 的任务完成率、泛化能力和安全性;
3. 构建可大规模并行的 Agent 训练环境基础设施,支持代码执行、Web 交互、API 调用等多种环境类型;设计和实现面向 Agentic RL 的评测体系和 benchmark 工具;
4. 将 Agentic RL 训练的核心技术沉淀为 PAI 的产品能力,支持云上客户训练和部署领域 Agent,形成端到端的 Agent 训练平台;
5. 有一定的技术前瞻性,可以对平台演进中的技术需求(如多智能体协作训练、Agent 安全对齐等)进行预研和设计,满足 AI 基础设施快速发展过程中各项业务场景的客户需求。
职位要求
1. 具备扎实的计算机基础知识和分布式系统研发经验,Python/C++ 编程能力强,并对操作系统原理、计算机网络等系统领域知识有较好的理解和项目应用经验。
2. 对强化学习理论和算法有深入理解,熟悉 PPO、GRPO、REINFORCE 等算法,了解 LLM 训练和微调的基本流程(SFT、RLHF、DPO、OPD 等)。
3. 具有较强的学习能力、复杂问题归纳梳理能力、沟通和团队协作能力,具备能够深度钻研技术的耐心。
4. 有很强的学术研究能力和优秀的学术成果(AI/ML/Systems 领域顶会/顶刊论文),有以下方向的研究经验者尤为优先:强化学习、大模型训练/推理系统、LLM Agent、分布式系统。
5. 熟悉 PyTorch 及相关训练生态(DeepSpeed、Megatron-LM、FSDP 等),有大模型训练或 RL 训练实战经验者优先。熟悉 verl、Slime、RLInf 等 RL 训练框架或 vLLM、SGLang 等推理引擎者优先。

阿里星-面向推理场景多业务融合网络技术

工作城市:杭州
薪资:12k-24k
学历要求:硕士,博士
岗位性质:实习
岗位描述:
职位描述
1、负责AI智算推理场景网络架构方案设计,满足通算和智算实例之间、云服务访问、数据访问的低时延、高吞吐需求;
2、负责AI智算推理场景融合网络核心技术的验证和产品化研发;
3、通过DPU、可编程硬件等, 推动推理场景融合网络技术在阿里云智算场景的大规模部署。
职位要求
1、计算机专业、网络技术等相关专业优先;
2、精通计算机网络和网络编程,精通至少一门主流编程语言,比如C/C++、Python、Go等;
3、精通TCP/IP协议栈、DPDK、OVS等网络高性能传输技术;
4、熟悉DPU/IPU等相关软硬协同网络技术,熟悉当前网络和系统领域的新进展;
5、有数据中心网络、RDMA、用户态协议栈、NCCL,高性能通信框架等开发经验者优先;
6、有强烈的技术热情和好奇心,自驱力和学习力强;具备良好的分析与解决问题的能力、沟通以及团队合作能力;喜欢挑战性的技术研发工作,善于攻坚克难,有创新热情,积极乐观,坚韧抗压,结果导向,能够持续推动问题的解决和突破;
7、掌握AI基础知识,掌握基础提示词工程,会使用Al专业工具,集成AI到个人工作流;有AI相关开发工具应用研发经验者优先,持有阿里云ACA/ACP/ACE认证证书者优先。



算法工程师-强化学习

工作城市:杭州
薪资:12k-18k
学历要求:硕士,博士
岗位性质:实习
岗位描述:
职位描述
1. 负责大语言模型(LLM)及多模态模型后训练(Post-Training)阶段的强化学习算法迭代;
2. 深入研究并优化基于人类、AI 及环境反馈的 RL 算法(如 PPO, DPO, GRPO, ORPO 等),提升模型的规则遵循与多目标平衡能力;
3. 探索基于 RL 的 Reasoning 模型相关技术(如 CoT 思维链、CoA 动作链的融合),实现原生具备多步思考和工具调用能力的推理模型;
4. 将 RL + LLM 技术应用于实际业务(如跨境贸易搜索、商家智能诊断、电商 Agent 等),设计并实现智能化的决策优化方案,提升业务效能。

职位要求
1. 本科及以上学历,计算机、数学、统计学、物理或自动化等相关专业优先;
2. 具备扎实的机器学习、深度学习及自然语言处理(NLP)理论基础,熟悉 Transformer、ViT、CLIP 等主流预训练模型;
3. 深入理解强化学习原理,熟悉 RM、PPO、DPO、GRPO、MBRL 等至少数种 RL 算法及其应用范式;
4. 精通 Python 编程,熟练运用 PyTorch 进行模型训练与调试;
5. 具备极佳的工程实现能力,了解大模型训练系统(如分布式训练、加速优化)或相关底层代码库者优先。



产品经理(AI-Coding 方向)

工作城市:上海
薪资:25k-45k
学历要求:本科,硕士,博士
岗位性质:全职
岗位描述:
岗位职责
1. 负责 AI-Coding 产品的规划与设计,包括代码生成、代码补全、代码审查等核心功能,打造开发者友好的 AI 编程体验。
2. 深入理解开发者需求,通过用户调研、数据分析等方式,持续优化产品功能和交互体验。
3. 与大模型算法、工程研发团队紧密协作,推动 AI 技术在编程场景的落地应用,提升代码生成质量和效率。
4. 跟踪 AI 编程领域的前沿技术和发展趋势,包括 LLM、CodeLLM、Agent 等方向,制定产品技术路线图。
5. 设计并实施产品实验和 A/B 测试,基于数据驱动进行产品迭代和优化。
6. 负责产品文档撰写、功能培训和技术支持,帮助开发团队和外部用户理解和使用产品。

任职要求
1. 计算机、软件工程、人工智能或相关专业本科及以上学历,2027 届毕业生。
2. 具备扎实的编程基础,熟悉至少一门主流编程语言(Python/Java/C++ 等),有实际项目开发经验。
3. 对 AI 技术和大模型有浓厚兴趣,了解 LLM、CodeLLM、Prompt Engineering 等基本概念。
4. 具备良好的产品思维和用户体验意识,能够从开发者视角思考产品设计。
5. 具备优秀的沟通协作能力和项目管理能力,能够跨团队推动项目落地。
6. 有较强的学习能力和自驱力,对新技术保持敏感,愿意深入探索 AI 编程领域。

加分项
1. 有 AI 相关项目经验,如参与过大模型应用开发、代码生成工具开发等。
2. 有开源项目贡献经验,或在 GitHub 上有活跃的技术输出。
3. 熟悉主流 IDE 和开发工具(VSCode、JetBrains 等),有插件开发经验者优先。
4. 有产品实习经验,或在校期间主导过完整的产品项目。
5. 在 ACM、Kaggle 等技术竞赛中获得过优异成绩。

你将参与
1. 参与 AI-Coding 核心产品从 0 到 1 的建设,面对海量开发者的真实使用场景。
2. 与顶尖的 AI 算法和工程团队合作,探索大模型在编程领域的前沿应用。
3. 获得广阔的成长空间和职业发展机会,成为 AI+ 编程领域的专业人才。

AI Agent Data Infra 研发工程师

工作城市:杭州
薪资:28k-40k
学历要求:本科,硕士,博士
岗位性质:全职
岗位描述:
面向 2027 年毕业生。

一、职责概述

负责阿里集团、阿里云可观测数据处理基础设施建设,打造日增百 PB 级实时日志分析平台。面向 AI 应用场景,构建高性能的数据采集、索引、存储、检索与智能分析能力,支撑千万级设备日志处理和新一代 AI 基础设施建设。
参与阿里云战略级产品 SLS 研发,建设面向 AI 应用的多模态数据采集、处理与检索分析能力;参与数据飞轮建设,研发高质量数据集清洗、存储与检索系统;参与 Agent 数据反馈回路和运行时数据基座建设,提升 Agent 质量与稳定性。

二、主要职责

1. 负责 AI Agent 场景的数据计算系统研发,建设 AgentLoop Pipeline 编排能力,支撑数据流转、评估计算、LLM/Agent 调用等任务。
2. 负责 AI Trace、Workflow 日志、模型输入输出、评估结果、Bad Case 等数据的加工、路由和沉淀,支撑评估、标注、微调、经验进化等数据反馈闭环。
3. 负责 LLM 与 Agent 调用相关的任务调度、并发控制、重试容错、超时管理、沙箱执行等核心能力建设,并保障系统高性能、高可用。

三、职位要求
1. 熟悉流式计算、OLAP 计算或任务调度中的至少一个方向,理解分布式系统。
2. 熟练使用 C++ 或 Golang 编程,熟悉异步 IO、内存管理、多线程同步、性能优化。
3. 具备良好的沟通协作、问题分析和解决能力。
4. 优先:熟悉数据导入、清洗、过滤、聚合、格式转换、导出投递等数据处理链路,有数据平台、实时计算、日志分析经验。
5. 优先:对 AI Agent 与 LLM 应用架构有兴趣或实践经验,理解 Trace、Workflow、Evaluation、Dataset、Fine-tuning、RAG/Memory 等数据闭环问题。
6. 加分:熟悉 Harness Engineering 研发流程,熟练使用 AI 工具。



技术服务工程师-AI大模型/智算

工作城市:广州
薪资:12k-15k
学历要求:硕士,博士
岗位性质:实习
岗位描述:
本岗位为27届转正实习岗位,已投递过27届阿里云集团实习生岗位的同学也可以投递哦,一起拥抱AI~
职位描述
加入我们,你将作为AI全栈技术服务工程师,成为阿里云面向全球数百万客户的「技术守门人」与「AI实战派」。你将不再只是纸上谈兵研究算法,而是深入千行百业的真实场景,将最前沿的 AI Agent、RAG、LLM 技术转化为解决实际问题的良药。
主要面向智驾、座舱、AI企业智能提效等核心场景。团队致力于通过标准化服务流程、专家级技术能力与智能化工具平台,保障客户在云上的业务稳定、架构优化与AI落地。以自动驾驶为例,你将帮助客户设计从量产车数据自动上报、采集清洗到云上入库的自动化流水线架构,确保系统持续稳定运行与全链路可观测;同时,依托阿里云万卡级GPU集群,协助客户解决大模型并行训练中的GPU适配、稳定性保障与效率调优等关键问题。
若后续达成实习合作,你将直接参与亿级规模生产集群的技术支持与创新,与顶尖技术专家一起打造智能化服务平台。在MaaS爆发的时代,你写的每一行代码、调的每一个参数,都可能跑在头部客户的生产集群上,直接影响真实世界的AI应用。 在此背景下,你将负责:
1. 参与企业级客户AI智算大模型项目的技术落地与实施,为客户提供从方案评估、实施、演示到部署的全流程服务;
2. 结合智驾/座舱等业务场景,设计云上整体技术架构与解决方案,助力客户提升AI模型训练和推理效率,特别是在大模型知识问答、自动化BI、内容文摘生成、多模态等领域的算法实践;
3. 与算法、售前架构师和产品团队合作,进行研发、验证及部署工作,确保算法解决方案按时且高质量交付;
4. 结合项目沉淀大模型交付服务方案的最佳实践,利用开源工具或开发大模型交付工具推进方案的实际应用。
职位要求
1. 硕士及以上学历,计算机、软件工程、人工智能等相关专业优先;
2. 熟练掌握 Python(核心要求),或具备良好的 Java/Golang 基础,能够编写高质量的测试或工程代码;
3. 有大模型相关研究或应用经验,特别是知识加工、语料生成、Prompt工程优化、LLM模型微调、模型效果评测等领域;对 Linux、云原生、Docker 等基础知识有一定了解;
4. 具备极强的逻辑分析能力,能够从复杂的现象中剥离出技术本质,享受解决 Bug 带来的成就感;
5. 具备出色的沟通能力和抗压能力,能够将复杂的技术方案通俗易懂地传达给客户,拥有极强的“客户成功”意识。

大模型算法

工作城市:广州
薪资:15k-18k
学历要求:硕士,博士
岗位性质:实习
岗位描述:
加入我们,你将作为AI全栈技术服务工程师,成为阿里云面向全球数百万客户的「技术守门人」与「AI实战派」。你将不再只是纸上谈兵研究算法,而是深入千行百业的真实场景,将最前沿的 AI Agent、RAG、LLM 技术转化为解决实际问题的良药。
主要面向智驾、座舱、AI企业智能提效等核心场景。团队致力于通过标准化服务流程、专家级技术能力与智能化工具平台,保障客户在云上的业务稳定、架构优化与AI落地。以自动驾驶为例,你将帮助客户设计从量产车数据自动上报、采集清洗到云上入库的自动化流水线架构,确保系统持续稳定运行与全链路可观测;同时,依托阿里云万卡级GPU集群,协助客户解决大模型并行训练中的GPU适配、稳定性保障与效率调优等关键问题。
若后续达成实习合作,你将直接参与亿级规模生产集群的技术支持与创新,与顶尖技术专家一起打造智能化服务平台。在MaaS爆发的时代,你写的每一行代码、调的每一个参数,都可能跑在头部客户的生产集群上,直接影响真实世界的AI应用。 在此背景下,你将负责:
1. 参与企业级客户AI智算大模型项目的技术落地与实施,为客户提供从方案评估、实施、演示到部署的全流程服务;
2. 结合智驾/座舱等业务场景,设计云上整体技术架构与解决方案,助力客户提升AI模型训练和推理效率,特别是在大模型知识问答、自动化BI、内容文摘生成、多模态等领域的算法实践;
3. 与算法、售前架构师和产品团队合作,进行研发、验证及部署工作,确保算法解决方案按时且高质量交付;
4. 结合项目沉淀大模型交付服务方案的最佳实践,利用开源工具或开发大模型交付工具推进方案的实际应用。
职位要求
1. 本科及以上学历,计算机、软件工程、人工智能等相关专业优先;
2. 熟练掌握 Python(核心要求),或具备良好的 Java/Golang 基础,能够编写高质量的测试或工程代码;
3. 有大模型相关研究或应用经验,特别是知识加工、语料生成、Prompt工程优化、LLM模型微调、模型效果评测等领域;对 Linux、云原生、Docker 等基础知识有一定了解;
4. 具备极强的逻辑分析能力,能够从复杂的现象中剥离出技术本质,享受解决 Bug 带来的成就感;
5. 具备出色的沟通能力和抗压能力,能够将复杂的技术方案通俗易懂地传达给客户,拥有极强的“客户成功”意识。



大模型infra研发工程师

工作城市:杭州
薪资:15k-30k
学历要求:本科,硕士,博士
岗位性质:实习
岗位描述:
【岗位职责】
1. 负责大模型全链路训练优化,攻克 Scaling Law 过程中的分布式性能瓶颈,提升 MFU(算力利用率)和训练稳定性,保障万亿级参数模型的交付;
2. 设计并研发领先的推理引擎,包括但不限于算子融合、动态图优化、量化压缩(FP8/INT4)、高效 CUDA 算子开发等,降低模型在线时延与计算成本;
3. 针对特定业务场景,进行软硬件联合优化,实现从预训练、SFT、RLHF 到模型部署的端到端技术突破。

【职位要求】
1. 本科及以上学历,计算机、人工智能、软件工程、数学相关专业优先;
2. 精通 C++/Python,具备卓越的工程实现能力;熟练掌握 PyTorch 或 TensorFlow,深入理解其内部机制及算子实现;
3. 熟悉 GPU 硬件架构及并行计算原理,掌握主流训练框架或推理框架;
4. 熟悉 Transformer 架构,对模型量化、蒸馏、剪枝或算子优化(CUDA/Triton)中的某一项有深入研究或实践经验。
5. 具备极佳的逻辑分析能力和数理基础,对前沿问题有持续热情,能适应快节奏的研发环境,具有跨学科协作意识。

【加分项】
1. 科研影响力: 在 NeurIPS, ICLR, ICML, ACL, OSDI, SOSP 等计算机顶会以第一作者发表过论文;
2. 深度参与过主流 MLSys 相关开源项目(如 vLLM, OpenRLHF, Megatron 等)的开发或在 ACM/ICPC、Kaggle 等竞赛中获得过顶尖名次。

阿里云智能AI Agent 平台研发工程师-北京

工作城市:北京
薪资:20k-40k
学历要求:硕士,博士
岗位性质:全职
岗位描述:
参与打造业界领先的 AI 底层平台,在超大规模的异构数据与算力基座上,构建面向全场景 AI Agent 的运行、通信、存储、调度与反馈处理框架,参与Agent框架、AI 网关、AI Registry设计,定义新一代的 AI 基础设施。
1. 建设AI Agent 核心基础设施:打造支撑海量 Agent 高效运行与演进的新一代运行、通信、数据处理平台。通过构建高性能的数据存储、检索引擎及计算流水线,挖掘海量Agent 运行时数据、交互轨迹及上下文中信息价值;
2. 核心架构与功能研发: 参与全公司级 AI Agent 底层数据与计算平台的设计与研发,提供支撑 Agent 运行的高效数据采集、处理、存储与检索能力;
3. 数据飞轮建设: 设计并研发 Agent 交互数据的收集、清洗与自动化评估系统,构建高质量的数据反馈回路(Feedback Loop),持续驱动大模型与 Agent 能力的迭代升级;
4. Agent 运行时基座: 研发稳定、高可用的 Agent 运行时(Runtime)架构和数据基础设施,包括但不限于上下文prompt、skills及长短期记忆(Memory)管理、状态持久化及高并发任务调度引擎。

鼠鼠求职首页