多模态算法工程师(北京)
北京
硕士及以上
不限专业
使用简历深度优化功能,快速提升简历质量
职位介绍
【职位职责】
1. 负责具身智能多模态算法核心研发与迭代,聚焦机器人、智能设备场景下视觉、文本、激光雷达、IMU、语音等多传感器信息融合,主导具身感知、场景理解、智能交互、行为决策等核心模块的设计与开发;
2. 负责具身多模态大模型的微调、对齐与适配优化,基于VLM、多模态基座模型实现机器人环境感知、指令理解、视觉定位、语义导航、操作预判等能力,解决真实物理场景下感知不准、指令理解偏差、环境泛化性弱等核心问题;
3. 落地具身智能核心业务场景,包括但不限于家用/工业机器人交互、自主导航、智能操控、环境语义重构、人机协同作业、端侧具身智能推理等,完成算法从原型设计、仿真验证、真机调试到业务落地的全流程迭代;
4. 搭建适配具身场景的多模态数据集,针对真实物理环境、复杂作业场景进行数据采集、清洗、标注、增强和合成,构建机器人专属的视觉-文本-行为多模态训练数据系,支撑模型迭代优化;
5. 针对机器人端、嵌入式端设备进行算法工程优化,完成模型轻量化、量化、蒸馏、推理加速,适配端侧低算力、低延迟、高稳定性要求,解决真机部署中的算力受限、环境干扰、实时性不足等问题,保障设备常态化稳定运行;
6. 跟进具身智能、世界模型、机器人多模态感知、具身Agent、视觉语言导航(VLN)等前沿技术,开展技术调研、算法复现、方案落地验证,沉淀标准化技术方案、专利及技术文档,推动团队技术迭代升级。
【任职要求】
1. 硕士、博士应届毕业生;
2. 计算机科学、人工智能、机器人工程、模式识别、自动化、电子信息、数学等相关专业;
3. 技能要求:
(1)基础能力:具备扎实的机器学习、深度学习、计算机视觉、概率论、线性代数数理基础,熟悉机器人感知、定位、导航、控制基础原理,理解具身智能“感知-决策-执行”闭环逻辑;
(2)技术栈要求:
•熟练使用Python,精通PyTorch/TensorFlow主流深度学习框架,具备独立完成具身多模态模型训练、微调、评估、迭代的完整能力;
•精通Transformer架构,熟悉主流具身多模态模型及方案,包括LLaVA、Qwen-VL、Robo-VLM、视觉语言导航模型、具身世界模型等,掌握视觉-文本-动作跨模态对齐、多传感器融合核心技术;
•扎实掌握计算机视觉核心技术,包括图像检测、分割、特征匹配、深度估计、视觉定位,熟悉NLP指令理解、Prompt工程、LoRA/QLoRA高效微调方案;
•熟悉ROS/ROS2机器人开发框架,了解嵌入式端、端侧推理优化,掌握TensorRT、ONNX等部署工具,具备模型轻量化、推理加速实战经验优先。
(3)项目经验:具备具身智能、机器人感知、多模态交互、视觉导航、智能操控相关项目落地经验,有端侧具身算法研发、真机调试、场景落地经验者优先。
11. 具备极强的物理场景问题拆解能力,可独立解决真机部署、复杂环境适配中的技术难点;拥有良好的自驱力、团队协作能力,逻辑清晰,善于技术复盘与方案沉淀。
12. 英语通过CET-6。
【学历要求】
硕士及以上
【硬性专业要求】
计算机科学、人工智能、机器人工程、模式识别、自动化、电子信息、数学等相关专业
所属批次:中国电子科技网络信息安全有限公司 2027届校园招聘简章企业职位库在招档案→

