logologo
寻找工作
返回简章2026-09-09 更新

模型部署与量化加速工程师

电子信息类·计算机类
使用简历深度优化功能,快速提升简历质量
职位介绍
招聘部门:研发中心 【职位职责】 1. 模型车端部署:负责自动驾驶端到端模型及多模态大模型(LLM/VLM)在车端平台上的高效迁移与部署。 2. 量化与压缩:研发并落地模型量化(PTQ/QAT)、剪枝、蒸馏等轻量化技术,深入探索 FP8、INT4 等低比特精度量化方案,在保证模型精度的前提下大幅提升推理性能。 3. 算子与内核优化:针对特定硬件架构,利用 CUDA、TensorRT、Triton 等工具进行高性能算子开发与优化,特别是针对 Attention 机制的加速。 4. 软硬协同优化:深入分析模型在硬件上的瓶颈,通过计算图优化、内存管理优化、多流并发等手段,实现全链路推理延迟的最小化。 5. 性能评测与对齐:建立完善的模型性能与精度评测体系,负责云端与车端模型输出的一致性校验,定位并解决部署过程中的精度损失问题。 【任职要求】 1. 计算机、电子工程、人工智能等相关专业本科及以上学历。 2. 精通 C++ 和 Python,具备扎实的编程功底和良好的算法与数据结构基础。 3. 深入理解模型量化原理,有实际的量化落地经验,熟悉常用的量化框架(如 TensorRT-LLM、AutoAWQ、BitsAndBytes 等)。 4. 熟悉主流深度学习框架(PyTorch/TensorFlow)及模型转换工具(ONNX/TensorRT/TVM)。 5. 具备 GPU 体系架构知识,能够熟练编写 CUDA 代码或进行高性能计算优化者优先。 6. 熟悉 Transformer 架构及大模型推理加速技术。 7. 加分项:参与过开源推理引擎(如 vLLM, DeepSpeed-MII, LMDeploy)的开发或贡献。 8. 加分项:有在 NVIDIA DRIVE OS 或相关车端底层平台上部署大规模模型的实战经验。 9. 加分项:具备端到端自动驾驶模型部署经验,熟悉多模态感知数据流的处理优化。 【学历要求】 本科及以上 【硬性专业要求】 计算机相关专业、电子工程相关专业、人工智能相关专业
所属批次:酷哇科技有限公司 2027届校园招聘简章企业职位库在招档案