AI 大模型全栈研发工程师
南京
本科及以上
计算机类·电子信息类
使用简历深度优化功能,快速提升简历质量
职位介绍
1.负责 A100/H100 GPU 集群部署、配置与资源调度,基于 Slurm、K8s+Volcano搭建算力调度体系,管理显存分配、多卡并行任务;开展算力容量监控与规划,输出扩容方案。运维 PyTorch DDP、DeepSpeed、Megatron等分布式训练环境,管理 Ceph、NAS、对象存储;部署维护 vLLM、Triton、TGI 推理服务,配置负载均衡、限流熔断,监控 TTFT、TPS、时延等SLA 指标;负责 Milvus 等向量数据库、全链路数据 Pipeline 运维优化。落实访问权限管控,通过弹性调度、量化优化提升 GPU利用率,持续优化算力运营成本。 2.搭建多源异构数据采集管线,完成文本、音视频数据清洗、去重、脱敏;制定标注规范,统筹标注管理,构建高质量训练数据集;开展特征工程,搭建标准化特征库。结合业务完成LLM、CV 等模型架构选型;负责模型预训练、LoRA 微调、SFT/RLHF、超参数调优;构建自动化评测体系,基于 F1、BLEU、ROUGE等指标开展离线与人工评估;持续开展 Prompt 工程迭代优化。 3. 设计 LLM智能体整体架构,自研任务规划、上下文管理、长短时记忆、工具调用等核心模块,搭建高可靠低延迟 Agent 底层框架。基于LangChain、LlamaIndex、AutoGen 构建智能体应用,实现自主决策、多步推理、多 Agent 协同;搭建并优化 RAG知识库,导入运维手册、故障 SOP 等垂直领域知识;编排业务工作流,落地智算设备诊断、性能调优等场景智能交互能力。 4. 完成模型封装、API服务开发,支持流式推理、批量推理,运用量化、蒸馏等手段优化推理性能;统一管理模型版本,沉淀训练参数、数据集、评测基线;搭建 Agent安全防护机制,包含意图校验、输出过滤、沙箱执行、权限管控;构建全链路可观测体系,监控任务成功率、工具调用准确率、响应时延、Token消耗等指标,保障生产环境稳定运行。 5. 持续分析线上 Bad Case,定位模型缺陷驱动迭代;跟踪 LLM、Agent 前沿技术(MCP协议、多智能体协同等)开展技术调研与 POC 验证;推进智能体、大模型应用与智算平台现有业务系统对接融合。
所属批次:中邮建2026 2027届校园招聘简章企业职位库在招档案→

