logologo
寻找工作
返回简章2026-07-25 更新

大模型算法数据工程师

上海
本科及以上
计算机类·电子信息类
使用简历深度优化功能,快速提升简历质量
职位介绍
关于团队 Marketplace Intelligence and Data Marketplace Intelligence and Data 团队的使命是建立可持续的高效数据和智能产品来促进Shopee的业务发展。团队负责Shopee电商数仓建设,商家与运营数据产品建设,全链路流量数据,商品算法,包括商品发布、管控、信息优化、SPU库及其比价业务,营销算法,包括招商、选品、推荐算法,评价算法,用户画像,此外,还包括机器翻译,语音算法,图像算法,实人认证等基础AI能力。 算法数据工程团队( Algo Data Team) 算法数据工程团队作为Marketplace Intelligence and Data 内部对各算法团队进行横向支持的核心数据团队,我们的使命是成为算法团队最坚实的数据战略伙伴。我们致力于提供高效、稳定、高质量的数据服务,从而加速算法的快速迭代,并将数据转化为驱动 Shopee 业务发展的强大商业价值。 作为大模型算法数据工程师,您将负责以下关键领域,将数据转化为算法生产力: 海量多模态预训练数据 Pipeline 建设 多模态清洗与去重: 主导 TB/PB 级文本、图像、视频、音频等多源异构数据的采集与清洗;设计跨模态去重算法(如图像/视频的 Perceptual Hash、CLIP Embedding 向量近邻去重、文本 MinHash)。 图文/音视频质量评估: 搭建多模态数据质量打分模型,过滤低画质、高噪声、图文不匹配(Low Clip Score)的数据;构建自动化 OCR/ASR 转写与文本修正流水线。 数据安全与脱敏: 负责多模态数据的合规清洗,包括图像/视频人脸及车牌脱敏、敏感视觉内容过滤、音频敏感词识别及 PII 数据合规处理。 Agent自动化评测与数据飞轮(Data Flywheel) Benchmarks 建设: 针对电商视觉客服、导购等AI Agent 场景,构建高信度的 Benchmark 评测集与动态评估机制。 Badcase 归因与数据回流: 建立线上推理日志采集与 Badcase 归因分析体系,实现高价值数据的自动筛选与闭环回流。 任职要求 计算机、人工智能相关专业,本科及以上学历,毕业时间在2026年9月至2027年5月。 熟悉Spark、Flink、Hadoop、HBase、Kafka、Druid、Clickhouse,Apache Ray等一种或多种大数据处理技术。 良好的思维逻辑和沟通能力,以及良好的项目管理和协调能力,能用英语沟通。 具备较强的自我驱动力与抗压能力,并乐于不断尝试、追求业务突破。 加分项: 有LLM/VLM 大模型数据处理,Agent 评测,数仓构建的科研和项目经验优先。 有模型评测(Benchmarks)、模型训练(Pretrain)、LLM 上下文工程(Context Engineering)、LLM Memory系统设计背景优先。