深圳Full TimeMid-levelPosted 2d ago
多模态训练算法工程师( 预训练 / 后训练 )深圳全职智能制造 / 工业互联网 / 工业自动化职位描述主导具身智能多模态大模型训练:负责从模型架构设计、分布式训练方案到落地优化的全流程,优先考虑有 主导过知名多模态大模型训练经验 的候选人;
多模态算法研发:重点推进 视觉-语言-动作融合 模型,以及机器人场景中的复杂多模态建模;
数据与仿真方案设计:研究结合传统仿真与生成式仿真的数据合成方法,推动大规模高质量数据的构建与应用;
学术前沿跟踪与快速验证:紧跟 VLM / VLA / 世界模型等领域前沿,快速实现并迭代验证关键技术;
落地与应用:推动模型在机器人与具身智能场景中的应用,解决训练与真实环境对接中的性能与泛化挑战;
团队技术引领:带领团队在算法、工程和跨学科交叉领域持续迭代,沉淀可复用的模型训练与优化方法。职位要求计算机科学、人工智能、机器人学等相关专业背景,博士优先,具备 5 年以上大模型相关研发经验;
主导过知名多模态大模型训练(优先有 Qwen-VL、InternVL、CogVLM、Yi-VL 等国内外代表性项目经验);
熟悉 视觉-语言-动作融合、多模态对齐、强化学习与世界模型 等关键技术,能独立提出并推动创新方案;
具备扎实的工程经验,熟悉 PyTorch / JAX / DeepSpeed / Megatron 等框架,能解决大规模训练中的计算与通信瓶颈;
在顶级学术会议(NeurIPS、ICLR、CVPR、ICRA 等)发表过相关论文,或主导过有影响力的开源/工业级多模态项目;
优秀的技术领导力与跨团队沟通能力,能带领团队完成从研究突破到应用落地的全过程。
加分项
有 图像输入 + 图像输出型多模态模型经验(如 Transfuser 类型、视频生成与决策一体化模型);
具备 图像生成/视频生成模型(Diffusion, GAN, VAE) 与 机器人决策模型 融合的经验;
有 VLM / VLA 大模型落地经验(如 GPT-4V、Qwen-VL 等的训练/部署);
主导或核心参与过 国内外知名多模态大模型项目(如 Qwen-VL、InternVL、CogVLM、Yi-VL、LLaVA、Flamingo、PaLI、Kosmos);
对具身智能/通用机器人有实践项目经验。投递
