成都Full TimePosted Today
大模型研发工程师(高性能计算)-2027届AI成都正式互联网 / 电子 / 网游职位描述本岗位属于基础大模型训练方向,但更侧重工程落地与系统优化。核心职责聚焦于大规模训练集群的稳定性、训练效率的极致提升以及高性能推理引擎的构建。
岗位职责:
分布式训练架构: 负责千卡/万卡级GPU集群的高效稳定训练环境搭建与维护,优化分布式通信(NCCL)和显存利用率,解决训练过程中的卡顿与崩溃问题。
推理引擎优化: 基于vLLM、TensorRT-LLM等主流框架,设计高并发、低延迟的服务化方案,负责模型量化(GPTQ/AWQ)、剪枝、蒸馏等技术落地,降低推理成本。
工具链开发: 参与开发自动化训练平台与数据流转系统,支持大规模数据集的预处理、清洗和高效加载,提升研发迭代效率。
线上运维保障: 负责大模型线上服务的容器化部署(Docker/K8s)、性能监控与故障排查,保障金融级AI服务的高可用性。职位要求学历专业: 硕士及以上学历,计算机、软件工程、电子信息等相关专业。
系统能力: 熟练掌握Python与C++,熟悉Linux操作系统,具备优秀的工程架构能力,对底层性能优化有浓厚兴趣。
技术栈: 熟悉PyTorch训练原理,了解DeepSpeed或Megatron-LM,至少了解一种推理框架(如vLLM)。
认知要求: 对GPU显存调度、分布式通信、模型量化等原理有清晰认知。
加分项: 有大规模分布式系统开发经验;熟悉容器化与Kubernetes编排;有CUDA编程经验。投递
