Back to Jobs
Soul APP

大模型推理架构师

Soul APP
上海Full TimeSeniorPosted 14d ago
大模型推理架构师上海社招全职互联网 / 电子 / 网游职位描述1. 参与 Soul 大模型、多模态模型、推荐模型等核心 AI 任务的训练与推理基础设施建设,提升模型从实验到线上部署的整体效率。 2. 负责大规模分布式训练系统的性能优化,包括数据并行、张量并行、流水线并行、专家并行、参数/梯度/优化器状态切分、显存优化、通信调度等方向,提升 GPU/NPU 集群利用率。 3. 参与高性能推理引擎建设,围绕大模型在线服务中的低延迟、高吞吐、弹性扩缩容、多租户隔离、KV Cache 管理、批处理调度、量化部署等问题进行系统优化。 4. 针对 Soul 的实时社交、多模态内容理解、AIGC 互动等场景,设计和优化端到端 AI 系统架构,降低训练和推理成本,保障核心业务的稳定性和体验质量。 5. 参与异构计算算子优化和计算图优化,包括 CUDA、Triton、CUTLASS、Ascend C、TileLang 等方向,针对 Attention、MoE、Embedding、推荐模型特征交互、多模态编码等关键模块进行性能调优。 6. 参与 AI 编译器和模型编译优化相关工作,围绕 IR 表达、算子融合、内存复用、调度优化、跨硬件后端适配等方向,提升模型在不同硬件平台上的执行效率。 7. 建设训练/推理性能分析、故障诊断、自动化调优、资源调度和可观测性工具,提升 AI 基础设施的工程效率与稳定性。 8. 跟踪并吸收业界前沿大模型系统技术,在合适的业务场景中完成工程化验证和落地。职位要求1. 计算机基础扎实,熟悉操作系统、计算机体系结构、并发编程、网络通信、内存管理等底层知识,具备较强的问题定位和性能分析能力。 2. 熟练掌握 C/C++、Python,具备 CUDA、Triton、Ascend C、CUTLASS、CuTe DSL、TileLang 等一种或多种高性能计算开发经验。 3. 熟悉大规模分布式训练或推理系统,理解数据并行、张量并行、流水线并行、ZeRO/FSDP、MoE、Checkpoint、Offload、通信重叠等核心机制。 4. 熟悉 NCCL、NVSHMEM、RDMA、InfiniBand、RoCE、Verbs 等通信机制或工具链,有 GPU/NPU 集群通信优化经验者优先。 5. 熟悉主流深度学习框架和训练生态,包括 PyTorch、Megatron、DeepSpeed、FSDP、vLLM、SGLang、TensorRT-LLM、TorchInductor 等,有源码级优化经验者优先。 6. 熟悉 AI 编译器、计算图优化或异构计算工具链,包括 MLIR、LLVM、TVM、XLA、Triton Compiler、Torch Dynamo/Inductor 等相关技术者优先。 7. 具备扎实的工程能力,能够独立完成复杂系统问题拆解、性能瓶颈分析、方案设计、代码实现和线上验证。 8. 熟悉 Transformer、Diffusion、Embedding/Recommendation、Multimodal Encoder、MoE 等常见模型结构,能够理解模型结构对系统性能和资源使用的影响。投递
Ready to apply? You'll be taken to Soul APP's application page.
大模型推理架构师 at Soul APP