深圳、北京Full TimeSeniorPosted 5d ago
高性能储存研发专家深圳、北京校招正式研发 - 基础架构27届提前批职位描述1. 高性能存储方案调研、选型与深度定制:结合业务场景(具身智能训练/推理),评估并引入合适的存储技术(如 3FS、JuiceFS、Alluxio 等),进行深度二次开发与性能调优。重点优化 FUSE 客户端、元数据服务及存储引擎,完善基于对象存储的缓存机制,结合 IB/RoCE 高性能网络,实现低延迟、高吞吐的数据访问能力,消除 AI 场景下的 I/O 瓶颈。
2. 异构资源存储优化:探索并落地 GPUDirect Storage(GDS)技术,扩展存储后端,设计并实现轻量级共享存储层,高效利用 GPU 节点上的闲置 NVMe 数据盘,降低基础设施成本。
3. 存储内核级调优:针对大规模分布式存储系统进行全栈优化,包括 RDMA 协议栈参数调优、VFS/FUSE 内核交互逻辑优化及内存管理策略调整,确保高并发、大数据量场景下系统的稳定性与 SLA。
4. 技术演进与落地:跟进 HPC 及云原生存储前沿架构,将业务痛点(如 Checkpointing 慢、小文件加载难)转化为可落地的存储解决方案,并推动在生产环境落地。职位要求1. 编程能力:精通 C/C++ 或 Rust(Rust 优先),熟练使用 Python/Go;扎实的计算机系统基础(操作系统、编译原理、计算机网络)。
2. 高性能网络:深入理解 InfiniBand 或 RoCE,具备 RDMA、Zero-copy、Kernel Bypass 实战经验。
3. 分布式存储内核:熟悉 Ceph、Lustre、DAOS 等主流架构,有源码级阅读或二次开发经验;了解 Alluxio、JuiceFS 等缓存层设计;有对象存储(S3 兼容)或文件系统(POSIX)深度开发经验;有 3FS 或其他高性能文件系统源码阅读经验者优先。
4. 硬件与系统底层:熟悉 NVMe 协议及 SSD 特性,了解 PCIe P2P、DMA 等技术;有 Linux 内核开发或存储驱动开发经验者优先。
5. AI 基础设施经验:熟悉 AI 训练/推理流程,深刻理解 Checkpointing、Dataset Loading 对存储的性能诉求,具备相关优化经验。
加分项:
- 有 3FS 源码级二次开发经验,或主导过大规模生产环境(万卡级)的部署与性能调优;对 CRAQ 协议、Foundation Blob 存储有深入理解。
- 熟悉 NVIDIA GPU 架构,有 GPUDirect Storage(GDS)、CUDA 编程或相关异构计算存储优化经验。
- 在顶级开源社区(CNCF、Apache、Linux Kernel)有活跃贡献记录。
- 有大规模生产环境(万卡集群级别)的存储故障排查与性能调优经验,能推动项目从零到一落地。投递
