北京、上海Full TimePosted 6d ago
K8S研发工程师-集群管理方向北京、上海社招全职研发 - 基础架构职位描述一、一句话定位
参与建设服务大模型训练、推理与在线业务的 Kubernetes 集群管理平台,用自动化和软件工程手段解决集群创建、升级、扩缩容、节点管理与稳定性问题,让大规模集群可标准化交付、可观测、可恢复。
二、为什么这个岗位重要
Kubernetes 是承载训练、推理和在线业务的核心基础设施,集群稳定性直接影响业务连续性与研发效率。
随着集群规模和异构资源类型增长,依靠人工操作无法支撑稳定交付,需要把集群生命周期管理做成平台和控制系统。
你将深入 Kubernetes 控制面、节点生命周期与集群可靠性,在真实生产环境中理解大型分布式系统如何运行和演进。
三、你将负责什么
1. 参与研发 K8s 集群管理平台,覆盖集群创建、配置、升级、扩缩容、巡检、回收等生命周期。
2. 基于 Operator / Controller、CRD 和声明式 API 建设自动化控制能力,减少人工操作与环境差异。
3. 参与 apiserver、etcd、scheduler、controller-manager、kubelet 等核心组件的稳定性、容量和性能治理。
4. 建设节点接入、状态管理、故障隔离和恢复能力,并与机器 / 网络底座团队协作完成问题定界。
5. 参与多集群管理、版本治理、配置一致性、变更防护和灾备演练,提升集群服务的标准化与可靠性。
6. 完善集群指标、日志、事件和 SLO,沉淀自动巡检、故障诊断和恢复工具。
职位要求四、我们期望你具备
1. 计算机、软件工程或相关专业本科及以上学历,具备扎实的计算机基础。
2. 至少熟练掌握 Go、Python、Java、C++ 中一门语言,能够独立完成编码、调试与测试;coding 是硬门槛。
3. 熟悉 Linux、操作系统、计算机网络和分布式系统基础。
4. 理解容器、进程隔离、网络与存储的基本概念,对 Kubernetes 工作机制有学习或实践基础。
5. 重视可靠性和工程质量,遇到故障能形成“发现—止损—定位—恢复—复盘”的基本思路。
6. 有 Owner 意识,愿意与不同技术团队协作完成端到端闭环。
加分项
阅读过 Kubernetes 核心代码,或开发过 Operator / Controller、调度插件、设备插件。
有 Kubernetes 集群搭建、升级、故障排查或多集群项目经历。
熟悉 etcd、容器运行时、CNI、CSI、eBPF 中的一项或多项。
有开源贡献、技术竞赛、优秀课程设计或可展示的分布式系统项目。
对 GPU 集群、大模型训练 / 推理基础设施有兴趣。投递
