K8s架构师-资源调度方向
- MiniMax
- Shanghai, Beijing, China
- CNY 1,000,000 – CNY 1,500,000
高优
紧急
北京、上海社招全职互联网 / 电子 / 网游 - 研发
职位描述
- 我们正在构建面向下一代大模型的 AI 基础设施。
- 你将深入超大规模 GPU 集群的核心调度链路,解决异构算力管理、复杂工作负载编排、资源效率与系统稳定性等关键问题,为模型训练、推理和持续迭代提供高性能、高弹性、高可用的算力底座。
- 这不是一个以 Kubernetes 运维为主的岗位。我们期待你能够深入调度系统,定义架构、设计机制,并将复杂的基础设施能力沉淀为简单、可靠的工程系统。 职位描述
- 主导 MiniMax 大模型推理平台与机器学习平台的核心架构设计及演进,构建统一、高效、可扩展的 AI 计算基础设施;
- 设计超大规模 GPU 集群的资源调度系统,解决异构资源建模、拓扑感知调度、队列与配额管理、优先级与抢占、Gang Scheduling、弹性伸缩等复杂问题;
- 面向训练、推理、评测及数据处理等多类型工作负载,持续优化资源流转效率、任务吞吐、调度时延和 GPU 有效利用率;
- 推动在线与离线业务的统一资源管理,在业务稳定性、服务质量与集群利用率之间建立更优的系统平衡;
- 建设面向大模型研发的基础设施抽象与工程工具链,让算力申请、任务编排、服务部署、扩缩容和故障恢复更加自动化、标准化;
- 建立覆盖调度决策、资源供给和工作负载运行状态的可观测体系,定位系统级性能瓶颈,并推动架构持续演进;
- 探索 AI Coding 与 AI Agent 在研发、运维和基础设施自治中的应用,重新定义复杂工程系统的构建与迭代方式。
职位要求
- 具备扎实的计算机体系结构、操作系统及分布式系统基础,能够对复杂系统进行抽象、拆解和架构设计;
- 深入理解 Kubernetes 核心机制及云原生技术体系,不止于使用 Kubernetes;熟悉 Scheduler Framework、Controller、CRD 或相关核心组件的设计与实现;
- 熟悉 kube-scheduler、Volcano、Koordinator 等至少一种调度系统,理解资源调度、任务编排和集群容量治理背后的核心机制;
- 具备大规模训练任务或在线推理服务的工程实践,拥有异构算力调度、在离线混部、弹性资源管理或集群效率优化经验;
- 具备优秀的系统工程能力,熟练掌握 Golang、Python、C++ 中至少一种语言,能够交付清晰、可靠、可长期演进的核心系统;
- 对性能、稳定性和资源效率保持敏感,善于通过指标、数据和系统分析发现真正的瓶颈,并将优化结果转化为可量化的业务价值;
- 具备良好的技术判断力与 Owner 意识,能够推动跨团队的复杂基础设施项目从设计走向规模化落地。 加分项
- 参与过 Kubernetes 调度器、Volcano、Koordinator、Kueue、Slurm 等项目的开发或深度定制;
- 熟悉 GPU 拓扑,以及 NVLink、RDMA、NCCL、存储和网络对分布式训练及推理性能的影响;
- 具备万卡级或超大规模异构计算集群的建设与治理经验;
- 对大模型训练、推理引擎、分布式并行或弹性容错机制有深入理解;
- 具备使用 AI Agent 驱动研发流程、自动化运维或基础设施自治的实践经验。
投递
Skills
- Kubernetes
- GPU Clusters
- Scheduling
- Go
- Python
- C++
- Distributed Systems

