大模型系统负责人
- MiniMax
- Shanghai, Beijing +1 more, China
- CNY 1,000,000 – CNY 2,000,000
大模型系统负责人
上海、北京、杭州社招全职互联网 / 电子 / 网游 - 研发
职位描述
职位职责
- 负责 AI Infra 整体方向与技术演进,围绕大模型训练与推理场景,持续逼近系统级最佳实践。
- 从模型效果与业务需求出发,端到端解决训练与推理链路中的关键问题,提升性能、效率与稳定性。
- 统筹算力、框架与流量体系设计,持续提升资源利用率与系统吞吐能力。
- 构建高性能、可扩展的基础设施体系,支撑大模型研发与线上服务。
- 建立团队技术标准与工程品位,提升整体技术判断力与复杂问题解决能力。 细分方向
- 在线推理优化方向
- 负责在线推理链路的端到端优化,覆盖从流量入口到结果返回的全路径;
- 优化推理架构,在跨机、跨实例等维度沉淀高性能实践;
- 面向真实业务负载,持续降低时延并提升资源利用率。
- 训推框架方向
- 负责训练与推理框架的优化与演进,从算子到框架层提升整体性能;
- 基于真实流量与模型特性,设计高效的框架与执行策略;
- 从多层级(算子 / 框架 / 调度)进行系统性性能分析与优化。
- AI Infra 平台方向
- 负责训练与推理基础设施建设,包括资源层、调度层与流量层;
- 构建适配大模型场景的高性能系统架构;
- 支撑模型研发、训练优化与线上服务的全流程效率提升。
职位要求
- 具备扎实的端到端性能分析能力,能够从底层原理理解系统性能表现(包括但不限于 GPU);
- 优秀的编程能力与代码品位,具备良好的数据结构与算法基础,有 ICPC / OI / ASC 等竞赛经历者优先;
- 深入理解操作系统、分布式系统等基础原理,具备复杂系统的架构设计能力;
- 具备良好的可靠性意识,熟悉监控、容灾等工程体系;
- 具备优秀的沟通与协作能力,能够推动跨团队复杂问题落地;
- 具备强自驱力与学习能力,对技术有长期追求。
投递
Skills
- AI Infrastructure
- Distributed Systems
- GPU Performance Optimization
- Training and Inference Frameworks
- System architecture design
- Performance Analysis
- Reliability Engineering

