HirePortal

中/高级后端开发工程师(AI算力平台)

  • RoboScience
  • Beijing, Shenzhen, China
  • CNY 350,000 – CNY 600,000

深圳、北京全职智能制造 / 工业互联网 / 工业自动化

职位描述

  1. 参与 AI 算力平台 / MaaS 平台后端系统建设,负责统一网关、租户、权限、Token / 证书、配额、审计、计费等核心能力;
  2. 负责在线推理服务管理能力建设,包括模型注册、模型部署、版本管理、灰度发布、服务升级 / 回滚、限流、路由、请求追踪等;
  3. 负责训练 / 微调任务系统建设,包括任务提交、任务队列、任务状态机、日志追踪、Checkpoint / 模型产物管理,以及训练任务生命周期管理;
  4. 对接 Kubernetes、腾讯云 TI-ONE、Ray、PyTorchJob 等云原生与 AI 任务系统,实现模型推理、训练、微调任务的自动化编排;
  5. 参与 GPU 资源管理与调度能力建设,支持资源池管理、配额控制、任务排队、成本统计、资源利用率分析等能力;
  6. 与算法、推理优化、SRE 团队协作,持续提升平台的稳定性、可观测性、发布效率和算力利用效率。

职位要求

  1. 计算机、软件工程、人工智能等相关专业本科及以上学历;
  2. 熟练掌握 Go / Python / Java 中至少一种语言,具备良好的工程实现能力,能独立完成复杂模块设计与开发;
  3. 熟悉 Kubernetes 基本原理和生态组件,理解 Deployment、Service、Job、CRD、Operator、Ingress、HPA 等核心概念,有 K8s 平台开发或应用接入经验;
  4. 熟悉后端系统常见组件与架构设计,包括 API Gateway、消息队列、任务调度、MySQL / PostgreSQL、Redis、对象存储、日志与监控等;
  5. 熟悉云原生服务治理和发布流程,了解灰度发布、蓝绿发布、限流、熔断、重试、回滚、可观测性等工程实践;
  6. 了解 AI 训练 / 推理基本流程,熟悉 PyTorch、模型部署、在线推理、微调任务、模型版本管理等概念,有 AI 平台、算力平台、MLOps 平台经验者优先;
  7. 具备较强的问题拆解能力和 Owner 意识,能与算法、基础设施、SRE、产品团队协作推进复杂平台项目落地。

投递

Skills

  • Go
  • Kubernetes
  • Python
  • API Gateway
  • MLOps
  • PyTorch
  • Microservices Architecture

Related jobs

RoboScienceApply for this job