HirePortal

多模态RL Infra工程师

  • ModelBest
  • Shanghai, Beijing +2 more, China
  • CNY 400,000 – CNY 800,000

北京、上海、成都、深圳社招全职技术 - 开发职位 ID:A79965

职位描述

1、RL训练框架搭建与优化:建设支持多模态大模型后训练的RL基础设施,包括SFT、DPO、GRPO等算法的训练框架开发与性能调优。 2、训练效率提升:优化RL训练的资源调度、通信模式与计算-通信重叠,降低显存占用与训练耗时,提升端到端训练吞吐。 3、训练稳定性保障:建立训练监控与容错机制,解决大规模RL训练中常见的训推不一致、reward hacking、loss震荡等问题。 4、多模态模型适配:支持图文理解模型与全模态模型(MiniCPM-V/o)的RL后训练,解决视觉/音频模态与文本模态在RL训练中的效率与对齐问题。 5、工具链建设:协助算法团队搭建数据流水线、评测链路和模型迭代闭环,提升整体研发效率。

职位要求

职位要求 1.本科及以上学历,了解常见强化学习算法的相关原理、实现方式、优化策略; 2.具备搭建、优化和维护强化学习训练基础设施(Infra)的经验; 3.熟悉集群资源管理、监控与CI/CD等Infra体系,能保障训练平台稳定性; 4.熟悉至少一种主流的RLHF框架,如OpenRLHF/VeRL/ChatLearn等; 5.了解分布式训练基本原理,熟悉通信库的相关工作原理; 6.有良好的沟通合作能力、快速学习和应用新技术的能力、及基本的英文文献阅读能力。 加分项: 1.有强化学习项目实施经验; 2.熟悉模型部署和推理优化; 3.了解云平台部署和容器化技术。

投递

Skills

  • Reinforcement Learning
  • RLHF
  • Distributed Training
  • Performance Optimization
  • OpenRLHF
  • GPU cluster management
  • CI/CD

Related jobs

ModelBestApply for this job