HirePortal

AI Infra 工程师(大模型推理/RL方向)

  • NIO
  • Shanghai, Shenzhen +2 more, China
  • CNY 300,000 – CNY 400,000

深圳、合肥、上海、杭州校招正式数字技术 - 算法硕士及以上2027届校园招聘-正式批职位 ID:A129433

职位描述

我们做什么 在这里,你将参与自研大模型推理引擎从 0 到 1 的建设,亲手优化千亿/万亿级参数模型的推理性能,让每一次回答更快、更准、更省算力。 同时,你会基于 Kubernetes(K8s)与云平台,把大模型推理能力做成稳定、弹性、可观测的在线服务,接触真实业务场景,挑战 AI Infra 行业前沿问题。 岗位职责 参与大模型推理引擎核心模块的设计与开发,提升系统吞吐、降低推理延迟与成本; 探索并落地先进的大模型推理加速方案,如量化、KV Cache、PagedAttention、连续批处理、投机解码、分布式推理、算子优化等; 参与推理平台与云平台建设:基于 Kubernetes/K8s、Docker、云原生技术,实现模型部署、弹性扩缩容、灰度发布、多租户资源隔离、监控告警、日志追踪与 CI/CD; 参与 GPU/NPU 资源调度与集群利用率优化,提升推理服务稳定性与云平台资源管理效率; 跟踪开源社区(如 vLLM、TensorRT-LLM、SGLang、LMDeploy 等)前沿动态,完成技术调研、验证与落地; 与算法、业务和平台团队协作,优化端到端推理体验。

职位要求

硕士及以上学历,计算机、AI、数学、信息、电子等相关专业; 熟悉 Python,了解大模型 Transformer 基本工作原理; 具备良好的工程习惯,熟悉 Linux、Git,学习能力强,能阅读英文技术资料; 了解或对 Kubernetes/K8s、Docker、云平台、云原生技术有浓厚兴趣; 乐于沟通协作,对 AI Infra、大模型推理方向有热情。 加分项(非必需) 有 vLLM、SGLang、TensorRT-LLM、LMDeploy 等推理框架使用或二次开发经验; 有 CUDA/Triton 算子编写经历; 有 Kubernetes、Docker、云平台、Ray、Volcano、Kueue、Prometheus/Grafana 等云原生或 MLOps/LLMOps 实践经验; 有 LLM 相关论文、开源项目、竞赛经历或高质量技术博客。 我们提供 资深大佬 1v1 带教,直接参与核心模块,拒绝边缘打杂; 真实业务场景 + 充足 GPU/NPU 资源,以及 K8s/云平台真实生产环境; 一群热爱技术的同龄人,一起把技术做深做透; 接触大模型推理与云原生 AI 基础设施前沿,支持技术分享、开源贡献与论文发表; 有竞争力的校招薪酬与福利保障。

投递

Skills

  • Python
  • Kubernetes
  • Docker
  • LLM inference
  • CUDA
  • vLLM
  • TensorRT-LLM

Related jobs

NIOApply for this job