HirePortal

AI Data 研发工程师(大模型数据方向)

  • MiniMax
  • Shanghai, Beijing, China
  • CNY 400,000 – CNY 800,000

紧急

上海、北京社招全职互联网 / 电子 / 网游 - 研发

职位描述

MiniMax 致力于构建下一代通用人工智能模型,覆盖文本、图像、视频、语音等多模态大模型方向。数据是大模型能力演进的核心基础,我们正在建设面向大模型时代的新一代 AI Data Infra 平台,支撑预训练、后训练、评测及模型迭代全过程的数据生产、管理与优化。我们希望寻找优秀的数据基础设施工程师,共同打造服务于全模态大模型的数据平台和 Pipeline 基础设施。 你将参与:

  1. 建设面向大模型的数据基础设施,负责构建支撑海量 AI 数据的数据基础设施,包括:
  • 面向文本、图像、视频、语音等多模态数据的统一管理体系;
  • 支撑 PB 级数据的存储、计算、索引与分发能力;
  • 建设面向 AI 数据的数据湖/湖仓体系,支持数据版本管理、元数据管理和生命周期管理;
  • 优化数据访问链路,保障大规模模型训练任务的数据吞吐和稳定性。
  1. 构建大模型训练与后训练数据 Pipeline,参与建设覆盖模型全生命周期的数据生产体系,包括:
  • 预训练数据 Pipeline:数据解析、清洗、过滤、去重、质量评估、分类采样;
  • 后训练数据 Pipeline:SFT、Preference Data、RLHF/RLAIF 数据构造及自动化评估;
  • 多模态数据处理:图像/视频/语音数据处理、Caption 生成、Embedding 提取和特征构建;
  • 数据合成、增强和数据闭环优化。
  1. 打造 AI Native 数据处理平台,建设面向大模型时代的数据计算平台:
  • 基于 Ray、Spark、Datatrove 等分布式计算框架构建大规模数据处理能力;
  • 建设数据 Pipeline 编排和执行体系,支持复杂任务自动化运行;
  • 支持 CPU/GPU 混合计算场景;
  • 探索智能调度、自动优化、异常检测和自动修复等 AI Native 能力。
  1. 建设高效的数据工程平台体系,提升算法团队的数据研发效率:
  • 建设标准化数据处理 SDK、API 和开发框架;
  • 建设任务调度、监控、日志、指标和可观测体系;
  • 建设数据资产管理、质量管理和数据治理能力;
  • 降低模型研发过程中的数据使用成本,加速模型迭代。

职位要求

1.基础能力

  • 扎实的计算机基础,理解分布式系统原理;
  • 熟练掌握 Python、Java、Go 等至少一种编程语言;
  • 熟悉 Linux、Kubernetes 等云原生基础设施;
  • 具备大规模数据系统设计和工程实践经验。 2.数据基础设施能力,具备以下一个或多个方向经验: 2.1.分布式计算
  • 熟悉 Spark、Ray、Flink 等分布式计算框架;
  • 有大规模数据 Pipeline 构建和性能优化经验;
  • 理解任务调度、资源管理、计算优化机制。 2.2.数据湖与存储
  • 熟悉 Iceberg、Paimon、Lance 等湖仓技术;
  • 理解 Metadata、Partition、Manifest、Index、Compaction 等核心机制;
  • 有 PB 级数据管理经验。 2.3.数据平台
  • 熟悉 Airflow、DolphinScheduler 等工作流系统;
  • 有数据开发平台、元数据管理、数据质量、数据治理平台建设经验;
  • 熟悉 Kubernetes 资源调度体系。 3.大模型数据经验(优先)
  • 参与过大模型预训练数据建设;
  • 熟悉网页、代码、多模态数据处理流程;
  • 理解数据清洗、过滤、Deduplication、Quality Filtering;
  • 熟悉 Embedding、向量检索、数据聚类等技术;
  • 了解 SFT、RLHF、Preference Data 等后训练数据流程;
  • 有 Vision-Language Model、Video Model、Speech Model 数据处理经验。 加分项
  • 参与过 GPT 类模型、MoE 模型、多模态模型的数据平台建设;
  • 有 TB/PB 级训练数据处理经验;
  • 建设过大规模数据清洗、去重、质量评估 Pipeline;
  • 熟悉 WebDataset、Parquet、MDS、Arrow、Lance 等训练数据格式;
  • 有数据平台 SDK/API 产品化经验。

投递

Skills

  • Python
  • Java
  • Go
  • Apache Spark
  • Ray
  • Kubernetes
  • Data Pipeline Engineering

Related jobs

MiniMaxApply for this job