AI Data 研发工程师(大模型数据方向)
- MiniMax
- Shanghai, Beijing, China
- CNY 400,000 – CNY 800,000
紧急
上海、北京社招全职互联网 / 电子 / 网游 - 研发
职位描述
MiniMax 致力于构建下一代通用人工智能模型,覆盖文本、图像、视频、语音等多模态大模型方向。数据是大模型能力演进的核心基础,我们正在建设面向大模型时代的新一代 AI Data Infra 平台,支撑预训练、后训练、评测及模型迭代全过程的数据生产、管理与优化。我们希望寻找优秀的数据基础设施工程师,共同打造服务于全模态大模型的数据平台和 Pipeline 基础设施。 你将参与:
- 建设面向大模型的数据基础设施,负责构建支撑海量 AI 数据的数据基础设施,包括:
- 面向文本、图像、视频、语音等多模态数据的统一管理体系;
- 支撑 PB 级数据的存储、计算、索引与分发能力;
- 建设面向 AI 数据的数据湖/湖仓体系,支持数据版本管理、元数据管理和生命周期管理;
- 优化数据访问链路,保障大规模模型训练任务的数据吞吐和稳定性。
- 构建大模型训练与后训练数据 Pipeline,参与建设覆盖模型全生命周期的数据生产体系,包括:
- 预训练数据 Pipeline:数据解析、清洗、过滤、去重、质量评估、分类采样;
- 后训练数据 Pipeline:SFT、Preference Data、RLHF/RLAIF 数据构造及自动化评估;
- 多模态数据处理:图像/视频/语音数据处理、Caption 生成、Embedding 提取和特征构建;
- 数据合成、增强和数据闭环优化。
- 打造 AI Native 数据处理平台,建设面向大模型时代的数据计算平台:
- 基于 Ray、Spark、Datatrove 等分布式计算框架构建大规模数据处理能力;
- 建设数据 Pipeline 编排和执行体系,支持复杂任务自动化运行;
- 支持 CPU/GPU 混合计算场景;
- 探索智能调度、自动优化、异常检测和自动修复等 AI Native 能力。
- 建设高效的数据工程平台体系,提升算法团队的数据研发效率:
- 建设标准化数据处理 SDK、API 和开发框架;
- 建设任务调度、监控、日志、指标和可观测体系;
- 建设数据资产管理、质量管理和数据治理能力;
- 降低模型研发过程中的数据使用成本,加速模型迭代。
职位要求
1.基础能力
- 扎实的计算机基础,理解分布式系统原理;
- 熟练掌握 Python、Java、Go 等至少一种编程语言;
- 熟悉 Linux、Kubernetes 等云原生基础设施;
- 具备大规模数据系统设计和工程实践经验。 2.数据基础设施能力,具备以下一个或多个方向经验: 2.1.分布式计算
- 熟悉 Spark、Ray、Flink 等分布式计算框架;
- 有大规模数据 Pipeline 构建和性能优化经验;
- 理解任务调度、资源管理、计算优化机制。 2.2.数据湖与存储
- 熟悉 Iceberg、Paimon、Lance 等湖仓技术;
- 理解 Metadata、Partition、Manifest、Index、Compaction 等核心机制;
- 有 PB 级数据管理经验。 2.3.数据平台
- 熟悉 Airflow、DolphinScheduler 等工作流系统;
- 有数据开发平台、元数据管理、数据质量、数据治理平台建设经验;
- 熟悉 Kubernetes 资源调度体系。 3.大模型数据经验(优先)
- 参与过大模型预训练数据建设;
- 熟悉网页、代码、多模态数据处理流程;
- 理解数据清洗、过滤、Deduplication、Quality Filtering;
- 熟悉 Embedding、向量检索、数据聚类等技术;
- 了解 SFT、RLHF、Preference Data 等后训练数据流程;
- 有 Vision-Language Model、Video Model、Speech Model 数据处理经验。 加分项
- 参与过 GPT 类模型、MoE 模型、多模态模型的数据平台建设;
- 有 TB/PB 级训练数据处理经验;
- 建设过大规模数据清洗、去重、质量评估 Pipeline;
- 熟悉 WebDataset、Parquet、MDS、Arrow、Lance 等训练数据格式;
- 有数据平台 SDK/API 产品化经验。
投递
Skills
- Python
- Java
- Go
- Apache Spark
- Ray
- Kubernetes
- Data Pipeline Engineering


