HirePortal

AI 评测工程师(大模型 / 智能体方向)

  • ModelBest
  • Shanghai, Beijing +1 more, China
  • CNY 300,000 – CNY 600,000

北京、上海、深圳社招全职技术职位 ID:A14257

职位描述

大模型项目最难的问题之一,是如何判断它在真实业务里到底有没有变好。你将负责建立从数据集、任务环境、评测方法到上线监控的完整评测体系,让团队能用事实回答“模型哪里好、哪里不够好、下一步该怎么改”。你的评测对象不只是单轮问答,还包括长文档理解、知识库问答、工具调用、多轮对话、长程任务、多智能体协同、视觉理解和端侧推理。你会与算法、产品、研发和客户团队一起定义真实任务,把一次项目中的难例沉淀成下一轮模型和产品迭代的燃料。 岗位职责

  1. 负责大语言模型、多模态模型、智能体和行业 AI 应用的评测方案设计,明确任务、数据、指标、基线和验收标准。 建设覆盖能力、可靠性、安全性、可解释性和工程性能的评测集,支持问答、长文档、RAG、工具调用、报告生成、视觉理解等任务。
  2. 设计人工评测、自动评测、模型评审、规则校验和抽样复核流程,提升评测结果的稳定性、一致性和可复现性。 建立智能体任务环境和轨迹分析方法,评估任务完成率、步骤有效性、工具调用正确率、证据引用、错误恢复和长程执行能力。
  3. 负责准确率、召回率、事实一致性、引用可追溯性、幻觉率、响应时延、吞吐、显存及成本等指标分析,建设回归评测、版本对比、难例挖掘和线上质量监控机制。
  4. 与算法、研发和产品团队协作定位问题根因,提出模型、数据、提示词、流程或系统优化建议,并面向客户项目输出评测报告和验收材料。

职位要求

  1. 本科及以上学历,计算机、人工智能、数学、统计学、语言学等相关专业优先。
  2. 理解大语言模型、RAG、智能体、多模态模型或传统机器学习中的至少一个方向。
  3. 具备较强的数据分析和实验设计能力,能够使用 Python、SQL 或其他工具完成数据处理和结果分析。
  4. 能够设计清晰的评测任务、指标和实验对照,具备严谨的记录、复盘和复现习惯。
  5. 对模型输出中的事实错误、逻辑漏洞、边界问题和业务风险保持敏感,具备良好的沟通能力,能与算法、工程、产品和业务人员共同定义质量标准。 加分项
  6. 有大模型评测、Benchmark、Agent 评测、自动化测试或模型安全评测经验。
  7. 熟悉 DeepEval、OpenCompass、lm-evaluation-harness 或类似评测工具和框架。
  8. 有政企知识库、公文审查、情报研判、工业质检、医疗、法律或科研场景经验。

投递

Skills

  • LLM Evaluation
  • Agent Evaluation
  • Python
  • SQL
  • Benchmark design
  • RAG
  • Data Analysis

Related jobs

ModelBestApply for this job