AI Agent算法评测工程师
- NIO
- Shanghai, Beijing, China
- CNY 400,000 – CNY 700,000
上海、北京社招全职数字技术本科及以上5-7 年
职位描述
搭建评测框架:构建针对RAG、Tool Calling、多步推理的自动化评测Pipeline,覆盖任务成功率与轨迹合理性。 裁判模型建设:落地LLM-as-a-Judge机制,解决打分偏差问题,实现Agent每日回归测试。 基准与数据集:维护业务评测黄金集,跟进行业Benchmark(如AgentBench),定期输出竞品对比报告。 缺陷归因:深度分析失败轨迹,区分是模型能力不足还是框架设计缺陷,推动底层优化。
职位要求
硬核技能:精通Python,熟悉Pytest,能独立搭建自动化测试工程。 懂大模型:熟悉RAG、Function Calling原理,擅长复杂Prompt设计与调优。 工程基础:熟悉Docker及CI/CD流水线,有数据分析(Pandas/可视化)能力。 加分项:有LLM-as-a-Judge实战经验;参与过AI应用的红队测试;熟悉LangChain或Dify源码。
投递
Skills
- Python
- Pytest
- LLM-as-a-Judge
- RAG
- Function Calling
- CI/CD
- Docker






