锦鲤求职

阶跃星辰

Coding评测工程师

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

一句话定义

负责大模型代码能力的评测体系建设与持续演进。定义模型在软件工程场景下的能力发展方向、质量标准,并构建可抵御刷分的评测体系,要求兼具一线工程判断力与AI评测方法论

工作范围

评测环境构建

为模型在特定方向上构建完整的任务完成环境,将真实软件开发流程抽象为可复现、可扩展的评测用例

设计模拟真实软件工程场景的评测环境,包含需求分析、架构设计、多文件编辑、Debug、测试覆盖等完整链路

评测标准制定

制定覆盖多语言的代码能力评测标准(正确性、代码质量、复杂度处理、工程规范等),建立能力基线并持续追踪

设计超越简单Pass/Fail的多维度评估维度,涵盖正确性、安全性、鲁棒性、可读性、执行效率等指标

基于评测结果进行结构化分析,持续迭代优化Rubric标准

评测数据工程

完成评测数据的全流程处理,包括数据清洗、过滤、去重与质量校验,构建高质量评测数据集

负责评测数据、评测样本与Benchmark的建设与治理,保障评测结果的客观性与可复现性

建立评测-训练闭环迭代机制,使能力提升可量化

人才画像

技术背景:计算机科学、人工智能、软件工程等相关专业,本科及以上学历

编程能力:精通Python,熟练掌握至少一种其他编程语言(Java/Go/C++/TypeScript等),有跨语言工程实践经验

工程经验:具备复杂系统或产品的核心研发经验,能清晰阐述关键设计决策与权衡

评测经验:熟悉评测集、指标体系、Rubric设计及自动化评测流程,有评测平台、数据流水线或实验系统建设经验

LLM认知:对主流大模型的原理、能力边界及典型应用场景有较深入理解,熟悉大模型与Agent的常见评测方法

工具链:熟悉Linux、容器技术(Docker)及编排工具;熟悉主流LLM评测基准与方法论(HumanEval、SWE-bench等)

加分项

有安全、隔离的代码执行沙箱环境构建经验

有桌面沙盒与虚拟机环境相关构建经验,支持桌面端代码编译打包、应用启动、进程健康、UI渲染、跨平台一致性等验证环节

熟悉容器技术及编排工具,支持大规模并发调度的评测执行

有Broswer Use、自动化测试等相关项目经验

人工智能方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →