Evaluation Science & Measurement Researcher
评测科学与测量方法研究员
把模糊的“好不好”转化为可靠、可解释、可复现的评测方法,真实测量模型能力,为模型迭代、数据改进和业务决策提供依据。
投递这个岗位 ↗岗位职责
- 将客户目标或模型能力诉求转为明确的测量目标、任务边界与决策用途,识别混杂因素及指标失真风险。
- 设计评分规则、评分锚点与边界样本,建立评分者培训、校准、盲评、复判及仲裁机制。
- 与工程团队共同建立规则验证、模型评判和人工复核相结合的评分链路,评估偏差、稳定性、成本与专家一致性。
- 设计对照实验、消融实验、重复运行与稳健性检查,区分模型差异、样本难度、评分噪声和运行环境影响。
- 治理评测题集的抽样、难度、污染控制、版本与退役机制,与领域专家共同保证专业正确性。
- 将评测结果转为可行动的失败分析和改进建议,沉淀模板、样例与培训方法,持续验证跨项目的使用效果。
任职要求
- 统计学、应用数学、心理测量、计算机科学、机器学习、计量经济学、认知科学或相邻领域硕士及以上;博士不是硬性要求。
- 掌握实验设计、测量误差、信度效度、一致性分析、不确定性估计中的至少两个方向。
- 熟练使用 Python 或 R,能够完成数据分析、统计检验、可视化和可复现报告。
- 能将模糊目标转化为可检验假设、任务设计、指标和判定规则,解释总体指标背后的样本组成、评分噪声与失败模式。
- 能与领域专家、算法工程师、项目经理及客户共同工作,推动研究方法用于真实项目。
- 能够使用大模型和代码工具提高效率,并对自动评分进行独立校准。
- 在满足学历要求的基础上,重点看测量判断、数据证据、可执行能力和独立复现;学校层次、论文数量不作为单独录用依据。
加分项
- 有 LLM、Agent、多模态、代码生成或 AI for Science 评测经验。
- 做过人类评分、专家标注、心理测量、教育测量、A/B 实验或质量统计。
- 有 Benchmark、数据集、模型发版评测或公开评测框架建设经历。
- 熟悉一致性系数、bootstrap、功效分析等方法,并了解适用边界。
- 有自动 Verifier、LLM-as-a-Judge、成对排序或偏差校准经验。
- 能把复杂分析转为客户和管理者可用的决策材料;博士、博士后及相关研究经验可加分。
岗位分工
- 本岗位侧重测量方法、评分校准与结果解释,不替代领域专家的专业结论,也不独立承担生产系统的完整开发和运维。