Model Capability Definition & Evaluation
模型能力定义与评测
评价不是在项目末尾打一个分数,而是先定义能力、暴露失败,再判断数据与模型迭代是否产生真实改善。
从客户能力问题开始
- 明确需要评价的能力对象、使用场景和失败成本。
- 建立当前模型或工作流的基线,区分已知失败与未知风险。
- 把模糊的好坏判断转化为可观察、可裁决的任务与指标。
评价体系设计
- 设计覆盖真实能力边界的 Benchmark 与难例结构。
- 将 Rubric 写成可理解、可复核、可处理例外的判定规则。
- 根据任务风险组合人工评价、规则校验与 Verifier。
- 通过双人复判、争议仲裁和一致性测试控制评价漂移。
数据与模型迭代验证
- 根据失败分类设计训练、偏好或评测数据方案。
- 保留独立评价集,避免生产数据与验证数据相互污染。
- 比较版本变化并识别能力改善、退化和结构性偏差。
- 将失败结果反馈到下一轮任务、数据和模型迭代。
能力边界
- 执行客户给定规则不等于具备模型能力定义能力。
- 没有真实任务定义、评价设计或失败分析证据时,不宣称完成能力评测。
- 评价结论只对已定义的样本、任务、版本和口径负责。
继续了解
- Rubric 为什么是工程系统: 理解评分规则如何进入生产、评测与回归。
- 模型与 Agent 评测: 查看任务环境、轨迹和长期任务评价边界。
- 讨论评测问题: 从能力目标、现有基线和期望周期开始沟通。