方法|2026-08-11
Rubric 为什么不是一张评分表
高质量 Rubric 是一个运行中的判定系统:它定义观察什么、如何判断、争议如何裁决,以及模型版本变化后如何回归验证。
Rubric 的四个层次
- 能力层:要评价的能力对象和失败成本。
- 任务层:样本、环境、输入输出和边界。
- 判定层:维度、等级、例外、证据和裁决。
- 运行层:培训、一致性、版本、回归和问题闭环。
常见失败
- 维度抽象但无法映射到可观察行为。
- 规则只有正例,没有边界、反例和争议处理。
- 不同评价者使用不同隐含口径。
- 模型版本变化后继续沿用旧样本和旧权重。
如何判断 Rubric 可用
- 评价者能够一致理解并复核证据。
- 边界案例存在明确升级和裁决机制。
- 评分结果能解释模型失败,而不是只给总分。
- 版本变化可以通过保留集和回归测试发现退化。
继续了解
- 模型能力定义与评测: 查看从能力问题到回归验证的完整服务边界。
- 模型与 Agent 评测: 查看任务环境、轨迹和长期评价问题。