Muchen AI

方法|2026-08-11

Rubric 为什么不是一张评分表

高质量 Rubric 是一个运行中的判定系统:它定义观察什么、如何判断、争议如何裁决,以及模型版本变化后如何回归验证。

Rubric 的四个层次

  • 能力层:要评价的能力对象和失败成本。
  • 任务层:样本、环境、输入输出和边界。
  • 判定层:维度、等级、例外、证据和裁决。
  • 运行层:培训、一致性、版本、回归和问题闭环。

常见失败

  • 维度抽象但无法映射到可观察行为。
  • 规则只有正例,没有边界、反例和争议处理。
  • 不同评价者使用不同隐含口径。
  • 模型版本变化后继续沿用旧样本和旧权重。

如何判断 Rubric 可用

  • 评价者能够一致理解并复核证据。
  • 边界案例存在明确升级和裁决机制。
  • 评分结果能解释模型失败,而不是只给总分。
  • 版本变化可以通过保留集和回归测试发现退化。

继续了解

联系我们