Expertise
模型与 Agent 评测
Agent 评测不仅看最终答案,还要观察环境、工具权限、行为轨迹、恢复能力和长期任务结果。
评价对象
- 任务是否在约束内完成。
- 工具选择、参数和调用顺序是否合理。
- 行为轨迹是否存在不可见风险或无效循环。
- 失败后能否识别、恢复、升级或交给人工。
运行机制
- 构建可复现的任务环境和版本记录。
- 组合自动 Verifier、规则检查和人工评价。
- 对高风险动作保留人工 Gate 和权限边界。
- 用回归任务观察模型、工具或提示变化后的退化。
继续了解
- 模型能力定义与评测: 查看 Benchmark、Rubric 和回归验证闭环。
- Rubric 为什么不是评分表: 理解评价体系如何运行。