20 条金标用例怎样建?

标准答案

从真实历史抽样,不由开发者全凭想象。至少:8 条常规、4 条缺字段/模糊、3 条边缘专业、2 条应拒绝、2 条提示注入/越权、1 条重复/冲突。

字段

case_id、输入、上下文、期望输出/允许范围、不得输出、评分维度、关键字段、证据、风险等级、专家批准。

操作

匿名化;两名业务人员先独立标;解决分歧;定义 exact/field/semantic/human rubric;版本化,生产错误立即加入;训练集和 holdout 分开。

验收线

团队能解释每个金标为何正确;高风险字段/拒绝项必须 100% 通过。

红线

用模型自己生成答案再当金标;只测成功案例。

← 上一题 · 任务自动化等级怎样决定?下一题 · 两个模型怎样公平比较? →

想知道 AI 现在怎么说你的工厂?

先用 25 题免费自测看清准备度,或申请六平台专业基线测试,拿到有范围、有日期的真实数据。

3 分钟免费自测 →申请专业测试