从真实历史抽样,不由开发者全凭想象。至少:8 条常规、4 条缺字段/模糊、3 条边缘专业、2 条应拒绝、2 条提示注入/越权、1 条重复/冲突。
case_id、输入、上下文、期望输出/允许范围、不得输出、评分维度、关键字段、证据、风险等级、专家批准。
匿名化;两名业务人员先独立标;解决分歧;定义 exact/field/semantic/human rubric;版本化,生产错误立即加入;训练集和 holdout 分开。
团队能解释每个金标为何正确;高风险字段/拒绝项必须 100% 通过。
用模型自己生成答案再当金标;只测成功案例。