同一时间、相同输入/工具/温度/提示、相同结构化输出和评分,重复运行;比较质量、失败类型、稳定、成本、时延和数据/地区可用性。
①冻结 eval set;②匿名模型输出给评审;③确定性字段程序评分,专业语义人工盲审;④高风险错误单独计,不能被平均分稀释;⑤报告 p50/p95 时延、有效成本/成功案例;⑥按任务路由,不追求一个模型包办。
选择可由业务权重解释,例如准确优先于便宜;结果可重跑。
只比较一条提示;模型 A 联网、模型 B 不联网却直接比较事实准确。
先用 25 题免费自测看清准备度,或申请六平台专业基线测试,拿到有范围、有日期的真实数据。