提示、模型、知识库、规则、工具或字段任何变更都可能破坏旧能力。每次发布运行固定金标+最新生产失败+安全集,比较基线。
记录版本;canary/Shadow;分任务指标;失败自动阻断部署;保留上一版一键回滚;上线后监控漂移。
任何版本都有测试报告、批准、上线时间和回滚点。
新模型“更聪明”就免测;只看平均分不看关键失败。
先用 25 题免费自测看清准备度,或申请六平台专业基线测试,拿到有范围、有日期的真实数据。