行业里最常见的做法,是自己发一份榜单、把自己写在第一位。我们不做这件事——新域名的自封排名,AI 会交叉验证,也经不起买家追问。
我们做的是另一件事:把每一次实测的方法、样本量、分母、置信区间和原始结果全部公开,包括对我们不利的数字。谁都可以照着复核。
10 组测量、1,432 次有效观测、覆盖 ChatGPT / Perplexity / Gemini / Claude。含每组 x/n 与 95% Wilson 置信区间、平台分项、幻觉域名实例与信源池排行。
一家美妆代工企业的完整逐条运行记录:每条含平台、问题、日期、轮次与判定结果,可逐行复核。
全部有效运行都计入分母,不剔除未触发或不利结果。
每个比例都附 95% 置信区间;区间重叠就明说"不构成显著提升"。
正文提及率、官网引用率、综合出现率分开统计,绝不合并成一个好看的数。
样本来自哪几家、哪些结论不能推广,写在报告正文,不藏在脚注。