五层诊断的第一层,也是最容易被忽略的致命项。常见障碍:robots.txt 误拦、CDN/WAF 或安全设置阻断 AI 爬虫(返回 403)、关键事实只存在于图片或 PDF 中、页面依赖 JS 渲染而爬虫拿不到文本。需要特别注意的是,各家 AI 的爬虫分为训练抓取、搜索索引与用户即时取回三类(如 OpenAI 的 GPTBot、OAI-SearchBot、ChatGPT-User),只放行其中一类是不够的。自检方式是用各爬虫的 User-Agent 直接请求首页与关键页面,确认返回 200 而非 403。