JavaScript 加载的内容,AI 爬虫不一定看得到
AI 爬虫看网站的方式不一定和 Googlebot 一样。重要页面内容通过 JS 加载时,部分爬虫可能拿不到——这造成实际的可见性问题:企业为人类访客发布有用信息,却让 AI 系统更难发现、理解、引用和署名这些信息。
关键问题不是站点用不用 JS(现代站点基本都用),而是解释业务、服务、产品、专业性与政策的内容,在爬虫不按访客浏览器方式处理页面时是否仍然可访问。可见性早就不限于传统搜索结果:AI 搜索与问答系统依赖找到并解读可靠信息,如果关键文案只在客户端脚本跑完后出现,这些系统对页面的理解可能不完整。
先审查最重要的页面
从商业与信息价值最明确的页面开始:核心服务与产品页、定价/可用性/位置信息、关于/联系/政策页、帮助与 FAQ、案例研究/文档/专业性证据。逐页确认哪些立即可见、哪些只在 JS 运行后出现——尤其注意确立页面主题的标题、说明文案、链接与结构化区块。如果这些依赖 JS,页面可能更难被 AI 爬虫稳定解读。
这不仅是技术整理:可访问上下文有限的页面难以匹配用户问题,署名也可能更难发生——爬虫没碰到识别"这是相关来源"的细节。
把必要内容与交互增强分开
JS 支持交互控件、动态元素是有价值的。风险出现在技术成为信息的唯一通道时:把页面的"essential meaning"和交互层分开处理——访客不靠脚本后才出现的内容,也应能识别页面主题、背后的组织和它提供的关键信息。
例如:交互式服务选择器帮访客缩小范围,但底层服务描述仍应清楚说明提供什么;可展开 FAQ 提升可用性,但问答本身是重要内容而非可选装饰。
实践建议
- 对 AI 可见性做专项审查:按"Googlebot 视角"和"纯文本爬虫视角"各抓一次关键页面,看标题/正文/链接是否 JS 依赖;
- 关键信息 SSR 或静态化兜底,JS 只做增强层,别让内容只存在于客户端渲染之后;
- 页面能被"无上下文地理解"是底线:单看一页就能说出它是谁、讲什么、提供什么。
来源:How JavaScript Can Limit AI Crawler Access to Your Website Content - DEV Community