拓冰建站拓冰建站
首页 / 资讯中心 / 正文

新网站在搜索引擎完全搜不到怎么优化?(一)

最近我上线了一个面向制造业现场人员的AI工具网站聆机智能制造业AI工具箱网站地址是https://ai.linkede.cn这个工具主要用于生成制造业常见文档比如8D报告、SOP作业指导书、设备点检表、设备保养规范、生产日报和班组交接班记录。网站上线后访问、注册和文档生成功能基本正常。但我很快发现了一个问题在搜索引擎搜索“聆机智能AI工具箱”完全找不到网站。我又试着搜索完整网址、公司名称和产品名称结果还是没有这个网站公司官网倒是可以搜出来。按照过往惯性思维当时第一反是做SEO、发外链、堆关键词或者在多个平台大量发布文章。但如果搜索引擎连网站都没有正常发现后面的工作基本都是白费。所以我先确认一个基础问题搜索引擎能不能正常访问这个网站第一步先判断是没排名还是没收录网站搜索不到通常有两种情况。第一种是网站已经被收录只是排名比较靠后。第二种是搜索引擎根本没有建立这个网站的索引。可以先在百度中搜索site:ai.linkede.cnsite:是一个常见的收录查询方式用来查看某个域名下有没有页面出现在搜索结果中。如果能看到首页、工具页面或者其他内容说明网站已经有部分页面被收录只是品牌词排名还没有上来。如果完全没有结果再搜索聆机智能AI工具箱或者聆机智能制造业AI工具箱结果完整品牌名、完整域名和site:查询都没有搜到网站。转为检查下面几个网站能不能正常访问搜索蜘蛛是否被拦截服务器返回的页面中有没有正文页面是否设置了禁止收录搜索引擎是否知道这个子域名存在第二步检查域名解析是否正常普通浏览器能打开网站不代表搜索蜘蛛一定能访问。有些网站配置了防火墙、CDN机器人防护或反爬虫规则。普通用户访问返回200搜索蜘蛛访问时却可能返回403。我在Mac终端执行了下面的命令curl -A Baiduspider -I https://ai.linkede.cn/其中-A Baiduspider用于把请求的 User-Agent 设置为Baiduspider模拟百度蜘蛛访问。参数-I表示只查看HTTP响应头不下载完整网页。实际返回结果如下第三步第一次排查结果百度蜘蛛没有被直接拦截最关键的一行是HTTP/1.1 200 OK这说明使用Baiduspider作为 User-Agent 访问首页时服务器正常返回了页面。没有出现403 Forbidden也没有出现404 Not Found或者502 Bad Gateway因此从这次测试来看可以暂时排除几个问题Nginx没有直接拒绝百度蜘蛛网站防火墙没有按User-Agent拦截Baiduspider首页路由可以正常访问Next.js服务正常响应HTTPS访问没有明显异常响应头中也没有发现X-Robots-Tag: noindex如果存在这个响应头搜索引擎会被明确要求不要索引页面。目前没有发现这种情况。不过HTTP 200只代表服务器成功返回了页面并不代表百度蜘蛛已经看到了完整内容。第四步返回200不等于蜘蛛看到了正文网站使用的是 Next.js。Next.js既可以在服务器端输出完整HTML也可以把部分内容留到浏览器中通过JavaScript加载。如果服务器返回的HTML只有div id__next/div而标题、介绍和工具列表都要等JavaScript执行后才出现那么搜索引擎理解页面的难度会更高。所以下一步需要检查百度蜘蛛实际拿到的HTML。我执行了curl -A Baiduspider -sL https://ai.linkede.cn/ \ baiduspider-homepage.html这条命令会把模拟百度蜘蛛访问获得的完整HTML保存到baiduspider-homepage.html然后搜索首页的核心内容grep -oE 聆机智能|AI工具箱|8D报告|SOP|设备点检表|生产日报 \ baiduspider-homepage.html | sort -u实际输出为8D报告 AI工具箱 SOP 聆机智能 设备点检表 生产日报这个结果非常关键。它说明百度蜘蛛拿到的不是只有div#__next的空壳页面。首页的品牌名称、产品名称和主要工具类型已经直接存在于服务器返回的HTML中。也就是说当前Next.js网站已经能够向搜索蜘蛛输出主要正文。因此可以暂时排除“纯前端SPA导致蜘蛛看不到内容”这个常见问题。第五步检查页面标题内容确认正文存在后我继续检查HTML中的标题grep -oE title[^]*/title baiduspider-homepage.html实际结果为title制造业 AI 文档生成工具/title这个标题能够正常输出但还有一个比较明显的问题。用户更可能搜索的以及我们在别的地方推广的是聆机智能制造业AI工具箱而当前标题写的是制造业 AI 文档生成工具两者意思接近但缺失了品牌名称品牌名称并不完全一致。对于一个新网站来说品牌词最好保持统一。网站首页、Logo、页面标题、公众号和外部文章中尽量使用相同名称。后续准备将首页标题改成title聆机智能制造业AI工具箱 - 8D报告、SOP、点检表在线生成/title这样既保留完整产品名称也说明了网站提供的具体功能。第六步、检查页面描述继续检查页面 descriptiongrep -oE meta[^]namedescription[^]* \ baiduspider-homepage.html当前页面描述为这段描述已经比较清楚地说明了目标用户和主要功能。不过描述中没有出现完整产品名称。后续可以改成meta namedescription content聆机智能制造业AI工具箱面向制造业质量、设备、生产和工艺人员支持生成8D报告、SOP作业指导书、设备点检表和生产日报并可导出Word和PDF。 /这样可以同时强化品牌词和具体用途。第七步、检查是否存在禁止收录设置我继续执行grep -oiE noindex|nofollow baiduspider-homepage.html命令没有返回任何结果。这说明当前首页HTML中没有发现meta namerobots contentnoindex也没有发现meta namerobots contentnofollow因此当前页面没有明确禁止搜索引擎索引或跟踪链接。首页暂时没有设置meta namerobots contentindex,follow这不算严重问题。在没有noindex的情况下搜索引擎通常默认可以索引页面。但为了让配置更明确后续仍然可以补充meta namerobots contentindex,follow第八步、检查canonical我又检查了canonicalgrep -oE link[^]relcanonical[^]* \ baiduspider-homepage.html这条命令没有任何输出。说明首页目前没有设置canonical。canonical用于告诉搜索引擎当前页面的标准地址是什么。例如我们的网站存在以下几种访问方式https://ai.linkede.cnhttps://ai.linkede.cn/http://ai.linkede.cn/虽然这些地址最终可能访问的是同一个页面但搜索引擎需要一个明确的标准地址。后续在首页补充link relcanonical hrefhttps://ai.linkede.cn/还要每个公开工具页面也要设置自己的canonical。例如link relcanonical hrefhttps://ai.linkede.cn/tools/ai-8d-report /第九步、检查百度蜘蛛返回的HTML我还对比了普通访问和模拟百度蜘蛛访问保存下来的HTMLcmp -s homepage.html baiduspider-homepage.html \ echo 普通访问与百度蜘蛛返回内容一致 \ || echo 两种访问返回内容不同实际结果为不过这个结果暂时不能说明网站针对搜索蜘蛛返回了特殊页面。Next.js生成的HTML中可能包含动态内容例如路由状态React服务端组件数据构建标识动态请求ID资源预加载信息缓存相关数据即使连续发送两次普通请求返回的HTML也可能存在细微差别。真正需要比较的不是整个文件是否逐字相同而是页面标题是否一致主要正文是否一致是否都能看到产品名称是否有一方返回错误页是否有一方出现noindex目前模拟百度蜘蛛访问时能够看到完整的品牌和工具内容因此暂时没有发现针对蜘蛛隐藏内容的问题。第一轮检查后的结论经过这次排查我原本担心的几个问题基本可以排除。检查项目实际结果模拟Baiduspider访问HTTP 200Nginx是否拦截蜘蛛暂未发现Next.js是否只返回空壳不是原始HTML是否有中文正文有title是否存在有description是否存在有noindex未发现nofollow未发现canonical暂未配置品牌名称是否统一需要调整robots.txt待检查sitemap.xml待检查百度资源平台提交待执行所以网站目前搜不到至少不是因为服务器拒绝访问也不是因为搜索蜘蛛只能看到空页面。可以确定网站具备基础抓取条件。接下来的重点应该转向统一首页品牌名称优化title和description增加canonical检查robots.txt检查并生成sitemap.xml在百度搜索资源平台添加子域名使用百度抓取诊断查看真实抓取结果从公司主站建立指向AI工具箱的链接下一篇将继续检查Next.js网站的robots.txt和sitemap.xml是否真的存在为什么有时访问这两个地址返回的却是网站首页。
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门