2026年搜索引擎结果页抓取的实际运作方式(在Google取消num=100并要求JavaScript之后)
两个不显眼的变化——强制JavaScript和num=100参数的取消——重写了搜索抓取的经济学。以下是实际发生的变化,为什么你的排名追踪器失效,以及如何在2026年可靠地收集SERP数据。
如果你的排名追踪器在2025年底突然沉默,或者你自制的Google抓取器开始返回空白页面,你并不是在想象。在九个月的时间里,Google进行了两项变化,单独来看似乎是小的维护,但合在一起却悄然重写了搜索抓取的经济学。这是一个关于实际发生了什么变化的实用指南,为什么它一次性破坏了如此多的工具,以及如何在2026年可靠地收集SERP数据而不烧毁你的基础设施或IP。
变化一:Google强制使用JavaScript
2025年1月17日,Google开始要求使用JavaScript来使用Google搜索。关闭它,你会得到一条简短的信息——“开启JavaScript以继续搜索”——而不是结果。一位公司发言人告诉TechCrunch,目标是“更好地保护我们的服务和用户免受机器人和不断发展的滥用和垃圾邮件形式的侵害”,并确认不到0.1%的搜索来自禁用JavaScript的用户。
0.1%的数字是个信号。大约每天85亿次搜索,千分之一仍然是数百万次请求——而其中不成比例的一部分从来不是人类。它们是排名追踪器、SEO爬虫和廉价抓取器,访问轻量级的无JavaScript版本的结果页面。Search Engine Journal直接确认了这一点:Google要求JavaScript以阻止机器人和抓取器,包括SEO工具。
启用JavaScript使我们能够更好地保护我们的服务和用户免受机器人和不断发展的滥用和垃圾邮件形式的侵害,并提供最相关和最新的信息。
实际后果是:通过获取URL并在静态HTML上运行正则表达式来解析Google的时代已经结束。结果现在是在客户端组装的。如果你的抓取器不能执行JavaScript,它不会看到降级页面——它什么也看不到。

变化二:num=100的消亡
第二个变化在外观上较小但影响更大。大约在2025年9月11日,Google禁用了&num=100 URL参数——这个小标志告诉搜索在单个页面上返回100个结果而不是默认的10个。十年来,它是深度排名追踪的支柱:一个请求,一百个位置。
当它消失时,数学在一夜之间颠倒。现在要查看前100个结果,你需要最多十个分页请求而不是一个。Keyword Insights在事件发生当天直言不讳地指出了成本。
Google已经取消了n=100 SERP参数。现在需要10个请求(成本增加10倍)才能获得100个SERP结果。这影响了我们的排名模块。我们正在审查选项,并将很快更新平台。
波及到了Google Search Console。从大约9月10日开始,SEO团队看到桌面展示次数急剧下降,而平均位置似乎有所改善。分析师Brodie Clark的理论——广泛讨论但从未被Google证实——是早期展示次数的大部分从来不是人类:它们是通过num=100加载100结果页面的机器人,每个页面注册的展示次数是正常页面的十倍。移除参数,虚假展示次数随之消失。这是一个社区解释,而不是官方解释,但它与时间完全吻合。

为什么这一次性破坏了如此多的工具
大多数SERP工具建立在两个假设之上,这两个假设多年来都是真实的,现在都不再成立:Google会提供无需JavaScript的可用HTML,你可以每个请求获取100个结果。在同一年移除这两个假设,故障模式叠加:
- 静态获取器返回空白或挑战页面而不是结果。
- 基于分页的收集器需要10倍的请求量以获得相同的覆盖,这意味着10倍的代理带宽和10倍的封锁面。
- 来自相同IP范围的更多请求更快触发反机器人系统,因此成功率恰好在需要增加请求量时下降。
- 搜索控制台基线发生了变化,因此历史仪表板不再能进行同类比较。
正如SEO工程师Ryan Jones所说,激进的抓取浪潮——现在大部分用于AI产品——正是促使Google反击的原因,破坏了排名检查器和SERP抓取器作为附带损害。工具并没有失败,因为它们写得不好。它们失败是因为基础发生了变化。
2026年可靠的SERP抓取是什么样的
新的基线有三个不可妥协的要素。缺少任何一个,你的成功率在负载下就会崩溃。
1. 执行JavaScript——但只在必要时
因为结果是在客户端组装的,你需要一个运行JavaScript的客户端来处理需要它的页面。但为每个请求启动一个无头浏览器既慢又昂贵。有效的模式是先尝试轻量级的、真实TLS指纹的获取,只有在页面实际挑战你时才升级到完整的浏览器渲染。大多数请求根本不需要浏览器;需要的请求会自动得到它。
2. 轮换带有真实浏览器指纹的住宅出口
数据中心IP和默认HTTP客户端指纹是最快的CAPTCHA之路。请求需要从住宅IP到达,带有像Chrome这样的真实浏览器的TLS和头部指纹。当一个出口被标记时,轮换到一个新的出口通常可以在不改变请求本身的情况下清除封锁——这正是一个有弹性的收集器从“异常流量”页面恢复而不是在其上失败的方式。
3. 解析为结构化数据,而不是原始HTML
Google的标记不断变化,后num=100时代的布局更加碎片化,而不是更少。针对一个移动目标维护你自己的选择器是一项全职工作。一个返回干净JSON的结构化SERP端点——有机结果、广告、购物、知识面板、People Also Ask、AI概览——将你的管道与Google方面的每一次外观变化隔离开来。

实践中的模式
与其自己维护浏览器、代理池和解析器,不如将查询交给一个同时处理这三者并返回干净结构化结果的端点。使用QuantumProxies SERP API,一个经过认证的请求处理JavaScript执行、住宅轮换和解析:
curl --location --request GET \
"https://app.quantumproxies.io/api/v1/serp/google/search?q=best+running+shoes&cc=us" \
--header "Authorization: Bearer YOUR_API_KEY"
响应是JSON,而不是HTML——有机结果带有位置、广告、购物单元、知识图谱、People Also Ask和AI概览(如果存在)。无需照看无头浏览器,无需在Google重新排列页面时修复选择器,分页处理使你不必手动重建num=100曾经免费提供的内容。当一个出口触发反机器人页面时,服务会自动在新的住宅IP上重试——这种轮换恢复行为在真实负载下保持管道活力。
如果你想在编写任何代码之前查看完整的请求和响应形状,https://quantumproxies.io/serp-api/docs上的交互式SERP API文档让你可以运行实时查询并复制cURL、Python、JavaScript、PHP、Go和Ruby的现成代码片段。
总结
SERP抓取并没有以某种模糊的、渐进的方式变得更难——它在一年内两次改变了形态。JavaScript现在是强制性的,因此你需要一个真正的客户端。num=100已经消失,因此深度覆盖的请求成本增加了一个数量级,这意味着你的代理层的质量和升级逻辑的智能现在比原始请求量更重要。2026年仍在大规模收集干净SERP数据的团队不是那些发送更多请求的团队,而是那些发送更智能请求的团队——JavaScript能力、住宅指纹化和从第一个字节开始的结构化。