如何在2026年不使用API抓取Amazon评论

Amazon在2026年关闭了其公共评论API并加强了产品页面的安全性。精选样本仍可访问,但完整历史大多不可用。以下是您可以收集的内容——以及法律界限所在。

Amazon评论是网络上最丰富的免费消费者情感来源——星级分布、已验证购买信号,以及买家对产品使用的确切语言。但在2026年,简单的路径被关闭。Amazon关闭了公共评论API,并在2026年5月加强了评论的提供方式:从原始产品页面HTML中提取评论不再可靠,独立评论URL现在对未登录的访问者返回“未找到”页面。本指南涵盖了您仍可以干净地收集的内容,以及法律界限所在。

2026年您实际可以获取的内容

评论数据分为两个层级,风险截然不同。公共产品页面显示了大约8到13条“精选”评论的精选样本——Amazon选择的正面、批评和最有帮助的反馈组合。该样本是公共数据,足以对产品的市场表现进行可靠的判断。完整评论历史位于登录墙后,即使登录,Amazon现在也限制了提供的历史范围。对于任何商业用途,您应停留在精选样本上。

评论在页面上的位置

每个产品都有一个10字符的ASIN——任何产品URL中的ID,例如amazon.com/dp/B06X3SSTD8的ASIN是B06X3SSTD8。精选评论在产品详情页面(PDP)中呈现。旧的独立路径/product-reviews/<ASIN>/现在在您未登录时返回Amazon自己的“页面未找到”,这就是为什么经典的pageNumber分页循环在没有会话cookie时返回空结果。构建您的管道时围绕ASIN和PDP,而不是已退休的评论端点。

进入Amazon评论的两种方式对比图:公共精选样本与登录墙后的完整历史
公共精选样本风险低,足以进行情感分析。登录墙后的完整历史属于不同的法律类别。

干净地抓取精选评论

精选集位于PDP中,因此您需要为每个ASIN获取一个页面。Amazon对抓取器进行严格指纹识别,因此这只能从干净的IP进行——通过一个住宅代理路由,使用美国出口,以便解决定价和可用性,并添加浏览器头设置。因为Amazon现在模糊了评论标记,务实的路线是使用Scraper API,它返回解析的评论对象,而不是不断变化的HTML外壳:

import requests

resp = requests.get(
    "https://api.quantumproxies.io/scraper",
    params={
        "api_key": "YOUR_KEY",
        "url": "https://www.amazon.com/dp/B06X3SSTD8",
        "country": "us",
        "render": "false",
        "extract": "amazon_reviews",
    },
    timeout=60,
)
for r in resp.json().get("reviews", []):
    print(r["rating"], r["verified_purchase"], r["title"])

如果您更喜欢自己解析,通过代理获取PDP并在精选块上运行选择器——但请准备好在Amazon更改布局时重新调整选择器,因为这种情况经常发生。API路线用稳定的JSON形状替代了这种维护。

值得捕获的字段

一个有用的评论记录不仅仅是星级+文本。捕获这些:

从一个产品扩展到一个目录

一个产品的精选样本是一个数据点;整个类别的是一个数据集。要扩大范围,您首先需要一个ASIN列表——从Amazon搜索或畅销书页面中提取,然后将每个ASIN输入评论获取。在规模上有两件事需要注意。首先,控制节奏:Amazon监控每个IP的请求速度,因此轮换住宅出口并在调用之间添加抖动,而不是在紧密的连续循环中发出。其次,故意固定市场——amazon.comamazon.co.ukamazon.de对同一产品有不同的评论,您的出口国家必须与域名匹配,否则您将获得本地化重定向而不是评论。收集数百个ASIN的精选样本,您将获得一个类别范围的情感图景,而不是单个产品页面能提供的。

抓取Amazon评论是否合法?

这不是法律建议,而是信息性说明——但形势很清楚。Amazon的服务条款明确禁止“使用数据挖掘、机器人或类似的数据收集和提取工具”。微妙之处在于抓取公共产品页面处于法律灰色地带:如果您从未登录,您从未同意这些条款,其可执行性在许多司法管辖区受到争议。抓取登录后的内容则不同——创建账户意味着您主动接受了服务条款,数据不是公共的。我们关于2026年网络抓取合法性的概述涵盖了案例法。实际规则:对于商业工作,停留在公共精选样本上,绝不逐字重发布个人的评论文本。

抓取Amazon评论的注意事项清单,对比公共精选评论与登录墙后的完整历史收集
公共精选评论在建议一侧;登录墙和逐字重用在避免一侧。

使用Scraper API提取解析的Amazon评论

从评论到洞察

原始评论不是交付物——其中的模式才是。通过情感模型运行类别中的精选样本,以满意度对产品进行排名,挖掘一星和二星评论中的反复出现的缺陷,并跟踪竞争对手在发布后的评分变化。相同的管道可以扩展到其他来源;请参阅我们关于大规模抓取产品评论的指南,以及抓取Amazon产品数据中的ASIN发现方法,以构建您输入的产品列表。

常见问题解答

可以不使用账户抓取Amazon评论吗?

可以,但只能是精选样本。公共产品页面向未登录的访问者展示了大约8到13条评论的精选集——这是不登录情况下的上限。足以评估产品的表现。完整评论历史需要登录会话,这将使您受Amazon服务条款的约束,并超出公共数据范围。

抓取Amazon评论是否合法?

抓取公共产品页面数据处于争议的灰色地带——如果您没有登录,您没有同意Amazon的服务条款。抓取登录后的内容风险更大,因为创建账户意味着接受这些条款。这不是法律建议;对于商业用途,安全的姿态是仅收集公共精选评论,绝不将某人的评论文本作为您自己的重新发布。

每个产品可以抓取多少Amazon评论?

不登录的情况下,大约8到13条精选评论每个产品——Amazon选择公开展示的样本。自2026年5月以来,即使是登录会话也会遇到Amazon提供的完整历史的上限。如果您需要广泛覆盖,聚合多个产品的精选样本,而不是试图耗尽一个产品的历史。

用Python抓取Amazon评论的最佳方式是什么?

通过一个带有美国出口的住宅代理获取产品页面,然后使用BeautifulSoup解析精选块,或调用返回解析评论JSON的Scraper API。API路线更稳健,因为Amazon模糊了评论标记并频繁更改——稳定的JSON形状可以避免每隔几周重新调整选择器。

Amazon评论环境在2026年收窄,但有用的部分仍可访问:公共精选样本,从干净的IP收集,聚合整个目录而不是耗尽每个产品。停留在公共数据上,捕获携带信号的字段,并让情感分析将样本转化为实际决策。

从干净的住宅IP开始抓取Amazon