如何在2026年不使用API抓取Amazon评论
Amazon在2026年关闭了其公共评论API并加强了产品页面的安全性。精选样本仍可访问,但完整历史大多不可用。以下是您可以收集的内容——以及法律界限所在。
Amazon评论是网络上最丰富的免费消费者情感来源——星级分布、已验证购买信号,以及买家对产品使用的确切语言。但在2026年,简单的路径被关闭。Amazon关闭了公共评论API,并在2026年5月加强了评论的提供方式:从原始产品页面HTML中提取评论不再可靠,独立评论URL现在对未登录的访问者返回“未找到”页面。本指南涵盖了您仍可以干净地收集的内容,以及法律界限所在。
2026年您实际可以获取的内容
评论数据分为两个层级,风险截然不同。公共产品页面显示了大约8到13条“精选”评论的精选样本——Amazon选择的正面、批评和最有帮助的反馈组合。该样本是公共数据,足以对产品的市场表现进行可靠的判断。完整评论历史位于登录墙后,即使登录,Amazon现在也限制了提供的历史范围。对于任何商业用途,您应停留在精选样本上。
评论在页面上的位置
每个产品都有一个10字符的ASIN——任何产品URL中的ID,例如amazon.com/dp/B06X3SSTD8的ASIN是B06X3SSTD8。精选评论在产品详情页面(PDP)中呈现。旧的独立路径/product-reviews/<ASIN>/现在在您未登录时返回Amazon自己的“页面未找到”,这就是为什么经典的pageNumber分页循环在没有会话cookie时返回空结果。构建您的管道时围绕ASIN和PDP,而不是已退休的评论端点。

干净地抓取精选评论
精选集位于PDP中,因此您需要为每个ASIN获取一个页面。Amazon对抓取器进行严格指纹识别,因此这只能从干净的IP进行——通过一个住宅代理路由,使用美国出口,以便解决定价和可用性,并添加浏览器头设置。因为Amazon现在模糊了评论标记,务实的路线是使用Scraper API,它返回解析的评论对象,而不是不断变化的HTML外壳:
import requests
resp = requests.get(
"https://api.quantumproxies.io/scraper",
params={
"api_key": "YOUR_KEY",
"url": "https://www.amazon.com/dp/B06X3SSTD8",
"country": "us",
"render": "false",
"extract": "amazon_reviews",
},
timeout=60,
)
for r in resp.json().get("reviews", []):
print(r["rating"], r["verified_purchase"], r["title"])
如果您更喜欢自己解析,通过代理获取PDP并在精选块上运行选择器——但请准备好在Amazon更改布局时重新调整选择器,因为这种情况经常发生。API路线用稳定的JSON形状替代了这种维护。
值得捕获的字段
一个有用的评论记录不仅仅是星级+文本。捕获这些:
- rating — 1到5星,定量信号。
- verified_purchase — 当Amazon确认买家购买了该商品时为true;权重更高。
- helpful_votes — 有多少购物者认为它有用。注意:值为0通常意味着“未显示”,而不是“零票”。
- date — 完整的“Reviewed in ... on ...”字符串,用于新近性和趋势分析。
- author和body — 显示名称和全文,用于情感和关键词挖掘。
从一个产品扩展到一个目录
一个产品的精选样本是一个数据点;整个类别的是一个数据集。要扩大范围,您首先需要一个ASIN列表——从Amazon搜索或畅销书页面中提取,然后将每个ASIN输入评论获取。在规模上有两件事需要注意。首先,控制节奏:Amazon监控每个IP的请求速度,因此轮换住宅出口并在调用之间添加抖动,而不是在紧密的连续循环中发出。其次,故意固定市场——amazon.com、amazon.co.uk和amazon.de对同一产品有不同的评论,您的出口国家必须与域名匹配,否则您将获得本地化重定向而不是评论。收集数百个ASIN的精选样本,您将获得一个类别范围的情感图景,而不是单个产品页面能提供的。
抓取Amazon评论是否合法?
这不是法律建议,而是信息性说明——但形势很清楚。Amazon的服务条款明确禁止“使用数据挖掘、机器人或类似的数据收集和提取工具”。微妙之处在于抓取公共产品页面处于法律灰色地带:如果您从未登录,您从未同意这些条款,其可执行性在许多司法管辖区受到争议。抓取登录后的内容则不同——创建账户意味着您主动接受了服务条款,数据不是公共的。我们关于2026年网络抓取合法性的概述涵盖了案例法。实际规则:对于商业工作,停留在公共精选样本上,绝不逐字重发布个人的评论文本。

从评论到洞察
原始评论不是交付物——其中的模式才是。通过情感模型运行类别中的精选样本,以满意度对产品进行排名,挖掘一星和二星评论中的反复出现的缺陷,并跟踪竞争对手在发布后的评分变化。相同的管道可以扩展到其他来源;请参阅我们关于大规模抓取产品评论的指南,以及抓取Amazon产品数据中的ASIN发现方法,以构建您输入的产品列表。
常见问题解答
可以不使用账户抓取Amazon评论吗?
可以,但只能是精选样本。公共产品页面向未登录的访问者展示了大约8到13条评论的精选集——这是不登录情况下的上限。足以评估产品的表现。完整评论历史需要登录会话,这将使您受Amazon服务条款的约束,并超出公共数据范围。
抓取Amazon评论是否合法?
抓取公共产品页面数据处于争议的灰色地带——如果您没有登录,您没有同意Amazon的服务条款。抓取登录后的内容风险更大,因为创建账户意味着接受这些条款。这不是法律建议;对于商业用途,安全的姿态是仅收集公共精选评论,绝不将某人的评论文本作为您自己的重新发布。
每个产品可以抓取多少Amazon评论?
不登录的情况下,大约8到13条精选评论每个产品——Amazon选择公开展示的样本。自2026年5月以来,即使是登录会话也会遇到Amazon提供的完整历史的上限。如果您需要广泛覆盖,聚合多个产品的精选样本,而不是试图耗尽一个产品的历史。
用Python抓取Amazon评论的最佳方式是什么?
通过一个带有美国出口的住宅代理获取产品页面,然后使用BeautifulSoup解析精选块,或调用返回解析评论JSON的Scraper API。API路线更稳健,因为Amazon模糊了评论标记并频繁更改——稳定的JSON形状可以避免每隔几周重新调整选择器。
Amazon评论环境在2026年收窄,但有用的部分仍可访问:公共精选样本,从干净的IP收集,聚合整个目录而不是耗尽每个产品。停留在公共数据上,捕获携带信号的字段,并让情感分析将样本转化为实际决策。