如何抓取Trustpilot评论进行声誉分析
Trustpilot是一个公开的声誉信息源,不仅适用于您的品牌,也适用于所有竞争对手。以下是页面的结构、分页的上限,以及如何将抓取的评论转化为情感分析管道。
Trustpilot是一个公开的声誉信息源——不仅适用于您的品牌,也适用于所有竞争对手。每个公司页面都是一个包含日期、星级、地理位置的意见流,您可以利用这些信息进行声誉跟踪、竞争对手基准分析和产品反馈。本文指南涵盖如何抓取Trustpilot评论:页面的结构、分页的上限、值得捕捉的字段,以及如何将原始文本转化为超越手动阅读的情感分析管道。
Trustpilot页面的结构
每个公司在trustpilot.com/review/{domain}都有一个评论页面——例如/review/example.com。Trustpilot也运行本地化的域名,因此it.trustpilot.com和www.trustpilot.com可以为同一家公司提供不同的评论集和排序顺序。这很重要:如果您想要特定市场的评论,请访问匹配的区域域名并使用该地区的出口IP。每条评论呈现为一个卡片,包含评论者的姓名、星级、日期、标题、完整正文文本,以及——非常有用的——评论者的国家代码(两位字母)。
分页及其上限
评论是分页的,每页大约20条,使用?page=N参数。这里有两个问题。首先,Trustpilot限制了您在单个公司页面上能翻页的深度——众所周知的“200条评论限制”,现成的工具声称可以突破。其次,排序顺序会影响您获取的内容:最新优先捕捉到的是最近的情感,而相关性排序的页面则倾向于突出显示的评论。请谨慎选择排序,对于非常活跃的公司,建议定期收集而不是一次性深度抓取,这样可以保持在深度限制之下并捕捉到新的评论。

构建抓取
Trustpilot会识别自动化流量,因此简单的请求会很快受到挑战。通过一个旋转的住宅代理路由,使用正确的国家出口,或者将获取交给一个Scraper API,它管理旋转、指纹和渲染,并返回每页的干净HTML或markdown:
import requests
def fetch_page(domain, page, country="gb"):
return requests.get(
"https://api.quantumproxies.io/scraper",
params={
"api_key": "YOUR_KEY",
"url": f"https://www.trustpilot.com/review/{domain}?page={page}",
"country": country,
"render": "false",
},
timeout=60,
)
for page in range(1, 11): # walk pages 1..10
html = fetch_page("example.com", page).text
# parse each review card: author, rating, date, title, body, country
将每个卡片解析为一个记录。较新的方法完全跳过脆弱的CSS选择器,将页面HTML传递给LLM提取步骤,返回结构化的JSON——当Trustpilot调整其标记时仍然具有弹性。
需要捕捉的字段
- rating——1到5星,是每个趋势图的数值骨干。
- date——规范化为
YYYY-MM-DD,以便按周或月进行分组。 - author和total reviews——评论者及其评论数量(一个评论的账户与一百个评论的账户读起来不同)。
- title和body——标题和完整文本,是您的情感和关键词来源。
- country——一个两位字母代码,让您可以按市场划分声誉。
将评论转化为情感分析管道
星级评分是一个粗略的工具——一条三星评论可能是一个赞美但带有一个抱怨。将每个正文通过情感步骤分类为正面、中性或负面,并附带置信度评分,以便您可以加权和筛选。典型的输出看起来像{"category": "Positive", "confidence": 0.95}。将评分记录附加到存储中——一个表格、一个数据库或一个仪表板——以评论ID为键,这样重新抓取时是更新而不是重复。这个五阶段流程(获取、解析、结构化、评分、存储)就是整个系统。

使用Scraper API干净地获取Trustpilot页面
声誉和竞争对手的用例
一旦数据落地,分析就为抓取付出了代价。跟踪您自己的评分随时间的变化,并在销售出现下滑之前发出警报。并排基准竞争对手——平均评分、投诉主题、响应率——找出他们的弱点。按国家字段划分,看看哪些市场对您的评价好,哪些不好。同样的评论挖掘模式适用于Yelp和Google Maps商业数据,因此一个管道可以同时覆盖每个声誉表面。这是信息性的,不是法律建议——请保持在公共评论页面,不要逐字重发个人的文本。
调度和保持数据新鲜
评论不是一次性提取——声誉是一个移动的目标,因此收集必须是一个计划,而不是一个脚本。每家公司每天或每周运行一次,最新优先,并根据评论ID进行更新插入,这样新评论会附加而现有评论会在原地更新。这绕过了Trustpilot的每家公司深度限制——如果您在评论发布时捕捉到它们,就不需要深度翻页——并为您提供了使数据有价值的时间序列:评分趋势线、糟糕一周后的投诉高峰和响应率的变化。添加一个简单的警报(每周下降超过半星,或一星评论激增),管道就不再是一个研究工具,而成为您和竞争对手声誉的预警系统。
不过,新鲜度是有代价的。每天重新抓取每家公司会消耗带宽和IP,而大多数数据并没有变化。像任何监控工作一样分层:密切关注您自己的品牌和前几个竞争对手,长尾则每周或每月扫描一次。将抓取的权重倾向于评论量实际变化的公司,保持数据的同时也保持账单的合理。
常见问题
可以抓取Trustpilot评论吗?
可以——公司评论页面是公开的并分页,因此您可以收集每条评论的作者、评分、日期、标题、正文和国家。主要障碍是Trustpilot的机器人检测,需要干净的旋转IP,以及其每家公司深度限制,您可以通过最新优先排序和定期收集而不是一次性深度抓取来解决。
抓取Trustpilot是否合法?
抓取公开可见的评论页面通常与其他公共数据收集处于同一灰色地带——这不是法律建议。请保持在公共页面,不要尝试绕过登录,保持请求率礼貌,并避免逐字重发评论者的个人数据或文本。对于汇总的声誉和竞争对手分析,派生的指标比任何单个评论更重要。
如何从Trustpilot抓取所有评论?
您可以通过/review/{domain}?page=N翻页,直到没有更多评论,但Trustpilot限制了单个公司提供的深度。为了获得广泛的覆盖,选择最新优先排序,定期重复运行以便随着时间的推移捕捉到新评论,并在需要特定市场评论时访问相关的区域域名并使用匹配的国家出口。
如何大规模分析Trustpilot评论?
将每个评论正文通过情感分类器,返回一个类别(正面、中性、负面)和置信度评分,然后将评分记录以评论ID为键存储。从那里您可以绘制评分趋势,聚类投诉主题,按国家字段划分,并基准竞争对手——情感层将数千条评论转化为少数决策。
Trustpilot为您提供了一个包含日期、地理位置、星级的反馈流,准确反映了客户的想法——关于您和您的竞争对手。抓取有五个阶段;没有干净的地理锁定IP,获取阶段就会失败,而情感层是将原始文本转化为您可以实际管理的声誉的关键。