Trustpilotレビューをスクレイピングして評判分析を行う方法
Trustpilotは、あなた自身やすべての競合他社のための公開評判フィードです。ページの構造、ページネーションの制限、スクレイピングしたレビューを感情分析パイプラインに変換する方法を紹介します。
Trustpilotは公開評判フィードであり、あなた自身のブランドだけでなく、すべての競合他社のためのものです。各企業ページは、日付付き、星評価付き、地理情報付きの意見の流れであり、評判追跡、競合他社のベンチマーク、製品フィードバックのために活用できます。このガイドでは、Trustpilotレビューをスクレイピングする方法、ページの構造、ページネーションの制限、キャプチャする価値のあるフィールド、生のテキストを手動読み取りを超えてスケールする感情分析パイプラインに変換する方法を紹介します。
Trustpilotページの構造
各企業にはtrustpilot.com/review/{domain}にレビューページがあります。例えば/review/example.comです。Trustpilotはローカライズされたドメインも運営しており、it.trustpilot.comやwww.trustpilot.comでは同じ企業の異なるレビューセットや並び順が表示されることがあります。特定の市場のレビューが必要な場合は、対応する地域のドメインにアクセスし、その地域の出口IPを使用してください。各レビューは、レビュアーの名前、星評価、日付、見出し、本文全体、そして便利なことにレビュアーの国を示す2文字のコードとして表示されます。
ページネーションとその制限
レビューはページネーションされており、1ページあたり約20件で、?page=Nパラメータが使用されます。ここで2つの問題があります。まず、Trustpilotは1つの企業でどれだけ深くページングできるかを制限しており、一般に知られている「200レビュー制限」を超えることを宣伝するツールもあります。次に、並び順が取得する内容に影響を与えます。最新順は最近の感情を捉え、関連性順は注目されたレビューに偏ります。並び順を慎重に決定し、非常に活発な企業の場合は、深いクロールではなくスケジュールされたパスで収集して深さ制限を超えず、新しいレビューをキャッチします。

スクレイピングの構築
Trustpilotは自動化されたトラフィックを指紋化するため、単純なリクエストはすぐにチャレンジされます。適切な国の出口を持つ回転する住宅プロキシを通すか、回転、指紋、レンダリングを管理し、ページごとにクリーンなHTMLまたはmarkdownを返すScraper APIに取得を任せます。
import requests
def fetch_page(domain, page, country="gb"):
return requests.get(
"https://api.quantumproxies.io/scraper",
params={
"api_key": "YOUR_KEY",
"url": f"https://www.trustpilot.com/review/{domain}?page={page}",
"country": country,
"render": "false",
},
timeout=60,
)
for page in range(1, 11): # walk pages 1..10
html = fetch_page("example.com", page).text
# parse each review card: author, rating, date, title, body, country
各カードをレコードに解析します。新しいアプローチは脆弱なCSSセレクタを完全にスキップし、ページHTMLをLLM抽出ステップに渡して構造化されたJSONを返します — Trustpilotがマークアップを調整したときにも耐性があります。
キャプチャするフィールド
- 評価 — 1から5の星、すべてのトレンドチャートの数値的なバックボーン。
- 日付 —
YYYY-MM-DDに正規化して、週や月ごとにバケット化できるようにします。 - 著者と総レビュー数 — レビュアーと彼らの多作さ(一つのレビューアカウントは百レビューアカウントとは異なります)。
- タイトルと本文 — 見出しと全文、感情とキーワードのソース。
- 国 — 市場ごとに評判を分割できる2文字のコード。
レビューを感情分析パイプラインに変換する
星評価は大雑把な道具です — 三つ星レビューは一つの不満を伴う絶賛かもしれません。各本文を感情ステップに通し、ポジティブ、中立、ネガティブとして分類し、信頼スコアを付けて、重み付けとフィルタリングを行います。典型的な出力は{"category": "Positive", "confidence": 0.95}のようになります。スコアリングされたレコードを保存 — シート、データベース、またはダッシュボードに — レビューIDでキーを付けて、再スクレイプが更新を行うようにします。この5段階のフロー(取得、解析、構造化、スコアリング、保存)がシステム全体です。

Scraper APIでTrustpilotページをクリーンに取得する
評判と競合他社のユースケース
データが届いたら、分析がスクレイプの価値を証明します。自社の評価を時間とともに追跡し、売上に現れる前に低下を警告します。競合他社を並べてベンチマークし、平均評価、不満のテーマ、応答率を比較して、彼らの弱点を見つけます。国フィールドで分割して、どの市場があなたを高く評価し、どの市場がそうでないかを確認します。同じレビュー採掘パターンはYelpやGoogle Mapsビジネスデータにも適用されるため、単一のパイプラインであらゆる評判の表面を一度にカバーできます。これは情報提供であり、法的アドバイスではありません — 公開レビューのページに留まり、個人のテキストをそのまま再公開しないようにしてください。
スケジューリングとデータの新鮮さを保つ
レビューは一度の取得ではありません — 評判は動くターゲットなので、収集はスケジュールであり、スクリプトではありません。企業ごとに毎日または毎週のパスを実行し、最新順でレビューIDでアップサートして、新しいレビューが追加され、既存のものがその場で更新されるようにします。これにより、Trustpilotの企業ごとの深さ制限を回避できます — レビューが着地するたびにキャッチすれば、深くページングする必要はありません — そしてデータを価値あるものにする時系列を提供します:評価のトレンドライン、悪い週の後の不満のスパイク、応答率の変化。シンプルなアラート(週ごとに半分以上の星が落ちる、または一つ星レビューの急増)を追加すれば、パイプラインは研究ツールではなく、あなたの評判と競合他社のための早期警告システムになります。
新鮮さにはコストがありますが、毎日すべての企業を再取得することは、ほとんど変わらないデータに帯域幅とIPを消費します。監視ジョブのように階層化します:自社ブランドと上位の競合他社を注意深く監視し、長いテールを週または月ごとにスイープします。レビュー量が実際に動く企業にクロールを重み付けすることで、データを最新に保ち、請求を合理的にします。
よくある質問
Trustpilotレビューをスクレイピングできますか?
はい — 企業レビューのページは公開されており、ページネーションされているため、各レビューの著者、評価、日付、タイトル、本文、国を収集できます。主な障害はTrustpilotのボット検出であり、クリーンな回転IPが必要です。また、企業ごとの深さ制限があり、最新順に並べ替えて、スケジュールされたパスで収集することで、深いクロールを避けます。
Trustpilotをスクレイピングすることは合法ですか?
公開されているレビューのページをスクレイピングすることは、他の公開データ収集と同じグレーゾーンにあります — これは法的アドバイスではありません。公開ページに留まり、ログインを回避しようとせず、リクエストレートを控えめにし、レビュアーの個人データやテキストをそのまま再公開しないようにしてください。集計された評判と競合他社分析では、派生したメトリクスが個々のレビューよりも重要です。
Trustpilotのすべてのレビューをどのようにスクレイピングしますか?
/review/{domain}?page=Nを通じてレビューがなくなるまでページングしますが、Trustpilotは1つの企業に対して提供する深さを制限しています。広範囲にカバーするには、最新順に並べ替え、繰り返しスケジュールされた実行で収集し、新しいレビューが時間とともにキャプチャされるようにし、特定の市場のレビューが必要な場合は、対応する地域のドメインに一致する国の出口でアクセスします。
Trustpilotレビューを大規模に分析するにはどうすればいいですか?
各レビューの本文を感情分類器に通し、カテゴリ(ポジティブ、中立、ネガティブ)と信頼スコアを返し、スコアリングされたレコードをレビューIDでキー付けして保存します。そこから評価のトレンドをチャート化し、不満のテーマをクラスタリングし、国フィールドで分割し、競合他社をベンチマークします — 感情レイヤーは数千のレビューを数個の意思決定に変えます。
Trustpilotは、あなたや競合他社について顧客が何を考えているかを日付付き、地理情報付き、星評価付きフィードで提供します。スクレイプは5段階で、クリーンな地域制限されたIPなしでは取得が失敗し、感情レイヤーが生のテキストを実際に管理可能な評判に変えます。