Trustpilot 리뷰를 스크랩하여 평판 분석하는 방법

Trustpilot은 당신과 모든 경쟁업체의 공개 평판 피드입니다. 페이지 구조, 페이지네이션 한계, 스크랩한 리뷰를 감정 분석 파이프라인으로 전환하는 방법을 알아보세요.

Trustpilot은 당신의 브랜드뿐만 아니라 모든 경쟁업체의 공개 평판 피드입니다. 각 회사 페이지는 날짜가 지정된 별점 평가 및 지리적 위치가 포함된 의견의 스트림으로, 평판 추적, 경쟁업체 벤치마킹, 제품 피드백을 위해 데이터를 채굴할 수 있습니다. 이 가이드는 Trustpilot 리뷰를 스크랩하는 방법을 다룹니다: 페이지 구조, 페이지네이션 한계, 캡처할 가치가 있는 필드, 원시 텍스트를 확장 가능한 감정 분석 파이프라인으로 전환하는 방법을 설명합니다.

Trustpilot 페이지의 구조

모든 회사는 trustpilot.com/review/{domain}에 리뷰 페이지를 가지고 있습니다 — 예를 들어 /review/example.com. Trustpilot은 지역화된 도메인도 운영하므로, it.trustpilot.comwww.trustpilot.com은 동일한 회사에 대해 다른 리뷰 세트와 정렬 순서를 표시할 수 있습니다. 이는 중요합니다: 특정 시장의 리뷰를 원한다면 해당 지역의 도메인을 사용하고 그 지역의 IP로 접속하세요. 각 리뷰는 리뷰어의 이름, 별점, 날짜, 제목, 본문 텍스트, 그리고 유용하게도 리뷰어의 국가를 두 글자 코드로 표시하는 카드로 렌더링됩니다.

페이지네이션과 한계

리뷰는 페이지당 약 20개씩 페이지네이션되며, ?page=N 매개변수를 사용합니다. 여기서 두 가지 문제가 발생합니다. 첫째, Trustpilot은 단일 회사에 대해 페이지를 얼마나 깊이 탐색할 수 있는지를 제한합니다 — 잘 알려진 "200-리뷰 한계"는 상용 도구들이 이를 극복한다고 광고합니다. 둘째, 정렬 순서가 결과에 영향을 미칩니다: 최신순은 최근 감정을 포착하고, 관련성 정렬은 강조된 리뷰로 편향됩니다. 정렬을 신중하게 선택하고, 매우 활동적인 회사의 경우 깊이 탐색을 피하고 새로운 리뷰가 도착할 때마다 수집하여 깊이 한계를 넘지 않도록 하세요.

Trustpilot 리뷰 파이프라인의 흐름도: 페이지네이션된 페이지 가져오기, 리뷰 카드 파싱, 필드 구조화, 감정 점수 매기기, 저장
파이프라인은 다섯 단계로 구성됩니다; 가져오기 단계 — 지리적 잠금 해제 및 페이지네이션 한계 —는 대부분의 스크래퍼가 실패하는 부분입니다.

스크랩 구축

Trustpilot은 자동화된 트래픽을 지문으로 식별하므로, 단순 요청은 빠르게 도전받습니다. 올바른 국가 출구를 가진 회전 주거용 프록시를 통해 라우팅하거나, 회전, 지문 및 렌더링을 관리하고 페이지당 깨끗한 HTML 또는 markdown을 반환하는 Scraper API에 가져오기를 맡기세요:

import requests

def fetch_page(domain, page, country="gb"):
    return requests.get(
        "https://api.quantumproxies.io/scraper",
        params={
            "api_key": "YOUR_KEY",
            "url": f"https://www.trustpilot.com/review/{domain}?page={page}",
            "country": country,
            "render": "false",
        },
        timeout=60,
    )

for page in range(1, 11):          # walk pages 1..10
    html = fetch_page("example.com", page).text
    # parse each review card: author, rating, date, title, body, country

각 카드를 기록으로 파싱하세요. 최신 접근 방식은 취약한 CSS 선택기를 완전히 건너뛰고 페이지 HTML을 LLM 추출 단계로 전달하여 구조화된 JSON을 반환합니다 — Trustpilot이 마크업을 조정할 때도 견고합니다.

캡처할 필드

리뷰를 감정 분석 파이프라인으로 전환

별점은 둔한 도구입니다 — 세 별점 리뷰는 한 가지 불만을 가진 극찬일 수 있습니다. 각 본문을 감정 단계에 통과시켜 긍정적, 중립적, 부정적으로 분류하고 신뢰도 점수를 부여하여 가중치와 필터링을 할 수 있습니다. 일반적인 출력은 {"category": "Positive", "confidence": 0.95}와 같습니다. 점수화된 기록을 저장소 — 시트, 데이터베이스, 대시보드 —에 리뷰 ID로 키를 지정하여 추가하세요, 재스크랩 시 업데이트되도록. 이 다섯 단계 흐름 (가져오기, 파싱, 구조화, 점수화, 저장)이 전체 시스템입니다.

Trustpilot 리뷰가 포함하는 것의 통계 다이어그램: 1에서 5까지의 별점, 세 가지 감정 클래스, 두 글자 국가 코드, 페이지당 약 20개의 리뷰
평점과 국가, 날짜만으로 시장별로 평판을 나누고 그 움직임을 추적할 수 있습니다.

Scraper API로 Trustpilot 페이지를 깨끗하게 가져오기

평판 및 경쟁업체 사용 사례

데이터가 도착하면 분석이 스크랩의 가치를 입증합니다. 시간 경과에 따른 자신의 평점을 추적하고 매출에 영향을 미치기 전에 하락을 경고합니다. 경쟁업체를 나란히 벤치마킹 — 평균 평점, 불만 테마, 응답률 — 하여 그들의 약점을 찾습니다. 국가 필드로 나누어 어떤 시장이 당신을 잘 평가하고 어떤 시장이 그렇지 않은지 확인하세요. 동일한 리뷰 마이닝 패턴은 YelpGoogle Maps 비즈니스 데이터에도 적용되므로, 단일 파이프라인으로 모든 평판 표면을 한 번에 커버할 수 있습니다. 이는 정보 제공용이며 법적 조언이 아닙니다 — 공개 리뷰 페이지에 머물고 개인의 텍스트를 그대로 다시 게시하지 마세요.

일정 관리 및 데이터 신선도 유지

리뷰는 일회성 수집이 아닙니다 — 평판은 움직이는 목표이므로 수집은 스크립트가 아닌 일정이어야 합니다. 회사별로 매일 또는 매주 최신순으로 실행하고 리뷰 ID에 따라 업서트하여 새로운 리뷰는 추가되고 기존 리뷰는 제자리에 업데이트됩니다. 이는 Trustpilot의 회사별 깊이 한계를 피하는 방법입니다 — 리뷰가 도착할 때마다 포착하면 깊이 탐색이 필요하지 않습니다 — 그리고 데이터를 가치 있게 만드는 시계열을 제공합니다: 평점 추세선, 나쁜 주 후 불만 급증, 응답률 변화. 간단한 경고 (주간 평점이 절반 이상 떨어지거나 별점 1개 리뷰 급증)를 추가하면 파이프라인은 연구 도구에서 평판과 경쟁업체에 대한 조기 경고 시스템으로 변합니다.

신선도에는 비용이 따릅니다. 매일 모든 회사를 다시 가져오면 대부분 변하지 않은 데이터에 대역폭과 IP를 소모합니다. 모니터링 작업처럼 계층화하세요: 자신의 브랜드와 상위 몇 개의 경쟁업체를 면밀히 관찰하고 긴 꼬리를 주간 또는 월간으로 스윕하세요. 리뷰 볼륨이 실제로 움직이는 회사에 크롤링을 가중하면 데이터가 최신 상태로 유지되고 비용도 합리적입니다.

자주 묻는 질문

Trustpilot 리뷰를 스크랩할 수 있나요?

예 — 회사 리뷰 페이지는 공개되어 있고 페이지네이션되어 있어 각 리뷰의 작성자, 평점, 날짜, 제목, 본문, 국가를 수집할 수 있습니다. 주요 장애물은 Trustpilot의 봇 감지로, 이는 깨끗한 회전 IP가 필요하며, 회사별 깊이 한계로, 이는 최신순으로 정렬하고 스케줄된 패스로 수집하여 깊이 있는 크롤링을 피함으로써 해결합니다.

Trustpilot을 스크랩하는 것이 합법인가요?

공개적으로 보이는 리뷰 페이지를 스크랩하는 것은 일반적으로 다른 공개 데이터 수집과 같은 회색 영역에 속합니다 — 이는 법적 조언이 아닙니다. 공개 페이지에 머물고, 로그인을 우회하려고 시도하지 말고, 요청 속도를 예의 바르게 유지하며 리뷰어의 개인 데이터나 텍스트를 그대로 다시 게시하지 마세요. 집계된 평판 및 경쟁업체 분석의 경우, 파생된 메트릭이 개별 리뷰보다 중요합니다.

Trustpilot의 모든 리뷰를 어떻게 스크랩하나요?

/review/{domain}?page=N을 통해 리뷰가 더 이상 없을 때까지 페이지를 넘기세요, 그러나 Trustpilot은 단일 회사에 대해 제공하는 깊이를 제한합니다. 광범위한 커버리지를 얻으려면 최신순으로 정렬하고 반복적인 스케줄된 실행으로 새로운 리뷰를 시간에 따라 포착하며, 특정 시장의 리뷰가 필요한 경우 해당 지역의 도메인과 일치하는 국가 출구로 접속하세요.

Trustpilot 리뷰를 대규모로 어떻게 분석하나요?

각 리뷰 본문을 감정 분류기에 통과시켜 카테고리 (긍정적, 중립적, 부정적)와 신뢰도 점수를 반환한 다음, 점수화된 기록을 리뷰 ID로 키를 지정하여 저장하세요. 그 후 평점 추세를 차트로 만들고, 불만 테마를 클러스터링하고, 국가 필드로 나누고, 경쟁업체를 벤치마킹할 수 있습니다 — 감정 레이어는 수천 개의 리뷰를 몇 가지 결정으로 전환합니다.

Trustpilot은 당신과 경쟁하는 모든 사람에 대한 고객의 생각을 날짜별, 지리적 위치별, 별점 평가된 피드로 제공합니다. 스크랩은 다섯 단계로 구성됩니다; 가져오기 단계는 깨끗한 지리적 잠금 IP 없이 실패하며, 감정 레이어는 원시 텍스트를 실제로 관리할 수 있는 평판으로 전환합니다.

Scraper API로 Trustpilot 스크랩 시작하기