시장별 스트리밍 카탈로그 연구: 가용성 데이터셋 구축
스트리밍 서비스의 카탈로그는 국경마다 달라집니다. 시장별로 어디에서 무엇이 가능한지 측정하고 이를 라이선스 및 콘텐츠 인텔리전스로 전환하는 방법입니다.
같은 스트리밍 서비스라도 각 나라마다 다른 제품입니다. 라이선스 계약은 시장별로 체결되므로 스페인에서 카탈로그의 주요 타이틀이 독일에서는 없을 수 있고, 일본에는 6개월 후에 도착할 수 있습니다. 콘텐츠 전략에 종사하는 사람들 - 스튜디오, 배급사, 분석가, 인수 팀 - 에게 이러한 시장별 변동은 잡음이 아니라 신호입니다. 이 가이드는 시장별 스트리밍 카탈로그 연구를 다룹니다: 어디에서 무엇이 가능한지 측정하고, 국가 간 비교 가능한 데이터셋을 구축하며, 이를 라이선스 인텔리전스로 전환하는 방법입니다. 먼저 프레임 노트: 이는 시장 조사를 위한 외부에서 공개 카탈로그를 관찰하는 것이며, 자신의 구독 지역을 회피하는 것이 아닙니다.
카탈로그가 실제로 얼마나 다른가
대부분의 사람들이 생각하는 것보다 차이가 큽니다. 공공 라이브러리 추적자들은 2024년 초 슬로바키아의 가장 큰 국가별 넷플릭스 카탈로그가 약 8,000개의 타이틀을 보유하고 있는 반면, 다른 시장은 그 일부만 가지고 있음을 발견했습니다. 미국 라이브러리만 해도 약 3,600개 이상의 영화와 1,800개 이상의 TV 쇼가 있으며, 이는 다른 어떤 나라와도 다른 혼합입니다. 그리고 가용성은 보편적이지 않습니다: 넷플릭스는 중국, 북한 또는 크림반도에서는 전혀 운영되지 않습니다. 모든 제공업체와 모든 타이틀에 대해 이러한 변동을 곱하면 단일 국가 관점으로는 포착할 수 없는 풍부하고 끊임없이 변화하는 데이터셋이 됩니다.

데이터가 존재하는 곳
모든 것을 처음부터 역설계할 필요는 없습니다. 두 개의 중립적인 소스가 많은 작업을 수행합니다. The Movie Database (TMDb)는 깨끗하고 정식의 메타데이터 - 타이틀당 안정적인 id, 출연진, 출시 연도 - 를 제공하여 시장 간 기록을 연결하는 데 매우 유용합니다. JustWatch 스타일의 가용성 집계기는 어떤 제공업체가 어떤 타이틀을 어떤 국가에서 제공하는지를 추적하며, 비공식 넷플릭스 글로벌 검색과 같은 커뮤니티 프로젝트는 오랫동안 지역별 라이브러리를 카탈로그화해 왔습니다. TMDb를 정체성의 중심으로 사용하고, 가용성 피드를 시장별 레이어로 취급하여 그 위에 오버레이하십시오.
시장 내 IP가 필요한 이유
여기 기계적 핵심이 있습니다. 제공업체의 공개 카탈로그와 탐색 페이지는 요청이 어디에서 오는 것처럼 보이는지에 따라 로컬 라이브러리를 렌더링합니다 - 이탈리아의 구독자가 보는 카탈로그를 보려면, 요청이 이탈리아 IP에서 시작되어야 합니다. 단일 관점은 단일 국가의 답변을 제공합니다; 교차 시장 데이터셋을 구축하려면, 각 대상 국가에서 동일한 쿼리를 반복해야 합니다. 200개 이상의 국가를 아우르는 주거용 프록시 풀이 실용적이게 만듭니다 - 실제 국가 내 IP로, 각 시장이 차단되거나 일관성이 없는 것이 아니라 진정한 로컬 보기를 반환합니다. 이는 광고 검증 및 항공료 연구의 동일한 지리적 관점 규율입니다, 답변은 위치에 상대적일 때만 존재합니다.
위치 페이지에서 전체 국가 범위를 탐색하십시오; 프로파일링할 수 있는 시장은 출구가 있는 시장입니다.
import requests
# Fetch a provider's public catalog view as a viewer in each market would
GATE = "gate.quantumproxies.io:8000"
MARKETS = ["us", "gb", "de", "it", "jp", "br"]
def catalog_view(url, country):
# exit country selected in the proxy username -> the local library view
proxy = f"http://USER-country-{country}:PASS@{GATE}"
r = requests.get(url, proxies={"http": proxy, "https": proxy},
headers={"Accept-Language": country}, timeout=25)
return r
by_market = {cc: catalog_view("https://example-provider.com/browse", cc)
for cc in MARKETS}
시장 간 표준화
국가별 원시 풀은 정체성을 조정하기 전까지는 비교할 수 없습니다. 같은 영화가 각 시장에서 다른 로컬 타이틀, 아트워크 및 슬러그를 가지므로, 표시 타이틀로 일치시키면 쓰레기가 됩니다. 모든 것을 정식 id - TMDb id가 이상적입니다 - 에 키를 맞추어, 미국의 "The Godfather: Part II"와 다른 곳의 현지화된 타이틀이 하나의 기록으로 수렴되도록 하십시오. 타이틀이 시장 간 중복 제거되면, 비교는 스스로 작성됩니다: 어떤 국가가 타이틀을 가지고 있는지, 언제 나타났는지, 카탈로그 크기가 어떻게 순위에 있는지, 그리고 어디에 격차가 있는지.
# Build an availability matrix: which markets carry each canonical title
from collections import defaultdict
availability = defaultdict(set) # tmdb_id -> set of country codes
def record(country, titles):
for t in titles:
availability[t["tmdb_id"]].add(country)
# ...after populating from each market's parsed catalog:
def gaps_vs(reference="us"):
# titles present in the reference market but missing elsewhere
return {tid: (all_markets - markets)
for tid, markets in availability.items()
if reference in markets}
all_markets = {"us", "gb", "de", "it", "jp", "br"}

카탈로그를 인텔리전스로 전환하기
데이터셋은 분석에서 그 가치를 발휘합니다. 가용성 창을 추적하여 미국 출시 후 타이틀이 다른 시장에 도달하는 데 걸리는 시간을 확인하십시오 - 라이선스 지연에 대한 직접적인 읽기입니다. 국가별로 카탈로그 크기와 장르 혼합을 벤치마크하여 제공업체가 어디에 투자하는지 이해하십시오. 경쟁자가 가지고 있고 당신이 없는 콘텐츠 격차를 발견하거나 그 반대의 경우도 마찬가지입니다. 특정 타이틀이 몇 주 동안 국경을 넘어가는 것을 지켜보며 거래 구조를 추론하십시오. 전체 풀을 일정에 따라 실행하고, 각 캡처에 타임스탬프를 부여하면, 델타가 라이선스 이동 피드가 됩니다 - 경쟁자 가격 모니터링과 동일한 모니터링 논리를 콘텐츠 권리에 적용한 것입니다.
한 가지 습관이 스냅샷을 모니터로 전환합니다: 풀을 일정에 따라 실행하고, 각 캡처를 이전 것과 비교하여 차이를 확인하십시오. 새로운 추가, 조용한 제거, 시장에서의 타이틀의 첫 등장 모두가 델타로 나타나며, 정적 인벤토리가 아닌 변경 피드를 제공합니다. 모든 캡처를 타임스탬프와 함께 저장하고 정식 id를 안정적으로 유지하면, 과거 어느 날짜에든 시장의 카탈로그를 재구성할 수 있습니다 - 이는 일회성 연구와 라이선스 팀이 실제로 비용을 지불할 지속적인 인텔리전스 제품의 차이입니다.
선을 넘지 마십시오
이것은 지리와 관련이 있으므로 범위에 대해 신중해야 합니다. 여기서의 정당한 사용은 시장 조사로서 공개적으로 표시된 카탈로그 및 가용성 데이터를 측정하는 것이며, 자신의 계정의 지역 권리를 회피하거나 콘텐츠를 재배포하는 것이 아닙니다. 각 서비스의 약관을 존중하고, 공개 카탈로그 메타데이터(타이틀, 가용성, 날짜 - 개인 사용자 데이터가 아님)만 수집하며, 요청을 정중하게 진행하십시오. 이는 정보 제공용이지 법률 자문이 아닙니다; 특정 프로그램이 의문을 제기하면, 확장하기 전에 상담을 받으십시오.
200개 이상의 국가에서 시장 내 주거용 IP를 확보하십시오
자주 묻는 질문
왜 스트리밍 카탈로그는 국가별로 다른가요?
라이선스는 시장별로 협상되고 시간에 따라 창이 나뉘므로, 특정 타이틀의 권리는 국가별로 다르고 변경됩니다. 한 시장에서는 영화가 스트리밍될 수 있고, 다른 시장에서는 이용할 수 없으며, 세 번째 시장에서는 나중에 도착할 수 있습니다. 가용성은 또한 제공업체가 전혀 운영되는지 여부에 따라 달라집니다; 일부 국가는 서비스가 없습니다. 이러한 시장별 변동이 카탈로그 연구가 측정하는 것입니다.
다른 나라의 스트리밍 카탈로그를 어떻게 볼 수 있나요?
연구를 위해, 제공업체의 공개 카탈로그나 탐색 페이지를 대상 국가에 위치한 출구 IP를 통해 요청하여, 로컬 라이브러리가 시장 내 뷰어가 보는 것처럼 렌더링되도록 하십시오. 주거용 프록시 풀을 사용하여 프로파일링하고자 하는 각 국가에서 출구를 통해 쿼리를 반복한 다음, 비교를 위해 결과를 정식 타이틀 id로 표준화하십시오.
카탈로그 연구에 도움이 되는 데이터 소스는 무엇인가요?
TMDb를 사용하여 시장 간 기록을 연결하기 위한 정식 타이틀 메타데이터와 안정적인 id를 얻고, 가용성 집계기(JustWatch 스타일 피드 및 커뮤니티 지역 라이브러리 추적기)를 국가별 레이어로 사용하십시오. TMDb는 정체성을 제공합니다; 가용성 피드는 시장 차원을 제공합니다. 두 가지를 오버레이하여 비교 가능한 교차 시장 데이터셋을 구축하십시오.
스트리밍 카탈로그 연구는 합법적인가요?
시장 분석을 위해 공개적으로 표시된 카탈로그 및 가용성 메타데이터를 수집하는 것은 일반적인 관행이지만, 각 서비스의 약관이 적용되며, 이는 법률 자문이 아닙니다. 공개 카탈로그 데이터에 충실하고, 개인 사용자 정보를 피하며, 자신의 지역 권리를 회피하거나 콘텐츠를 재배포하는 데 사용하지 마십시오, 특정 대규모 프로그램에 대해 상담을 받으십시오.
스트리밍 카탈로그는 이동 중이며, 국경에 따라 달라지는 데이터셋이며, 그 가치는 시장 간의 차이에 정확히 존재합니다. 각 국가를 시장 내 IP에서 프로파일링하고, 타이틀을 하나의 정식 id로 조정하며, 일정에 따라 캡처하면 - 흩어진 지역 라이브러리가 라이선스 인텔리전스 엔진이 됩니다.