按市场划分的流媒体目录研究:构建可用性数据集

流媒体服务的目录在每个边界都会变化。以下是如何按市场衡量各地的可用内容,并将其转化为许可和内容情报。

同一流媒体服务在每个国家都是不同的产品。许可协议是按市场达成的,因此在西班牙目录中占据头条的标题可能在德国缺席,并在六个月后才在日本出现。对于内容策略的参与者——工作室、发行商、分析师、采购团队——这种按市场的变化不是噪音,而是信号。本指南涵盖按市场划分的流媒体目录研究:如何衡量各地的可用内容,构建跨国的可比数据集,并将其转化为许可情报。首先说明一下:这涉及从外部观察公共目录作为市场研究,而不是规避您自己订阅的地区限制。

目录实际差异有多大

差异比大多数人想象的要大得多。公共图书馆追踪者发现最大的国家Netflix目录——斯洛伐克的,在2024年初——大约有8,000个标题,而其他市场的数量只是其一部分。仅美国的图书馆就有大约3,600多部电影和1,800多部电视剧,与其他任何国家的组合都不同。而且可用性并非普遍:Netflix在中国、朝鲜或克里米亚根本没有运营。将这种变化乘以每个提供商和每个标题,您就拥有了一个丰富且不断变化的数据集,单一国家的视角无法捕捉。

统计面板显示流媒体目录大小按国家变化,从约8,000个标题下降,三个国家没有Netflix
目录大小和标题组合在市场之间差异显著——这种差异正是研究所测量的。

数据存储在哪里

您不必从头开始逆向工程。有两个中立来源完成了大量繁重的工作。The Movie Database (TMDb) 提供干净、规范的元数据——每个标题、演员、发行年份的稳定id——这对于跨市场连接记录非常有价值。类似JustWatch的可用性聚合器跟踪哪些提供商在哪些国家提供哪些标题,像非官方Netflix全球搜索这样的社区项目长期以来一直在编目区域图书馆。使用TMDb作为身份的主干,并将可用性信息作为您覆盖的每个市场层。

为什么需要市场内IP

这是机械核心。提供商的公共目录和发现页面根据请求来源地呈现本地图书馆——因此要查看意大利订阅者看到的目录,您的请求必须来自意大利IP。单一视角只能给您一个国家的答案;要构建跨市场数据集,您需要在每个目标国家的出口循环相同的查询。住宅代理池覆盖200多个国家,使这一切成为可能——真正的国家内IP,这样每个市场返回的都是其真实的本地视图,而不是被阻止或不一致的视图。这与广告验证机票研究背后的地理视角原则相同,答案只存在于相对于某个位置。

在我们的位置页面浏览完整的国家覆盖范围;您可以分析的市场是您拥有出口的市场。

import requests

# Fetch a provider's public catalog view as a viewer in each market would
GATE = "gate.quantumproxies.io:8000"
MARKETS = ["us", "gb", "de", "it", "jp", "br"]

def catalog_view(url, country):
    # exit country selected in the proxy username -> the local library view
    proxy = f"http://USER-country-{country}:PASS@{GATE}"
    r = requests.get(url, proxies={"http": proxy, "https": proxy},
                     headers={"Accept-Language": country}, timeout=25)
    return r

by_market = {cc: catalog_view("https://example-provider.com/browse", cc)
             for cc in MARKETS}

跨市场标准化

原始的按国家提取数据在您协调身份之前不可比。相同的电影在每个市场都有不同的本地标题、艺术作品和标识符,因此按显示标题匹配会产生垃圾。将所有内容键入规范id——TMDb id是理想的——这样美国的《教父:第二部》和其他地方的本地化标题就会合并为一个记录。一旦标题在市场之间去重,比较就会自然而然地出现:哪些国家拥有一个标题,何时出现,目录大小排名如何,以及差距在哪里。

# Build an availability matrix: which markets carry each canonical title
from collections import defaultdict

availability = defaultdict(set)   # tmdb_id -> set of country codes

def record(country, titles):
    for t in titles:
        availability[t["tmdb_id"]].add(country)

# ...after populating from each market's parsed catalog:
def gaps_vs(reference="us"):
    # titles present in the reference market but missing elsewhere
    return {tid: (all_markets - markets)
            for tid, markets in availability.items()
            if reference in markets}

all_markets = {"us", "gb", "de", "it", "jp", "br"}
从选择市场到地理定位出口和标题标准化到跨市场可用性比较的管道图
管道是每个市场的循环,然后是规范id上的连接——身份协调使市场具有可比性。

将目录转化为情报

数据集在分析中发挥作用。跟踪可用性窗口以查看标题在美国发布后多长时间到达其他市场——直接反映许可滞后。按国家基准目录大小和类型组合以了解提供商的投资方向。发现竞争对手有而您没有的内容差距,反之亦然。观察特定标题在几周内跨越边界以推断交易结构。按计划运行整个提取,给每次捕获加上时间戳,差异就变成许可变动信息流——与竞争对手价格监控相同的监控逻辑,应用于内容权利。

一个习惯将快照变成监控:安排提取并将每次捕获与上次进行差异比较。新添加的、悄然移除的以及标题首次出现在市场中的所有变化都会作为差异浮现,给您一个变化信息流而不是静态库存。将每次捕获存储带有时间戳并保持规范id稳定,您可以重建任何市场在任何过去日期的目录——这就是一次性研究与许可团队实际愿意为之付费的持续情报产品之间的区别。

保持在界限的正确一侧

因为这涉及地理位置,请慎重考虑范围。这里的合法用途是测量公开显示的目录和可用性数据作为市场研究——而不是规避您自己账户的地区权限或重新分发内容。尊重每个服务的条款,仅收集公共目录元数据(标题、可用性、日期——而不是个人用户数据),并礼貌地安排您的请求。这是信息性建议,而非法律建议;如果特定程序引发问题,请在扩展之前咨询法律顾问。

在200多个国家获取市场内住宅IP

常见问题解答

为什么流媒体目录因国家而异?

许可是按市场协商的,并在时间上分阶段进行,因此每个国家的特定标题的权利不同且会变化。一部电影可能在一个市场流媒体播放,在另一个市场不可用,并在第三个市场稍后到达。可用性还取决于提供商是否在某些国家运营;有些国家没有服务。这种按市场的变化正是目录研究所测量的。

如何查看其他国家的流媒体目录?

为了研究,通过位于目标国家的出口IP请求提供商的公共目录或发现页面,以便本地图书馆呈现为市场内观众所见。使用住宅代理池在您想分析的每个国家的出口中循环查询,然后将结果标准化为规范标题id以进行比较。

哪些数据源有助于目录研究?

使用TMDb获取规范标题元数据和稳定id以跨市场连接记录,以及可用性聚合器(类似JustWatch的信息流和社区区域图书馆追踪器)作为每个国家的层。TMDb为您提供身份;可用性信息流为您提供市场维度。将两者叠加以构建可比的跨市场数据集。

流媒体目录研究合法吗?

收集公开显示的目录和可用性元数据进行市场分析是常见做法,但每个服务的条款适用,这不是法律建议。坚持公共目录数据,避免个人用户信息,不要用它来规避您自己的地区权限或重新分发内容,并为特定的大规模计划咨询法律顾问。

流媒体目录是一个动态的、依赖边界的数据集,其价值正体现在市场之间的差异中。从市场内IP分析每个国家,将标题协调为一个规范id,并按计划捕获——分散的区域图书馆就会成为许可情报引擎。

查看您可以分析的每个国家